首頁 / 技術文章 / 付費內容如何對 AI 爬蟲開放:存取、用途與收費的決策矩陣
技術文章
付費內容如何對 AI 爬蟲開放:存取、用途與收費的決策矩陣
付費內容面對 AI 爬蟲,應以伺服器端控制能否取得,以偏好信號或協議處理用途,再獨立決定是否收費。robots.txt 不能代替付費牆;允許搜尋、拒絕訓練的意願,也不能直接當成已落實的用途限制。
對 AI 開放,應拆成不同的決定
出版者真正需要回答的是:哪些內容可以送出、取得者可以如何使用,以及交換條件是免費還是付費。本站建議把它們分成存取、用途與收費來處理。這是依各機制職責整理的決策架構,並非任何標準的正式分類;它的價值在於指出,一個設定究竟保護了什麼。
例如,出版者可以考慮公開摘要、保留付費全文,另對特定業者洽談授權。這些選擇並不互斥。相反地,即使網站表明不准用於訓練,若仍向任何請求送出全文,就不應把那項聲明視為存取防護。決策時應先分清楚意願、技術限制與商業條件。
決策矩陣:每個機制能控制到哪裡
矩陣中的強制執行,指網站能否在技術上拒絕交付內容,或阻止某種使用。這與對方是否願意遵守聲明、是否承擔契約義務,是不同問題。已有標準,不代表能強制;能在伺服器攔截,也不代表能控制內容交付後的所有用途。
| 決定 | 對應機制 | 能否強制執行 | 標準化狀態 | 尚待確認的部分 |
|---|---|---|---|---|
| 存取:能不能取得 | 伺服器端存取控制;robots.txt 補充爬取請求 | 伺服器可拒絕交付;robots.txt 本身不能阻擋 | robots.txt 的 RFC 9309 為 Proposed Standard;它不是付費牆規範 | 網站是否確實在送出全文前檢查權限,須逐站確認 |
| 用途:取得後能做什麼 | aipref 規劃中的偏好信號,或個別用途約定;robots.txt 不等於用途授權 | 偏好信號不能直接阻止後續使用;契約效果須另行判斷 | aipref 工作組為 Active,章程中的偏好詞彙標準尚待交付 | 最終用途分類、語法、完成時程及採用情況 |
| 收費:要不要付錢 | Cloudflare Pay per crawl,或個別授權 | 收費與拒絕交付能否連動,依廠商或網站實作而定 | Pay per crawl 為廠商私有機制;個別授權依協議 | 計價、可用範圍、實際付費爬蟲及營收成效 |
這張表應用來檢查缺口。例如,只填了 robots.txt 的網站,表達了爬取意願,卻未必建立存取門檻;啟用收費方案的網站,仍需另外決定付款者能否將內容用於模型開發。每一列都應有自己的決策與驗證方式,不能由另一列的設定代答。
存取層:robots.txt 有規範,但不是門鎖
RFC 9309 定義 Robots Exclusion Protocol,屬於 IETF 標準軌文件,狀態為 Proposed Standard。它讓服務擁有者表達爬蟲可以如何存取內容,或是否可以存取;其中的規則是請求爬蟲遵守,而不是存取授權。
因此,對付費站的技術判斷很直接:若目標是讓沒有權限的客戶端拿不到全文,檢查就必須發生在伺服器交付內容之前。登入、權杖或 bot 管理可以是設計的一部分,但重點是實際拒絕未授權的請求,而非僅在 robots.txt 寫下 Disallow。
尤其應檢查付費牆是否只改變畫面。如果伺服器已送出全文,前端才用 JavaScript 遮罩隱藏,爬蟲就可能讀到內容;是否存在這個問題,必須依個別網站實作確認。工程驗收宜以未登入請求實際收到什麼為準,不能只看瀏覽器是否顯示訂閱提示。
存取控制也有邊界。它適合回答這次請求是否交付全文,不能單靠同一道門保證已取得內容的對象往後如何使用。這正是用途需要獨立處理的原因:把未授權請求擋住,與管理授權後的使用,應列為不同責任。
用途層:aipref 正在制定,偏好不等於使用保證
IETF AI Preferences(aipref)工作組章程將 AI 模型開發、部署與使用所涉及的內容蒐集、處理偏好列為工作範圍。規劃包括透過內容 metadata 或傳遞內容的通訊協定附加偏好,並交付不依附特定附加方式的偏好詞彙標準。
工作組頁面列為 Active,但章程描述的是待交付工作,不能當成已完成的通用標準。依這些資料,尚不能把允許 AI 搜尋、禁止模型訓練寫成已有定案語法的設定教學;最終是否區分搜尋索引、即時檢索與訓練,以及何時完成,仍待確認。
在設計上,用途偏好的價值是讓意願更容易被表達與理解。但即使未來詞彙統一,仍不宜推論內容提供者因此獲得技術上的遠端控制權。標準化可以處理表達方式;接收者是否遵守,以及違反約定後如何處理,還需要其他證據與安排。
同樣地,分別設定不同爬蟲,也不應直接推論成用途隔離已獲保證。實務上應逐一核對業者對爬蟲用途的說明,再確認網站的存取設定。相關設定取捨可延伸閱讀搜尋與訓練爬取分開處理的限制;名稱或設定檔本身,都不足以證明交付後的使用情況。
收費層:Pay per crawl 提供選項,營收仍須驗證
Cloudflare 推出的 Pay per crawl,定位是讓內容創作者向 AI 爬蟲收取存取費用。官方提出的選項包括封鎖 AI 爬蟲、免費允許部分或全部爬蟲,以及收費存取。這是廠商提供的產品機制,並非通用的網際網路收費標準。
對出版者而言,這個選項的意義是讓存取可以附帶交易條件。但有收費入口,不等於已有付費需求,也不能据此估算收入。目前可據以討論的是產品定位;計價方式、可用範圍與實際付費情況仍缺乏足夠資料,不宜拿來推導導入後的回報。
若採個別授權,建議把交付哪些內容、准許哪些用途、如何計費分別寫清楚。尤其不能從付了存取費,就推論取得所有用途的授權。收費方案的評估也應同時看技術條件與商業條件:是否真的能攔下未付款請求,以及付款後的權利範圍是否明確。
公開摘要、llms.txt 與訂閱者代理的界線
對希望保留 AI 搜尋曝光的付費站,本站建議先評估公開摘要是否足以清楚呈現主題、核心發現與原始出處,再決定是否需要交付全文。這是內容策略建議,並非引用或訂閱成效的保證。現有來源沒有量化資料,能證明開放付費全文必然帶來流量或訂閱。
llms.txt 提案的目的是提供資訊,協助 agent 使用網站,而非限制存取。因此不應把它當成付費內容的保護機制。若選擇採用,應另行檢查其指向的內容是否適合公開;假如付費全文被放進無須授權即可取得的檔案,原頁面的付費牆就無法替那份副本把關。
另一個尚未釐清的情境,是 AI agent 代表已登入的訂閱者閱讀內容。現有來源不足以判定它是否應被當作爬蟲,以及 robots.txt 或 aipref 偏好如何適用。產品團隊宜把訂閱者委託代理操作的權限另列政策議題,可參考網站如何界定代理存取權限,避免直接套用未登入爬蟲的處理方式。
付費站較穩健的起點,是先驗證未授權請求拿不到付費全文,再決定公開內容足以支援哪些搜尋需求,最後評估用途約定與收費方案。後續應追蹤 aipref 的實際交付、收費方案的可用條件,以及公開內容帶來的訂閱效果。任何一項設定,都不應被當成其他層已受到保護的證據。
常見問題
在 robots.txt 寫 Disallow,能保護付費全文嗎?
不能單靠它保護。依 RFC 9309,robots.txt 規則是請求爬蟲遵守,不是存取授權。若要阻止未授權取得全文,應在伺服器交付內容前檢查權限。
能否統一宣告允許 AI 搜尋、禁止模型訓練?
目前不能依所引章程,把它視為已有定案通用語法的功能。aipref 工作組正在制定偏好詞彙,最終用途分類仍待確認;表達偏好也不等於能技術上阻止後續使用。
啟用 Pay per crawl 就能向所有 AI 爬蟲收費嗎?
Cloudflare 的產品定位是讓創作者向 AI 爬蟲收取存取費用,但現有資料不足以確認涵蓋哪些爬蟲、可用範圍或實際付款情況,不能推論所有爬蟲都會付費。
付費站一定要開放全文,才能經營 AEO 或 GEO 嗎?
不宜把開放全文當成預設前提。建議先改善公開摘要與原始出處的表達,再評估全文授權;現有來源沒有證明開放全文必然提升引用、流量或訂閱。