跳到主要內容
2026-08-22 日報
開發生態

Cloudflare 推出 Bot Preference Sync,自動將 AI 爬蟲攔截設定同步寫入 robots.txt

Cloudflare Blog一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Cloudflare 宣布推出 Bot Preference Sync 功能,自動將用戶在儀表板設定的 AI 爬蟲管理規則同步寫入網站的 robots.txt 檔案中。 該功能涵蓋從免費版(Free)到企業版(Enterprise)的所有用戶。若網站已有 robots.txt,系統會將新規則附加於現有內容前方,保留原有的 Disallow 指令,確保網站對外的宣告與 Cloudflare 邊緣節點的實際攔截動作保持一致。 Cloudflare 曾於 2026 年 7 月 1 日推出針對搜尋(Search)、代理(Agent)與訓練(Training)三類 AI 流量的控制選項。目前搜尋與代理維持「允許」、「在有廣告的頁面封鎖」或「全面封鎖」三個選項;訓練流量則可設定為「不允許(Disallow)」,系統會將拒絕訓練的偏好寫入 robots.txt。 針對同時具備搜尋與訓練功能的「混合型爬蟲」,Cloudflare 提出透明度要求。若這類爬蟲希望在網站設定「不允許訓練」時仍不被全面封鎖,必須滿足四項條件:遵守 robots.txt 的拒絕訓練指令、提供退出 AI 摘要的機制、提供 URL 級別的訓練與搜尋使用數據,並公開證明拒絕訓練不會影響傳統搜尋排名。 符合標準的 AI 爬蟲將被記錄於 Cloudflare Radar 的 AI 爬蟲透明度專區;未提供透明度的爬蟲在面臨拒絕訓練設定時,將直接遭到封鎖。
讀原始報導

背景

robots.txt 是於 1994 年建立的標準協定,網站可透過它來指示網路爬蟲允許存取的範圍,但這項機制僅仰賴爬蟲的自願遵守。過去網站管理者常面臨 robots.txt 宣告與實際阻擋規則不一致的問題,導致部分爬蟲藉此忽視網站偏好或嘗試繞過安全限制。

來源