robots.txt 與 AI 爬蟲規則怎麼設定?封鎖或允許 GPTBot、ClaudeBot 的完整指南

先搞清楚:AI 爬蟲跟一般搜尋爬蟲不一樣
Google 的 Googlebot 爬你的網站是為了排名,你通常希望它來。但 GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended 這類 AI 爬蟲,目的是把你的內容餵進語言模型訓練資料或即時檢索。
這件事有沒有問題,取決於你是誰:
- 如果你是媒體、電商、或靠原創內容賺錢的站,被 AI 爬走之後「你的答案」直接出現在 ChatGPT 裡,流量就不一定還會回來。
- 如果你希望 AI 引擎能夠正確引用你的品牌,那全擋掉反而不利於你的品牌知識庫曝光。
所以「要不要封鎖 AI 爬蟲」沒有標準答案,但你必須主動設定,讓自己有得選。
事前準備
開始之前你需要:
- 可以編輯網站根目錄的權限(或後台能修改 robots.txt 的介面)
- 清楚知道自己的目標:封鎖訓練、允許引用、還是全部放行?
- 一份目前爬蟲清單(下面會列給你)
如果你用的是 WordPress,可以透過 Yoast SEO 或 Rank Math 的工具直接編輯 robots.txt,不用動 FTP。
步驟一:找到你的 robots.txt 並備份
你的 robots.txt 位置固定在:
https://yourdomain.com/robots.txt
打開瀏覽器直接輸入,確認目前裡面有什麼。如果是空白或 404,代表你現在沒有設定,所有爬蟲預設都能進來。
備份現有內容,準備修改。
步驟二:確認你想管的 AI 爬蟲名稱
robots.txt 是靠 User-agent 名稱辨識的,打錯就沒效。以下是 2026 年主要的 AI 相關爬蟲:
| 爬蟲名稱 | 來源 | 用途 |
|---|---|---|
| GPTBot | OpenAI | 模型訓練 |
| ChatGPT-User | OpenAI | 即時瀏覽(ChatGPT) |
| Google-Extended | Bard / Gemini 訓練 | |
| ClaudeBot | Anthropic | 模型訓練 |
| anthropic-ai | Anthropic | 網頁爬取 |
| PerplexityBot | Perplexity AI | 即時搜尋引用 |
| Amazonbot | Amazon | Alexa / AI 摘要 |
| Meta-ExternalAgent | Meta | AI 訓練 |
注意:GPTBot 跟 ChatGPT-User 是兩個不同的爬蟲,前者爬訓練資料、後者是使用者開啟網頁瀏覽功能時才會出現。你可以分開設定。
步驟三:決定你的策略,選一個寫法
策略 A:全部封鎖 AI 爬蟲,保留搜尋引擎
如果你的網站靠原創內容經營,不想讓任何 AI 爬走,這樣寫:
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: *
Allow: /
策略 B:允許引用型爬蟲、封鎖訓練型爬蟲
假設你希望 Perplexity 可以引用你的文章帶流量進來,但不想讓 OpenAI 拿去訓練模型:
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Allow: /
User-agent: *
Allow: /
策略 C:全部放行
如果你的商業模式就是靠 AI 引用建立品牌知名度,那什麼都不用加,或明確寫:
User-agent: *
Allow: /
步驟四:上傳並驗證設定有沒有生效
改好之後,有幾種方式確認:
- 直接瀏覽器打開
yourdomain.com/robots.txt,確認內容正確。 - Google Search Console → robots.txt 測試工具:可以測試特定 User-agent 看到的結果。
- 第三方工具:用 robots.txt Checker 或類似服務驗證語法。
語法錯誤(例如少了換行、多了空格)會讓整份檔案失效,所以驗證這步不能跳過。
步驟五:搭配 meta robots 標籤做雙層防護
robots.txt 告訴爬蟲「不要進這個目錄」,但如果你想針對單一頁面控制,還可以在 HTML <head> 加上:
<meta name="robots" content="noai, noimageai">
noai 是 2024 年後部分爬蟲開始支援的標籤,告訴 AI 不要把這個頁面內容用於訓練。目前 OpenAI 文件中有提到支援,但並非所有爬蟲都遵守。
這兩層加起來才比較完整。
常見錯誤與怎麼避開
錯誤一:以為封鎖 Googlebot 就擋掉 Google AI
Googlebot 跟 Google-Extended 是兩個不同的 agent。你封鎖 Googlebot 會讓你的 SEO 消失;你要封鎖的是 Google-Extended。
錯誤二:robots.txt 放錯位置
只有根目錄的 /robots.txt 有效。放在子目錄(例如 /blog/robots.txt)對爬蟲完全沒意義。
錯誤三:以為封鎖就一定有效
robots.txt 是「君子協定」,正規爬蟲會遵守,但惡意爬蟲不一定。如果你的內容是真的機密,robots.txt 不夠,要搭配 IP 封鎖或登入牆。
錯誤四:設定完就忘了
AI 爬蟲名稱會增加。現在有些新進的 AI 公司還沒被廣泛整理出來,建議每半年回來檢查一次主流清單。
完成後的檢查點與下一步
做完這幾步,你應該已經:
- 確認 robots.txt 存在且語法正確
- 針對你的策略設定了主要 AI 爬蟲規則
- 用工具驗證過生效
- 視需要加上 meta robots noai 標籤
下一步建議:
如果你希望 AI 引擎能夠正確理解你的品牌,光是設定 robots.txt 不夠——你還需要思考網站的內部連結架構是否清楚,以及 AI 爬蟲爬到你的網站時,能不能順著結構讀懂你是誰、賣什麼、為什麼值得引用。
另外,如果你有在追蹤流量,可以在 GA4 的流量報告裡觀察爬蟲帶來的 referral 流量有沒有變化,來判斷設定是否有影響。
robots.txt 不是一次設定就結束的事,它是你跟 AI 爬蟲的邊界聲明——你定期更新,它才繼續有效。
常見問題
robots.txt 封鎖 AI 爬蟲之後,AI 工具還是能看到我的內容嗎?
robots.txt 是「君子協定」,正規爬蟲如 GPTBot、ClaudeBot 會遵守,但過去已被爬取並進入訓練資料集的內容無法被刪除。封鎖只能阻止未來的爬取,無法消除歷史紀錄。如果你希望模型移除已有的資料,需要透過各平台的內容移除申請機制另外處理。
GPTBot 和 ChatGPT-User 有什麼差別,要分開設定嗎?
GPTBot 是 OpenAI 用來抓訓練資料的爬蟲;ChatGPT-User 則是使用者在 ChatGPT 介面開啟網頁瀏覽功能時觸發的爬蟲。如果你只想阻止訓練但允許即時引用,可以只封鎖 GPTBot、放行 ChatGPT-User,兩者是獨立設定的。
封鎖 AI 爬蟲會不會影響我的 Google SEO 排名?
不會,前提是你只封鎖 AI 爬蟲(如 Google-Extended),而不是 Googlebot。Google-Extended 和 Googlebot 是兩個不同的 User-agent,分開設定即可在不影響 SEO 的前提下阻止 Google AI 的訓練爬取。
如果我的網站用 WordPress,怎麼編輯 robots.txt?
可以透過 Yoast SEO 或 Rank Math 外掛的「工具 → robots.txt 編輯器」直接修改,不需要用 FTP 進入伺服器。修改後記得存檔,並用瀏覽器直接開啟 yourdomain.com/robots.txt 確認內容是否已更新。
有沒有辦法同時允許某些頁面被 AI 爬、其他頁面不被爬?
可以。robots.txt 支援針對特定路徑設定 Allow 和 Disallow。例如你可以讓 GPTBot 只能爬 /about/ 和 /blog/ 的公開介紹,同時封鎖 /products/ 的商品資料。路徑設定愈精確,控制力愈強。
分享這篇



