想讓 AI 搜尋找到網站,第一步可以很具體:確認你希望公開的頁面,有沒有被抓取規則擋住。但「搜尋用的抓取」「模型訓練」「使用者請 AI 開啟網頁」是不同用途,不能只用一個「允許 AI」開關概括。

這篇的學習目標:為一個公開頁面完成三筆搜尋爬蟲檢查紀錄,說明規則允許什麼,以及哪些結果仍然未知。 適合有官網的工作室、小店與網站維護者。只要瀏覽器和公開網址,不必購買 API 或 GEO 工具;查看回應標頭時會用到瀏覽器開發者工具。

這是 GEO 實作入門的存取檢查。若還不熟悉名詞,可先看AEO、GEO 與 SEO 的差異。本文不需要更改正式站設定;先看懂,再決定是否請維護者處理。

先分清三種用途

搜尋抓取: OpenAI 的 OAI-SearchBot 用於 ChatGPT 搜尋。GPTBot 則用於蒐集可能投入基礎模型訓練的內容;兩者設定可分開管理。允許前者,不代表一定要允許後者。OpenAI 爬蟲文件

使用者觸發: ChatGPT-User 可能在使用者提問時造訪網頁,並非自動巡覽整個網路的爬蟲。OpenAI 說明,這類使用者發起的動作可能不適用 robots.txt;它也不是管理 ChatGPT 搜尋收錄的開關。

PerplexityBot 用於 Perplexity 搜尋呈現與連結,官方說明它不是用來抓取基礎模型訓練資料。Perplexity-User 則處理使用者觸發的網頁存取,官方說明這類請求通常忽略 robots.txt。不要把兩者合成同一項判斷。Perplexity 爬蟲文件

本篇練習先檢查 Googlebot、OAI-SearchBot、PerplexityBot 三種搜尋用途;訓練與使用者觸發的存取另外記錄,不用搜尋檢查的結果替它們下結論。

Google-Extended 不是 Google AI 搜尋的總開關

Google Search 的抓取控制使用 Googlebot,也涵蓋搜尋中的 AI 功能。Google-Extended 是另一個用途控制標記,管理特定 Gemini 訓練與 grounding,也就是回答時利用來源資料作為依據;它不影響網站是否進入 Google Search,也不是搜尋排名訊號。

Google-Extended 沒有獨立的 HTTP User-Agent。因此,不能因為伺服器紀錄裡找不到這個名稱,就斷言相關內容從未被使用。Google 爬蟲與用途說明

Google 的 AI Overviews、AI Mode 仍要求頁面已收錄且符合搜尋摘要呈現資格;允許 Googlebot 只是其中一個條件。Google AI 搜尋功能說明

免費操作:用一個公開網址做五步檢查

先選一個不用登入、沒有私人資料的服務頁或文章。準備空白筆記,記下完整網址與今天日期。

  1. 開啟該網站根目錄的 robots.txt。例如要看 https://kemai-ai.com/blog/what-is-aeo,就開啟 https://kemai-ai.com/robots.txt。保留實際的協定與主機名稱;有 www、子網域或不同連接埠時,規則範圍可能不同。
  2. 在檔案搜尋 Googlebot、OAI-SearchBot、PerplexityBot,再查看 User-agent: *。把名稱與其後的 Allow、Disallow 規則一起抄下來。沒有專屬名稱不等於被擋住,仍須看通用群組;不要只截取一行 Allow。
  3. 對照目標網址的路徑。Disallow: /blog/ 與 Disallow: / 影響不同;若有專屬群組、相互衝突或萬用字元,先標記「待核對」,依該平台規則確認,不憑第一眼猜。Google 會選最符合的使用者代理群組,再以較具體的路徑規則判斷,不能把所有群組任意疊在一起。
  4. 用瀏覽器開啟目標頁面,確認讀得到內容。桌面 Chrome 可開啟開發者工具的 Network(網路),重新整理後選主文件請求,查看狀態碼與 Response Headers(回應標頭);另在頁面原始碼搜尋 robots、googlebot、noindex。狀態碼 200 只代表這次請求成功,若回傳的是驗證畫面,也要另行記錄。
  5. 為三種搜尋爬蟲各寫一筆結果:網址、機器人與用途、對應規則、普通瀏覽器存取結果、尚未確認項目、下一步。規則允許時,結論寫「未見 robots.txt 阻擋」,不要寫成「AI 已收錄」。

有些限制放在 X-Robots-Tag 回應標頭,單看頁面原始碼可能漏掉。若不熟悉開發者工具,把這欄標為「未檢查」,交給維護者確認即可,不要為了填滿表格猜答案。

規則語法與群組範圍可核對Google robots.txt 規格。這份文件描述 Google 的解讀;其他平台另看各自文件。

實測範例:客脈公開頁面看到了什麼

2026-09-12,我們用一般公開 HTTP 請求讀取客脈的 robots.txt,回應為 200、純文字。當時檔案只有一組 User-Agent: *,Allow 為 /,Disallow 為 /admin 與 /thanks,並列出 sitemap 網址。這裡列的是觀察到的設定,不是要讀者直接貼上的設定範本。

接著讀取三個公開頁面:首頁AEO 入門文章牧石案例。三頁均回應 200,HTML 的 robots 為 index, follow;另有 googlebot 專用標記,未含 noindex。本次回應也未帶 X-Robots-Tag。

以 AEO 文章為練習對象,可以記成以下三筆:

  • Googlebot/Google 搜尋: 目標路徑是 /blog/what-is-aeo;當次通用規則未禁止此路徑。普通 HTTP 請求成功;Googlebot 是否實際取得新內容,這次未驗證。
  • OAI-SearchBot/ChatGPT 搜尋: 未見此機器人的專屬禁止群組,通用規則也未禁止目標路徑。這次未驗證 OpenAI 端的實際抓取或搜尋引用。
  • PerplexityBot/Perplexity 搜尋: 未見專屬禁止群組,通用規則未禁止目標路徑。這次未驗證 Perplexity 端的實際抓取或搜尋引用。

實測只涵蓋公開檔案、一般 HTTP 回應與 HTML 標記。 我們沒有使用真正來自上述平台的機器人發出請求,也沒有在本次測試詢問 ChatGPT、Perplexity 或 Google AI 搜尋。這些紀錄不能證明防火牆會放行官方爬蟲,更不能證明文章已被引用。

若網站之後改版或修改規則,讀者看到的結果可能不同;請以自己的檢查日期保存紀錄。

有允許規則,仍然抓不到時

robots.txt 是公開的抓取指引,不是帳號權限或防火牆。頁面也可能受登入、驗證挑戰、主機錯誤或其他存取限制影響。先把「規則如何寫」與「實際請求收到什麼」分開查。

OpenAI、Perplexity 的官方文件列有機器人 IP 資料;若維護者確認是防火牆誤擋,應核對當時的官方來源與請求紀錄,再決定調整方式。只把請求名稱改成某個機器人,不能證明來自該平台,也不應據此放行所有同名請求。

如果希望私人檔案只能讓特定人閱讀,應使用登入與存取權限。只寫 Disallow 並不能保密;在 Google,禁止抓取的網址仍有可能因其他連結被發現。noindex 也不是密碼保護。robots.txt 的限制

常見錯誤:把不同進度寫成同一件事

  • 封鎖 GPTBot,就以為 ChatGPT 搜尋也被封鎖: 訓練與搜尋用途要分開核對。
  • 允許 Google-Extended,就認為 AI Overviews 會引用: Google 搜尋資格與呈現另有條件。
  • 瀏覽器能開,就寫成所有 AI 都能讀: 一般訪客與官方爬蟲的請求來源、處理方式可能不同。
  • 一個頁面通過,就宣稱整站完成 GEO: 本次結論只適用已檢查的網址、設定與時間。
  • 今天改規則,今天沒被引用,就再改一次: 平台需要時間重新取得與處理設定;引用還受到內容與問題等因素影響。

「可存取、已抓取、已收錄、被提及、附有引用、帶來點擊、收到有效詢價」應分開記錄。這篇完成的是前段檢查,後續可接著做搜尋收錄與詢價的六步診斷

自己做一次:交出三筆可核對的紀錄

選自己的一個公開頁面,照五個步驟完成三筆搜尋爬蟲紀錄。每筆都保留原始網址、日期、對應規則、存取證據與未知項目,再寫出一個下一步:不需修改、請維護者核對,或補做平台內的搜尋觀察。

驗收時,請另一個人只看你的紀錄,就能找到相同檔案與頁面,知道哪些是觀察結果、哪些只是依官方文件做的判讀。即使某欄是未知,只要說明缺少什麼證據,仍是一份可用的紀錄。

本練習使用瀏覽器與公開文件,不需要付費模型、API 額度或掃描服務。主機紀錄、防火牆功能是否可用取決於原有方案;若後續工具要求升級,先確認必要性與費用。本篇不要求購買或改變帳號設定。

接續練習可參考Microaudit 健檢與誤判判讀,把不同工具的發現也整理成有證據的待辦。

查核日期:2026-09-12。平台用途與規則依文中連結的官方文件整理;客脈公開頁面的檢查範圍如實測段落所述。本文由 AI 輔助整理與撰寫,未進行 AI 搜尋答案引用測試,也未宣稱排名或詢價成效。