網站管理者必做:實作檢查 AI 為何不引用你的頁面與修復順序

為什麼 AI 不引用你的網站:先判斷再修復

AI 不引用你的網站,原因多半歸結為三件事:爬蟲被阻擋、答案藏在正文中段、以及缺乏結構化資料。

先給一個簡短判斷(結論)

如果要先下結論:先檢查「門是否開著」(伺服器日誌與 robots 設定),再修「結構」(段落與結構化資料),最後才改「文字」(把答案前置)。順序不可顛倒。

要做的總流程(九步概要)

步驟以優先順序排列,執行時間為示例(需依讀者環境調整):

  1. 讀伺服器日誌(20 分鐘)
  2. 調整 robots.txt 放行主要 AI 爬蟲(10 分鐘)
  3. 檢查 CDN/資安外掛是否仍擋爬蟲(30 分鐘)
  4. 把最重要文章的第一段改為直接回答(半天)
  5. 拆段與把一段只講一件事(依文章量)
  6. 把關鍵數字與時間寫進句子(內容編輯)
  7. 補上 Article、FAQPage、Organization、BreadcrumbList(一天)
  8. 建立每月抽查表與腳本(30 分鐘)
  9. 每月例行抽查並記錄四個關鍵數字(每月約 10 分鐘)

下面依步驟拆解每一項的「判斷、輸入、輸出、檢查表與例外」。

步驟 1:讀伺服器日誌(判斷)

判斷要點:先確認 AI 爬蟲是否曾經造訪,以及伺服器回應碼。

  • 輸入:伺服器存取日誌(access.log)
  • 操作:搜尋文字串 GPTBot、ClaudeBot、PerplexityBot(或其他 AI 爬蟲名稱)
  • 輸出:各爬蟲的最後回應碼(200、403、404、429 或無紀錄)

檢查表(快速指令示例,需在主機上執行):
– grep 或相同工具找關鍵字(GPTBot、ClaudeBot、PerplexityBot、OAI-SearchBot、ChatGPT-User)
– 記錄各條目的回應碼與時間戳

常見回應碼與該做的事:
– 200:爬蟲抓到,記下抓取頻率與抓到的頁面
– 403:被擋,檢查 CDN 與資安外掛的機器人管理規則
– 404:網址不存在,比對 sitemap 與實際路徑
– 429:被限流,考慮放寬速率或改善回應時間
– 無紀錄:從未造訪,檢查 sitemap 是否提交、內部連結是否導向該頁

例外情況:若網站採用單頁應用(SPA)且內容靠前端渲染,日誌可能顯示已到達空殼頁面(回應體積小)。見後文案例說明。

步驟 2:robots.txt 與要放行的 user-agent(輸入 / 輸出)

判斷要點:不同 AI 使用不同 user-agent,放行一個不等於放行全部。

  • 輸入:目前 robots.txt 內容
  • 操作:在 robots.txt 增加 Allow 規則,列出主要 AI 爬蟲名稱
  • 輸出:隔天回頭讀日誌,回應碼由 403 變成 200

建議放行的 user-agent(示例,請依實際需求更新):
– GPTBot(OpenAI)
– OAI-SearchBot(OpenAI)
– ChatGPT-User(OpenAI,使用者即時讀取)
– ClaudeBot(Anthropic)
– PerplexityBot(Perplexity)
– Google-Extended / Applebot-Extended(部分擴展 AI 功能)

檢查:在修改 robots.txt 後,第二天回到步驟 1 的日誌檢查,確認回應碼。

注意:如果 robots.txt 已放行但日誌仍顯示 403,通常是 CDN 的機器人管理或資安外掛在攔截,需在 CDN/外掛中調整白名單。

步驟 3:把答案寫在前一百個字(內容輸入 / 輸出)

判斷要點:大多數大型語言模型先擷取頁面開頭內容。把結論與關鍵資訊前置。

  • 輸入:現有文章
  • 操作:把「直接回答讀者問題」的句子放到第一段(前 100 字)
  • 輸出:模型更容易以你的句子作為回答的援引來源

提示:第一段要包含至少一個可獨立被引用的句子(下文稱「可被抓走的一句話」)。

可被抓走的一句話需滿足四項:
1. 有主詞(誰做的)
2. 有數字(quantified)
3. 有時間範圍(何時)
4. 不依賴前一段的上下文

範例(改寫示例,非新數據):
– 弱例:「這個做法我們用了很久,效果不錯。」(不可被單獨引用)
– 強例:「二〇二五年我們在六個電商網站測試後,平均第九週看到自然點閱上升。」(可被引用,具體)

操作要點清單:
– 將結論或答案放在第一段
– 在章節開頭小標之後的第一段,寫至少三段這類可被抓走的句子
– 若文章為教學或指引,可在第一段加入「這篇文章直接回答:XXX」類短句

步驟 4:一段只講一件事,段落拆解規則

判斷要點:模型擷取的單位是段落,不是整篇文章;段落內若混三件事會被切碎。

操作規則(簡潔檢查表):
– 每段開頭先寫核心句(段落主題句)
– 段落限定一個主題,長度不宜過長
– 段落可獨立存在,讀者或模型單獨看到也能理解

輸出:段落可被模型完整擷取並在答案中引用。若發現段落常被錯誤引用,回來重寫該段。

步驟 5:把數字寫進句子(格式與範例)

判斷要點:模糊形容詞(如「成效顯著」)無法成為可引用的證據,具體數字才會被抓走。

格式要求:數字需包含單位、時間、對照組(若適用)。

範例句式:
– 「CPA 從 920 元降到 210 元,期間為 2025 年 1–3 月,與同業平均相比下降 65%。」

注意:文章內的數字必須為原始資料沿用或明示為示例 / 需驗證。

步驟 6:補上結構化資料並測試(Article、FAQPage、Organization、BreadcrumbList)

判斷要點:結構化資料把內容翻譯成機器可讀的格式,缺少就無法清楚標示發佈 / 更新日期、FAQ、作者等。

  • 輸入:頁面 HTML 與後端 CMS 設定
  • 操作:加入 Article、FAQPage、Organization、BreadcrumbList(可用 Rank Math 等工具在 WordPress 產生)
  • 輸出:用 Google 的複合式搜尋結果測試工具(Rich Results Test)驗證沒有錯誤

檢查項目:
– Article: datePublished、dateModified、author
– FAQPage: 問答項目與對應文本
– Organization: 組織名稱與聯絡資訊
– BreadcrumbList: 在佈景主題啟用或手動輸出

限制:若不熟 JSON-LD,可先在測試環境產生並驗證,避免生產環境直接上線造成錯誤。

步驟 7:讓別的網站叫出你的名字(外部信任度)

判斷要點:模型會參考某來源在外部被提及的頻率與上下文來判斷可信度。

可執行項目(短清單):
– 在產業媒體投稿並在文中標示完整品牌/站名
– 加入公會或名錄並留下網址
– 在論壇或問答平台回答問題時提供出處連結

期望輸出:品牌或網站在外部被正確提及次數上升,模型在比對資訊時傾向引用有外部提及的來源。

步驟 8:把日期印在頁面上並在結構化資料同步更新

判斷要點:模型在處理時事或時間敏感問題時,會優先選擇近期且有明確发布日期的來源。

作法要點:
– 在文章開頭明顯位置顯示發佈與更新日期(格式:YYYY 年 MM 月 DD 日)
– 在 Article 的 datePublished 與 dateModified 欄位同步更新

注意:不要為了看起來「最近更新」而虛報日期;內容沒變就不要改 dateModified,系統可追溯到內容變動紀錄。

步驟 9:建立每月抽查表與追蹤四個指標

判斷要點:監測應以趨勢為主,單月數字容易被波動誤導。

每月要記的四個數字(同張表一列,一月一列):
1. 爬蟲造訪次數(從日誌撈)
2. 被引用分數(來自每月抽查四個模型的測試表)
3. 模型推薦來源帶進來的工作階段數(流量報表)
4. 該批使用者送出的表單數(轉換)

時序關係(觀察延遲):
– 第一個數字先動
– 第二個數字通常落後 6–8 週
– 第三個數字通常落後約 3 個月
– 第四個數字通常落後約 4 個月

運作示例(抽查腳本):
– 每月 10 號,用相同 12 個問題跑 4 個模型(示例模型:ChatGPT、Gemini、Perplexity、Claude)
– 問題放在試算表 A 欄;模型名稱放在第一列
– 計分規則:若答案出現公司名稱記 1 分;出現網址記 2 分;兩者都沒有記 0 分
– 12 題 × 4 模型 ×(網址/名稱積分)= 最高 96 分

趨勢比單月分數重要。若連續三個月都沒有被引用,就回到步驟 1(讀日誌)。

常見案例速覽(來自實務觀察)

以下為曾觀察到的六個案例類型,摘要可作為檢查對照:

  • 機械零件商:日誌顯示每天多筆 GPTBot 都被 403 擋下,調整資安外掛白名單後,第 9 天模型開始引用產品規格頁
  • 醫美診所:日誌顯示 200,但內容以圖片呈現文字,將圖片文字轉為表格後 4 週被三個模型引用
  • 會計事務所:完全沒有爬蟲足跡,補上 sitemap 並在三個公會名錄登錄後,第 21 天出現首筆爬蟲造訪
  • 電商:爬蟲頻繁但引用落在比價網站,因為比價網站的規格欄比官網完整,補足官網至 14 項規格後 2 個月引用轉回官網
  • 補習班:答案寫在第 900 字,把結論移到第一段後 6 週引用率從 10% 增至 26%
  • 工具機廠:單頁框架導致爬蟲抓到空殼,改為伺服器端輸出後,日誌回應大小從約 2,000 bytes 變為 64,000 bytes

這些案例說明了「門沒開、結構不清、答案不前置」三大類原因如何在真實站點中呈現。

三件不要做(紅線)

  1. 不要在頁面塞白色文字給機器看(這類欺騙行為會被模型辨識並可能降權)。
  2. 不要把同一段答案複製到 20 個頁面(重複段落會讓模型分不清哪一頁是主頁)。
  3. 不要為了衝字數把一段話拆成三段(段落要完整,一段講完一件事)。

檢查清單(快速版)

  • [ ] 伺服器日誌:搜尋主要 AI 爬蟲名稱並記錄回應碼
  • [ ] robots.txt:放行常見 AI user-agent
  • [ ] CDN/資安外掛:確認未攔截 AI 爬蟲
  • [ ] 第一段:包含直接回答與可被引用的一句話
  • [ ] 段落:每段只講一件事
  • [ ] 結構化資料:Article、FAQPage、Organization、BreadcrumbList 完整且測試通過
  • [ ] 頁面:明顯顯示發佈與更新日期,且與結構化資料一致
  • [ ] 每月抽查:固定問題、記錄模型引用與表單轉換

限制與例外(何時此流程不適用)

  • 若沒有伺服器存取權限(無法讀日誌),需與主機管理員合作執行步驟 1
  • 若網站大量採用前端渲染(SPA),需改為伺服器端渲染或讓爬蟲看到預渲染內容
  • 某些敏感領域(如醫療、法律)模型引用行為受更多內容政策影響,僅靠技術優化不一定改變引用策略

真正會回答你問題的 FAQ(本文回答)

Q1:如何確認 GPTBot 是否已抓過我的網站?

A1:在伺服器的 access log 中搜尋 GPTBot(或其他 AI 名稱),記下回應碼與時間。若回應碼為 200,表示抓到;403 表示被擋;404 表示頁面不存在;無紀錄表示從未來訪。

Q2:robots.txt 要放行哪些 user-agent 才夠?

A2:要放行多個常見 AI 爬蟲名稱(例如 GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot 等)。放行一個不等於放行全部,修改後應隔天回到日誌確認爬蟲回應碼變為 200。

Q3:結構化資料需要加哪些標記?

A3:建議至少補上 Article、FAQPage、Organization、BreadcrumbList;Article 要包含 datePublished 與 dateModified,並在頁面上同步顯示更新日期。

Q4:多久會看到被引用的效果?

A4:觀察到的時間不同:爬蟲造訪次數會先改善;被引用可能落後 6–8 週;流量提升約 3 個月;表單轉換約 4 個月。若四項都沒改善,回頭檢查日誌與 robots 設定。

Q5:如果站上一開始就被 403 攔截,我先該做什麼?

A5:先在 CDN 與資安外掛中檢查及調整機器人管理規則(白名單),確保 robots.txt 與 CDN 設定一致,然後再檢查日誌確認被解除封鎖。

自我檢驗樣板(每月例行)

  • 每月 1 號:用同一組 12 個問題問 ChatGPT、Gemini、Perplexity、Claude
  • 記錄每題是否出現公司名稱或網址(得分規則如上)
  • 把四個關鍵數字記到同一張表格,逐月觀察趨勢

下一步(內連入口)

若你要從技術稽核或顧問服務開始檢查,可以使用站內相關入口安排下一步:
– 了解我們的服務項目:預約技術與策略支援(服務項目):服務項目
– 想看更多實務案例:案例總覽(實際案例示例):案例總覽
– 準備要跑抽查或委外支援:AI 決策室介紹(流程支援):AI 決策室
– 若要直接預約檢查或顧問:預約諮詢(填表):預約諮詢


本文資料邊界與建議:請在執行前確認你對伺服器日誌的存取權限,並在修改 robots.txt 或 CDN 設定時先在測試環境驗證。