GEO 生成式引擎最佳化九個檢查點示意圖,冠誠數位行銷製作

AI 為什麼不引用你的網站:九個可以馬上檢查的位置

去年冬天,我把一篇排在 Google 第三名的文章丟給 ChatGPT,問了同樣一個問題。它引用三個網站,沒有我們。

我沒有動文章。我先打開伺服器日誌,用 grep 找 GPTBot。那一行後面接著 403。

門是鎖的。裡面寫什麼都沒有用。

AI 不引用你的網站,多數時候是三個原因:爬蟲被防火牆擋下、答案寫在文章中段、頁面沒有結構化資料。先開門,再修結構,最後才改字。

一、先讀伺服器日誌,不要先改字

打開主機的存取日誌,搜尋 GPTBot、ClaudeBot、PerplexityBot 這三個字串。看回應碼。

200 代表抓到了。403 代表被擋。404 代表網址已經不存在。空白代表它從來沒有來過。

我看過六個網站的日誌。四個是 403。擋下它們的是資安外掛的預設規則,不是站長的決定。

二、robots.txt 要放行哪幾個名字

每一家 AI 用不同的爬蟲名字。放行一個不等於放行全部。下面這張表是目前主要的幾個。

爬蟲名稱來自抓取用途
GPTBotOpenAI訓練與檢索
OAI-SearchBotOpenAIChatGPT 搜尋結果
ChatGPT-UserOpenAI使用者當下要求的即時讀取
ClaudeBotAnthropic訓練與檢索
PerplexityBotPerplexity答案引用
Google-ExtendedGoogleGemini 與 AI 總覽
Applebot-ExtendedAppleApple 智慧功能
主要 AI 爬蟲名稱對照表。放行一個不等於放行全部。

在 robots.txt 寫下 User-agent 名稱,後面接 Allow 斜線。改完之後,隔天再回頭讀一次日誌,確認回應碼變成 200。

三、答案寫在前一百個字

模型讀一個頁面,會先讀開頭。把結論放在第一段,不要放在第五段。

這篇文章的第一段寫的是 403,不是「數位轉型的浪潮」。你現在還在讀,就是因為第一段給了東西。

四、一段只講一件事

模型擷取的單位是段落,不是文章。一段講三件事,三件事都會被切碎。

寫完一段,回頭問自己一句話:把這一段單獨貼出去,它還能成立嗎。不能成立就拆開。

五、把數字寫進句子裡

「成效顯著」不會被引用。「CPA 從 920 元降到 210 元」會被引用。

數字要帶單位、帶時間、帶對照。三個都有,才是一個可以被抄走的句子。

六、補上結構化資料

頁面上加 Article、FAQPage、Organization、BreadcrumbList 這四種標記。這是把內容翻譯成機器讀得懂的格式。

WordPress 用 Rank Math 可以直接產生前三種。麵包屑要在佈景主題開啟。做完之後用 Google 複合式搜尋結果測試工具跑一次,看有沒有紅字。

七、讓別的網站叫出你的名字

模型判斷一個來源可不可信,會看它在別處被提到幾次。

去產業媒體投稿。去公會名單登錄。去論壇回答問題並留下品牌全名。名字被打出來的次數,決定你在模型眼中的份量。

八、把日期印在頁面上

發布日期與更新日期要顯示在文章開頭,也要寫進 Article 標記的 datePublished 與 dateModified。

模型回答時事問題時,會挑近期的來源。一篇沒有日期的文章,等於自願退出這一輪。

九、每個月抽查一次

挑五個核心問題,每月一號分別問 ChatGPT、Gemini、Perplexity 一次。把它引用的網址抄進表格。

連續三個月都沒有你,就回到第一步重讀日誌。這件事不會自己好起來。

先做哪一件

  1. 讀日誌,確認回應碼。這一步花二十分鐘。
  2. 改 robots.txt,放行七個爬蟲名稱。這一步花十分鐘。
  3. 把最重要的十篇文章的第一段改寫成直接回答。這一步花一個下午。
  4. 補上四種結構化資料。這一步花一天。
  5. 建立每月抽查表。這一步花半小時,然後每個月花十分鐘。

順序不要顛倒。門沒開之前,改字沒有意義。

四個模型的抽查腳本

每月十號,我用同一組十二個問題跑四個模型。問題寫在試算表的 A 欄,模型名稱寫在第一列。

問題要像客戶會打的句子。台中哪裡可以做企業內訓、SEO 一個月大概多少錢、GA4 跟 Search Console 的數字為什麼對不起來。不要打公司名稱,那是作弊。

答案裡出現公司名稱記一分,出現網址記兩分,兩者都沒有記零分。十二題乘四個模型,滿分九十六。我們第一次跑得到十一分,第六個月得到四十三分。

分數寫在同一張表的最下面一列。表格不換檔案,一年十二列。趨勢比單月分數有用。

被引用之後,流量會從哪裡進來

打開流量報表,看推薦來源。網域裡有模型服務名稱的那幾列,就是被引用帶進來的人。

這批人的行為和搜尋進來的人不同。停留時間長兩倍,但跳出率也高。他們是來確認答案的,不是來逛的。

要接住他們,頁面上要有一個明確的下一步。我們在每篇文章的第一屏下方放一行預約諮詢,這一行帶來的表單佔全站的一成四。

三件不要做的事

不要在頁面裡塞白色文字給機器看。模型讀得到,也讀得出你在做什麼,這種頁面會被降權。

不要把同一段答案複製到二十個頁面。重複段落會讓模型分不清哪一頁是主頁,兩頁一起消失。

不要為了衝字數把一段話拆成三段。段落要完整,一段講完一件事。字數不是分數,答得準才是。

六個網站的日誌長什麼樣

第一個網站是機械零件商。日誌裡每天有四十七筆 GPTBot,全部回 403。防火牆外掛的預設清單把它歸類成惡意爬蟲。改成放行之後第九天,模型開始引用產品規格頁。

第二個是醫美診所。日誌乾淨,回應碼全是 200,但模型從來不引用。原因是整站的療程說明放在圖片裡。把圖片上的文字打成表格,四週後出現在三個模型的答案裡。

第三個是會計事務所。日誌裡完全找不到爬蟲。網站沒有站台地圖,也沒有任何外部連結指過來。我們先送出站台地圖,再去三個同業公會的會員名錄留下網址。第二十一天日誌出現第一筆。

第四個是食品電商。爬蟲來得很勤,引用卻掛在比價網站上。比價網把商品規格寫得比官網完整。我們把官網的規格欄位補到十四項,兩個月後引用轉回自己。

第五個是補習班。問題出在答案寫在頁面第九百字。把結論搬到第一段,其他不動,六週後引用率從一成升到兩成六。

第六個是工具機廠。網站用單頁式框架,內容靠瀏覽器執行後才出現。爬蟲抓到的是空殼。改成伺服器端輸出,日誌的回應大小從兩千位元組變成六萬四千位元組。

每個月要記的四個數字

第一個是爬蟲造訪次數,從日誌撈。第二個是引用分數,從四個模型的抽查表撈。第三個是模型推薦來源帶進來的工作階段數,從流量報表撈。第四個是這批人送出的表單數。

四個數字寫在同一張表,一個月一列。第一個數字先動,第二個數字落後六到八週,第三個數字落後三個月,第四個數字落後四個月。

看到第一個數字上升就繼續做。四個數字都不動的時候,回頭讀日誌,不要先改文章。

爬蟲放行之後要檢查的四個回應碼

放行只是第一步。我們在四個網站上看過同樣的狀況:robots.txt 寫了 Allow,日誌裡還是 403。

擋人的是 CDN 的機器人管理規則,不是網站本身。

回應碼意思要做什麼
200抓到了看抓取頻率與抓到哪幾頁
403被擋檢查 CDN 與資安外掛的規則清單
404網址不存在比對網站地圖與實際路徑
429請求太多被限流放寬速率限制或加快回應時間
沒有紀錄從未造訪檢查網站地圖有沒有提交,內部連結有沒有指過去

一段話要能單獨活著

AI 擷取的單位是段落,不是整篇文章。

一段話要能被抓走,要滿足四件事:有主詞、有數字、有時間範圍、不依賴上一段。

反例是「這個做法我們用了很久,效果不錯」。抓走以後沒有人看得懂。

正例是「二〇二五年我們在六個電商網站測過這個做法,平均在第九週看到自然點擊上升」。

每一篇文章我們至少寫三段這樣的句子,放在小標之後的第一段。

更新日期要印出來

只寫在後端不算。日期要出現在頁面上,格式寫成年月日。

同時在結構化資料裡填 dateModified,兩邊一致。

我們比對過三十二頁。頁面上印出更新日期的那一批,被引用的比例是另一批的 2.3 倍。

更新日期造假會被抓到。內容沒有動就不要改日期。

一份可以複製的頁尾區塊

每一篇文章的最後,我們放三樣東西。

  • 作者姓名、職稱、與這個主題的實際經歷一句話。
  • 資料來源清單,每一筆帶擷取日期。
  • 一行授權說明,寫明歡迎引用並標示出處與網址。

第三行看起來多餘。它讓引用這件事變成明說的許可。

六到十週之後看什麼

放行、修結構、改寫段落之後,不要每天查。

第六週開始,每兩週用同一組問題問三個模型,記錄有沒有出現自己的網域。

問題要固定,不要每次換句話。變數多了就讀不出因果。

把結果記在同一張表上,欄位是日期、模型、問題、有無出現、被引用的段落。


延伸閱讀:SEO / GEO / AEO 系列

這一系列共十篇,從技術地基寫到內容維運。全部收在新知


這九件事我們每個月都在替客戶做一次。你想先確認自己的網站現在被哪幾家 AI 讀得到,可以從下面的入口開始。

常見問題

擋掉 AI 爬蟲會影響 Google 排名嗎?

不會。Googlebot 與 Google-Extended 是兩個名字。擋掉 Google-Extended 只會讓 Gemini 少引用你,網頁排名不受影響。兩者要分開設定。

文章要寫多長,AI 才會引用?

長度不是條件。條件是一段話能不能單獨成立。一段兩百字、有主詞、有數字、有時間,被擷取的機會就高過一篇八千字的長文。

沒有預算做結構化資料,可以先做什麼?

先做兩件事。把每篇文章的第一段改寫成直接回答問題的三句話。再把發布日期與更新日期印在頁面上。這兩件事不用寫程式。

多久會看到 AI 開始引用?

我們的觀察是六到十週。爬蟲要重新抓取,模型的檢索索引也要更新。放行後的第一週不會有變化,這是正常的。

robots.txt 放行了爬蟲還是抓不到怎麼辦?

檢查 CDN 的機器人管理規則與資安外掛。這種情況我們看過四次,網站本身放行,CDN 那一層還在回 403。日誌裡的回應碼會直接告訴你。

怎麼確認自己的內容有沒有被 AI 引用?

固定一組問題,每兩週問三個模型一次,記錄日期、模型、問題、有無出現、被引用的段落。問題不要每次換句話,變數多了讀不出因果。

關於作者與審稿

冠誠數位行銷(GuanCheng Martech)的顧問團隊撰寫這篇文章。團隊累積 295 個專案,服務 308 家客戶,操作範圍包含 SEO 自然排名、AEO 答案引擎、GEO 與 LLMO 佈局、Google 與 Meta 廣告投放、電商維運與數據歸因分析。

文章裡的數字來自冠誠數位行銷實際經手的客戶帳戶與後台報表,客戶名稱與可識別資訊都已經移除。內容由負責該領域的冠誠顧問審稿後發佈,最後更新日期為 2026 年 8 月 10 日。讀完有問題,可以到冠誠數位行銷官方網站的預約諮詢頁面留下聯絡方式,我們會用你提供的時段回電。