分頁與篩選頁的索引策略:讓爬蟲把預算花在對的地方
電商或內容量大的網站做技術 SEO,最常遇到的不是頁面不夠,而是頁面太多。三個篩選條件各有十個選項,理論上就能組出上千個網址;再加上排序、每頁筆數、追蹤參數,實際可被爬取的網址數量往往是商品數的數十倍。
爬蟲每天願意花在你網站上的時間是有限的。當這些時間被大量近似頁面吃掉,真正重要的商品頁與內容頁就會被排到很後面,新上架的東西要好幾週才被發現。這篇談的是怎麼把爬取預算重新分配回值得的地方。
一、先把頁面分成四類
處理之前要先分類,不同類型的處理方式完全不同,混在一起做只會製造新的問題。
第一類:有獨立需求的頁面
有人會直接搜尋這個組合,例如「某品牌 某尺寸 某顏色」。這一類應該保留索引,並且給它獨立的標題、描述與一段說明文字,讓它不只是列表。判斷方式是看關鍵字工具中是否有實際搜尋量,或站內搜尋是否有人這樣找。
第二類:功能性的瀏覽輔助
排序方式、每頁顯示筆數、檢視模式切換。這一類對使用者有價值,對搜尋沒有價值,因為內容與原始頁面完全相同,只是呈現方式不同。應該一律不索引,並用標準網址指回未帶參數的版本。
第三類:組合過深的篩選
同時套用三個以上條件產生的頁面,通常結果只有零到數筆,內容稀薄且大量重複。這一類不但不該索引,最好連連結都不要給爬蟲,避免它循著連結一路爬進組合的深淵。
第四類:零結果頁
篩選之後沒有任何商品的頁面。這種頁面對使用者是死路,對搜尋是垃圾。應該回傳明確狀態、不索引,並在頁面上提供回到上層的路徑。
二、分頁的三個常見錯誤
列表分頁的處理方式在過去幾年變過幾次,很多網站還停留在舊做法上。
- 錯誤一:把第二頁之後的標準網址全部指向第一頁。這會讓第二頁以後的商品失去被發現的機會,因為爬蟲認為那些頁面沒有獨立價值
- 錯誤二:把分頁全部設為不索引。不索引會連帶降低爬蟲跟隨頁面內連結的意願,深層商品同樣受害
- 錯誤三:只用非同步載入,沒有可被爬取的分頁網址。使用者體驗很好,但爬蟲永遠只看得到第一批商品
比較穩健的做法是:每一頁都有自己的標準網址、都可被索引,但標題與描述加上頁碼以避免重複;同時提供一個結構清楚的商品總覽或站台地圖,讓深層商品有第二條被發現的路。
三、參數治理的四個步驟
- 第一步:從伺服器記錄檔匯出爬蟲實際請求的網址,統計各種參數出現的次數與佔比
- 第二步:把參數分成內容型與呈現型。內容型會改變頁面主要內容,呈現型不會
- 第三步:呈現型參數一律用標準網址收斂,並在內部連結中避免產生這些網址
- 第四步:內容型參數依需求判斷是否保留索引,保留的要補上獨立文案,不保留的用機器人規則擋掉
第一步是多數人跳過卻最關鍵的一步。沒有記錄檔資料,你只能猜爬蟲把時間花在哪裡;有了資料,通常會發現前幾名的請求都是完全沒有價值的參數組合。
四、內部連結才是真正的閥門
用機器人規則擋住某個路徑,只是阻止爬取,不會阻止那些網址被發現,也不會回收已經被索引的頁面。真正有效的控制在於不要產生連結。
具體做法包含:篩選器改用不會產生新網址的互動方式、超過兩個條件的組合不提供可點擊連結、排序與檢視切換使用不會被爬取的形式。當連結不存在,整個問題從源頭就消失了。
這件事需要前端與行銷一起決定,通常卡在沒有人認為這是自己的責任。實務上建議把它寫進網站改版的驗收條件,而不是事後補救。
五、驗證有沒有改善的三個指標
- 爬取請求的分布:重要頁面類型佔總請求的比例是否上升,參數頁佔比是否下降
- 新頁面被發現的時間:從上架到出現在索引的天數是否縮短
- 索引頁數與有效頁數的差距:總索引數下降但帶來點擊的頁數不變或上升,代表清理方向正確
第三項最容易被誤解。很多人看到索引頁數下降就緊張,但如果下降的都是零流量的參數頁,而有效頁面的曝光不變甚至上升,那正是預期中的結果。要看的從來不是總數,而是結構。
六、導入的順序建議
不要一次全改。建議先處理呈現型參數,因為它們風險最低、影響最單純;觀察兩到四週確認沒有負面變化,再處理深層篩選組合;最後才調整分頁策略,因為那一項牽動的頁面數最多。
每一階段都保留變更紀錄與時間點,這樣當某週數字出現波動時,你能快速判斷是自己改的還是外部因素。沒有紀錄的技術調整,一旦出問題就只能整批回退,之前的努力全部作廢。
爬取預算這件事的本質,是承認資源有限並主動做取捨。網站不是收錄越多越好,而是讓有限的注意力落在真正能帶來生意的頁面上。把這個觀念建立起來,很多技術決策的答案就自然清楚了。
七、不同規模網站的優先順序
網站規模不同,爬取預算的緊張程度差很多,資源該投在哪裡也不一樣。用可被爬取的網址總數來分級,比用商品數更準確。
網址總數在數千以內的網站,爬取預算通常不是瓶頸,主要問題是重複內容稀釋權重。這種規模先把呈現型參數收斂、把零結果頁擋掉就夠了,分頁策略可以維持現狀,不需要大動干戈。
網址總數在數萬到數十萬之間,是最容易出事的區間。商品數其實不多,但篩選組合把網址數推到爬蟲負擔不了的程度,新品要兩三週才被收錄。這種規模的重點在第四段講的內部連結閥門,從源頭減少可被發現的組合,比事後用規則擋有效得多。
網址總數超過百萬的大型站,需要的是分層策略:把頁面依商業價值分成三到四層,確保最高價值的那一層在站內結構上距離首頁不超過三次點擊,並且擁有最多的內部連結。低價值層即使被延後爬取也不影響大局,這是刻意的取捨而不是疏忽。
八、六個容易被忽略的細節
- 網站地圖只放希望被索引的網址,不要把所有存在的網址都丟進去,否則等於送出互相矛盾的訊號
- 網站地圖裡的最後更新時間要真實反映內容變動,長期填當天日期會讓這個欄位失去參考價值
- 過濾器產生的網址若使用井字號而非問號,爬蟲多半不會視為獨立頁面,這在某些情境是優點
- 商品缺貨或下架後不要直接回傳找不到,先評估是否有替代品可導向,避免大量斷點
- 站內搜尋結果頁一律不索引,它是最典型的低價值且無限增生的頁面類型
- 行動版與桌機版若網址不同,兩邊的索引指示必須一致,否則會出現互相打架的狀況
第二項常被當成小事,但它影響的是爬蟲對整個網站的信任度。當系統發現網站地圖宣稱的更新時間與實際內容不符,之後就會傾向忽略這個訊號,改用自己的排程,你也就失去了主動告知新內容的能力。
九、一個常見的誤區:以為擋掉就等於解決
把不想要的路徑加進機器人規則,是最快也最常被使用的處理方式,但它只解決了一半問題。被擋住的網址仍然可能因為外部連結或既有索引而出現在搜尋結果中,只是沒有描述文字,看起來反而更糟。
更麻煩的是,被擋住的頁面上如果有指向重要頁面的連結,那些連結傳遞的價值也一併被切斷了。有些網站在擋掉篩選路徑之後,發現深層商品的曝光反而下降,原因就在這裡。
比較完整的做法是分兩階段:先讓那些頁面可被爬取但不索引,等到索引清空之後,再視情況決定要不要連爬取一併擋掉。順序反過來,清理工作就會卡住,因為爬蟲根本讀不到不索引的指示。
技術 SEO 裡大部分的爭議,最後都回到同一個問題:你希望搜尋引擎把有限的注意力放在哪些頁面上。把這個問題想清楚並寫成一份明確的分層文件,前面所有的判斷都會變得簡單;沒有這份文件,每一次改版都會重新爭論一次,而網址數只會越長越多。
延伸閱讀
- 技術 SEO 稽核清單。站台健康度的檢查項目
- 內容修剪的四個徵兆。重複內容的處理方式
- 內部連結與主題叢集。站內結構的規劃
關於作者與審稿
冠誠數位行銷(GuanCheng Martech)的顧問團隊撰寫這篇文章。團隊累積 295 個專案,服務 308 家客戶,操作範圍包含 SEO 自然排名、AEO 答案引擎、GEO 與 LLMO 佈局、Google 與 Meta 廣告投放、電商維運與數據歸因分析。
文章裡的數字來自冠誠數位行銷實際經手的客戶帳戶與後台報表,客戶名稱與可識別資訊都已經移除。內容由負責該領域的冠誠顧問審稿後發佈,最後更新日期為 2026 年 9 月 6 日。讀完有問題,可以到冠誠數位行銷官方網站的預約諮詢頁面留下聯絡方式,我們會用你提供的時段回電。
