A/B 測試在小流量網站的替代方案:四種可行的驗證方式
分流測試是驗證行銷改動最嚴謹的方式,但它有一個前提:足夠的樣本。當一個網站每月只有幾千次造訪、幾十筆轉換時,把流量切成兩半做測試,需要好幾個月才能累積到可以判斷的程度——而那時候市場已經變了。
更常見的情況是:測試跑了兩週,看到一組數字比較好就宣布勝出,而那個差異其實完全在隨機波動範圍內。這樣做比不測試更糟,因為它給了錯誤的信心。
這篇提供四種在小流量環境下仍然可行的驗證方式。
一、方案一:前後期比較加對照基準
不做分流,而是全站切換到新版本,比較切換前後的表現。這個方法的問題是無法排除時間因素,但可以用對照基準來緩解。
- 選一個沒有被改動的相似頁面或渠道作為對照
- 比較目標頁面的變化幅度與對照組的變化幅度
- 如果目標頁面上升兩成而對照組持平,這個差異比較可信
- 如果兩者同步上升,代表變化來自外部因素而非你的改動
- 比較期間至少各四週,涵蓋完整的週期波動
- 切換時間避開活動檔期與節假日
- 記錄期間內所有其他變動,包含投放調整與外部事件
- 用中位數而不是平均數,避免單日異常主導結果
二、方案二:質性測試
流量少的時候,深度可以補數量。找五到八位符合目標客群的人實際操作,並請他們邊做邊說出想法。
這種方法的資訊密度極高:一位使用者的十分鐘操作,可能直接指出三個資料看不出來的問題——某個按鈕看起來不像可以點、某段文字造成誤解、某個必填欄位讓人卻步。
- 受測者不要找同事或同業,他們的認知與真實客戶差太多
- 給任務而不是問意見,例如請你找出這個服務要多少錢
- 全程不要引導,卡住的時候忍住不要提示,卡住的地方就是問題
- 五到八人通常就會出現重複的問題,那些就是最該修的
質性測試無法告訴你哪個版本轉換率高,但它能告訴你為什麼低——而後者往往更有用。
三、方案三:用代理指標放大樣本
轉換數太少無法判斷,但轉換前的行為數量通常是轉換的數十倍。用這些前導行為當作代理指標,樣本立刻足夠。
- 捲動深度:改動之後,到達頁面某個位置的比例是否提升
- 特定區塊的停留時間:價格區、案例區的閱讀時間變化
- 表單開始填寫率:即使完成數少,開始填寫的人數多得多
- 內部連結點擊率:讀者有沒有被引導到下一步
使用代理指標的前提是先確認它與最終轉換有關聯。確認方式是用過去六到十二個月的資料,看兩者是否同向變動。完全無關的代理指標會導向錯誤結論。
四、方案四:循序驗證
不同時比較兩個版本,而是依序推出並累積證據。
做法是把一個改動拆成三到四個階段,每個階段推出後觀察兩到四週。如果每一階段都朝同一個方向移動,即使單一階段的差異不顯著,連續的一致性本身就是證據。
- 第一階段:只改標題與第一段
- 第二階段:加上價格說明與比較基準
- 第三階段:調整表單欄位
- 第四階段:加上證據與案例
這種做法的額外好處是你會知道哪一個階段貢獻最大,而分流測試通常只能告訴你整包改動有沒有用。
五、四種方案的搭配
四種不需要擇一,最有效的組合是:先用質性測試找出問題、用循序驗證逐步改動、用代理指標觀察每一步、最後用前後期比較確認整體效果。
這個組合的總時間大約是八到十二週,比硬做分流測試快,而且過程中一直有可行動的資訊,不需要等到最後才知道結果。
六、什麼時候還是該做分流測試
三種情況下即使流量不大也值得做。第一,改動的風險很高,例如大幅調整定價呈現方式,需要限制影響範圍。第二,改動可以長期跑,例如電子報主旨測試,累積速度快。第三,測試對象是高頻行為而非低頻轉換,例如按鈕點擊率。
- 測試前先估算需要多久才能累積足夠樣本,超過八週就不要做
- 只測一個變因,多變因測試需要的樣本量會倍增
- 事先決定判斷標準與結束時間,不要邊看邊決定
- 結果不顯著時誠實記錄為不顯著,不要挑對自己有利的切片
七、最重要的一個原則
無論用哪一種方法,都要在改動之前記錄現況。這聽起來理所當然,但實務上超過一半的改動沒有基準線,導致事後無法判斷。
記錄的成本是十分鐘:把要觀察的三到五個指標的目前數值與過去四週平均寫下來。這十分鐘決定了後面幾週的觀察有沒有意義。
小流量網站的驗證困難是真實的,但它不代表只能憑感覺。換一種方法、接受較低的確定性、用多個弱證據互相佐證,仍然可以做出比猜測好得多的判斷。
八、一個實際的操作範例
假設一個服務業網站每月三千次造訪、二十筆詢問,想改善服務頁的轉換。用分流測試需要至少四到六個月才能判斷,顯然不可行。改用四種方案的組合,實際的流程會是這樣。
第一到二週做質性測試。找六位符合客群的人,請他們在這個網站上找出這個服務的費用大概多少、以及要怎麼開始。六個人裡有四個在價格區塊停下來說看不懂、三個沒有找到聯繫方式。這兩個問題在資料上完全看不出來,因為那些人根本沒有留下轉換紀錄。
第三到四週記錄基準線。把服務頁的造訪數、平均停留、捲動到價格區的比例、表單開始填寫率、以及詢問數的過去四週數值記下來。同時選定部落格的其中一個分類頁作為對照組。
第五到八週做循序驗證的第一與第二階段。先重寫價格區塊,加上包含項目與比較基準;觀察兩週,捲動到價格區之後繼續往下的比例從四成一升到五成八。接著把聯繫方式從頁尾移到價格區塊下方;再觀察兩週,表單開始填寫率從百分之三點二升到百分之五點一。
第九到十二週完成剩下的階段並做整體比較。四週後詢問數從每月二十筆變成三十一筆,而對照組的部落格分類頁流量與去化率大致持平,代表這個變化不是來自整體流量成長。
整個過程十二週,每一步都有可行動的資訊,而且最後知道哪一項改動貢獻最大——這是分流測試給不了的。
九、把驗證方式寫進團隊規範
- 任何改動之前必須記錄三到五個指標的基準線,沒有基準線不准上線
- 小流量頁面預設使用循序驗證,不使用分流測試
- 每季至少做一次質性測試,對象是真實客群而非內部同事
- 所有驗證結果無論成敗都要記錄,包含當時的假設與實際數字
第四項最容易被忽略。失敗的驗證紀錄與成功的一樣有價值,因為它避免了未來重複嘗試同樣的方向。累積兩年之後,這份紀錄會變成團隊最實用的判斷依據。
驗證的目的不是追求學術等級的嚴謹,而是讓每一次改動都比上一次更有依據。在資源有限的環境下,能夠持續累積判斷的做法,價值遠高於一次做到完美卻無法重複的測試。
延伸閱讀
- 樣本太小怎麼做決定。資料不足時的判斷方法
- 六種常見的統計陷阱。數字對但結論錯
- 到達頁的四個死亡區塊。訪客在哪裡離開
關於作者與審稿
冠誠數位行銷(GuanCheng Martech)的顧問團隊撰寫這篇文章。團隊累積 295 個專案,服務 308 家客戶,操作範圍包含 SEO 自然排名、AEO 答案引擎、GEO 與 LLMO 佈局、Google 與 Meta 廣告投放、電商維運與數據歸因分析。
文章裡的數字來自冠誠數位行銷實際經手的客戶帳戶與後台報表,客戶名稱與可識別資訊都已經移除。內容由負責該領域的冠誠顧問審稿後發佈,最後更新日期為 2026 年 9 月 6 日。讀完有問題,可以到冠誠數位行銷官方網站的預約諮詢頁面留下聯絡方式,我們會用你提供的時段回電。
