符合台灣
A/B測試規劃指令|讓每次實驗都有明確的假設和判斷依據
一句話結論輸入測試假設與目標指標,AI 產出完整 A/B 測試規劃,含樣本量計算、實驗設計、分組邏輯與結果判讀標準,讓數據說話而非靠直覺決定要不要推全站。
指令介紹
台灣很多產品的 A/B 測試是假的——跑兩週、方向對就推全站,沒有統計顯著性、沒有樣本量計算、沒有護欄指標。這種做法叫跑測試,不叫 A/B 測試。這組指令幫你在實驗開始前把所有關鍵決定做好,讓結果可以被信任。
適用情境
A/B測試實驗設計數據驅動轉換率優化
懶人貼上・複製就能用
已填好範例複製就能直接用
▸ 想換成你自己的內容?點開填一填選填
AI 指令庫編輯的話
編輯實測If/Then/Because 格式讓假設有明確的可否證條件,而非模糊的「應該會更好」;樣本量計算讓實驗長度有科學依據,防止因為看到正向趨勢就提早停止導致偽陽性錯誤。 這組「A/B測試規劃指令|讓每次實驗都有明確的假設和判斷依據」是 Prompts 編輯團隊實測整理的職場 AI 指令(Prompt),適合用 ChatGPT、Claude 執行,特別適合「0」等台灣在地場景。複製上方指令範本即可使用,免費、免註冊。
模型實測對照
## 1. 測試假設
If 我們將「立即付款」按鈕改為藍色(主色調),
Then 付款完成率將提升 10% 以上,
Because 主色調按鈕在視覺層級上更突出,減少用戶在最後步驟的認知猶豫。
## 2. 實驗設計
・Control(A):現有灰色「立即付款」按鈕
・Treatment(B):藍色「立即付款」按鈕(#007AFF,其餘 UI 完全一致)
## 3. 主要指標
付款完成率 = 當日完成付款人數 / 當日到達結帳頁人數
基準值:目前約 45%;最小可偵測差異(MDE):10%(即治療組目標 49.5%)
## 4. 護欄指標
・平均訂單金額(AOV):不應顯著下降(可能因衝動購買增加而需監控)
・客服退款率:不應上升
・結帳頁跳出率:應維持或改善
## 5. 樣本量估算
統計功效 80%,置信水準 95%(雙尾檢定),基準轉換率 45%,MDE 10%
→ 每組所需樣本約 3,900 人
→ 總樣本:7,800 人
→ 按每日 2,000 人、各 50% 分流,需要約 8 天
## 6. 實驗時長
建議跑 14 天(包含兩個完整週期,避免週一/週末行為差異影響),確認 novelty effect 消退後結果穩定。
## 7. 分組邏輯
依用戶 ID 尾數奇偶數分組(奇數→Control,偶數→Treatment),確保同一用戶每次看到一致體驗,避免 carry-over effect。
## 8. 成功判定標準
・推全站:治療組付款完成率比控制組高 ≥ 5%,且 p < 0.05,護欄指標無顯著惡化。
・終止:治療組付款完成率低於控制組 ≥ 3%(有害),或護欄指標顯著惡化。
・繼續觀察:差異不顯著但方向正確,延長實驗兩週後再判斷。
## 9. 回滾計畫
若中途發現治療組的客服退款率顯著上升,立即停止實驗並將所有用戶回到控制組,不等實驗結束。
實測(ChatGPT):If/Then/Because 假設格式讓實驗有可否證的預測,樣本量計算讓「跑幾天夠」有科學依據,成功判定標準讓推全站決策不靠感覺。
產出含 If/Then/Because 假設、Control vs Treatment 設計、主要與護欄指標、樣本量估算(7,800人/14天)、分組邏輯、成功/終止判定標準與回滾計畫的完整 A/B 測試規劃,可直接交給分析師執行。
實測(Claude):強制計算所需樣本量和實驗天數是這組指令最重要的功能——讓 PM 在實驗開始前就知道「跑幾天才算數」,避免看到想要的數字就提早停止實驗的確認偏誤。
為這個指令評分
常見問題
A/B 測試一定要等統計顯著才能推嗎?
正式的 A/B 測試要等顯著,但緊急情況或資源不足時可以用「決策門檻」替代:設定最低觀察樣本量(如 5,000)和最低效果量(如 5%),達到後人工判斷。重要的是事前設好標準,不要用結果去反推判斷依據。
A/B 測試要幾組才算好?
初學者從 A/B(2組)開始,一次只改一個變數。有足夠流量且有明確假設後再考慮 A/B/C(3組)。同時跑太多測試會有交互效應問題,讓結果難以解讀。
相關指令
猜你喜歡
每週 5 組最新台灣 AI 指令,寄到你信箱
免費訂閱電子報,第一時間收到新指令與實測心得;現在訂閱立即領取「50 組必備 AI 指令懶人包」。
訂閱成功!懶人包連結已寄到你的信箱,請收信。
不寄垃圾信,隨時可取消訂閱。