最適化

Google 広告のABテスト:変更の効果を証明する実験の設計

前後比較は季節性と競合の動きまで自分の成果として計上してしまいます。キャンペーン実験なら、2つの版を同じ期間・同じ条件で同時に走らせられます。

Google 広告のABテストは、プラットフォームに組み込まれた実験機能で行います。1つのキャンペーンのトラフィックを2つに分け、元の版と変更した版を同じ期間・同じ条件で走らせて比べる仕組みです。変更が本当に効いたかを証明できる誠実な方法はこれだけです。先月と今月を比べても、そこで測っているのは変更の効果ではなく、季節性と競合の動きと自分の変更を足し合わせた合計にすぎません。実際の運用では、良い実験は3つの判断に集約されます。変数は1つ、分割は50/50、そして95%の信頼水準に届くまで待つことです。

前後比較と実験では 結果が変わる前後実験316入札変更182広告文2411LP変更151配信拡大参考値: コンバージョン変化率 (%)
同じ4つの変更を2つの方法で測った場合の違いです。前後比較は差を大きく見せ、実験は実際に残る差を示します。参考シナリオであり、実際の顧客データではありません。

Google 広告の実験とは何ですか?

Google 広告の実験とは、既存キャンペーンの複製を作り、トラフィックと予算の一部をその複製に振り分けたうえで、2つの版を並べてレポートするテストの枠組みです。管理画面の「テスト」から作成します。元のキャンペーンが対照群、複製が実験群です。両者は同じ日、同じオークション、同じ季節に配信されるため、両者の差の大半は変更した点に帰属します。

  • カスタム実験:検索、ディスプレイ、動画キャンペーンで利用でき、入札戦略・広告文・ランディングページ・ターゲティングの変更を検証します。
  • P-MAX の実験:P-MAX を他のキャンペーンタイプと比較したり、既存構成に追加したときの上乗せ効果を測定したりします。
  • アセットテスト:2026年に、1つの P-MAX キャンペーン内でクリエイティブ アセットを比較できるよう拡張されました。キャンペーン内で分割するため学習期間が短くて済みます。
  • 動画・デマンド ジェネレーションのホールドアウト:広告を一切見せない対照群を確保し、ブランドへの影響を測ります。

1つのキャンペーンに実験は5件まで予約できますが、同時に動かせるのは1件だけです。分割比率は作成時に固定され、別の比率を試すには新しい実験を作り直す必要があります。

なぜ前後比較は誤解を招くのですか?

対照群がないからです。2つの期間を比べるということは、その間に変わった他のすべても一緒に比べているということです。差がプラスに出ても、そのうちどれだけが自分の手柄なのかは分かりません。実験は同じ期間内に対照群を維持するため、ノイズが両群に等しくかかり、残るのは自分の介入だけになります。

  • 季節性:曜日、月末、祝日、カテゴリの繁忙期があり、2つの期間が同条件になることはありません。
  • 競合の動き:競合が予算を上げたりオークションから抜けたりすると、こちらが何もしなくても費用が変わります。まずクリック単価に表れます。
  • 学習期間:入札戦略を変えるとアルゴリズムが再調整され、最初の数日は安定後の成果を代表しません。
  • 計測のずれ:コンバージョン期間、計測設定の変更、データ遅延によって2つの期間は別の物差しで測られます。
  • 平均への回帰:悪い週の後はどんな施策も良く見えます。翌週はどのみち平常に戻るからです。

キャンペーン実験はどう設定しますか?

設定は読み解くより簡単ですが、読み解きの信頼性を決めるのは設定です。開始前に、仮説・主要指標・終了日を文章にして固定してください。ここを先に決めておかないと、終わったときには欲しい答えを見つけられるだけの指標が手元に揃ってしまいます。

4ステップの キャンペーン実験1変数は1つだけ変更点は1つだけ2配信を50%分割Cookie分割を推奨34〜6週間続ける最初の7日は除外495%で判断する適用か中止か延長
キャンペーン実験の4ステップです。変数は1つに絞り、トラフィックを50/50に分割し、最低4〜6週間走らせ、95%の信頼水準で判断します。
  1. 仮説を書きます。「ランディングページのフォームを短くすればコンバージョン率が上がる」といった形です。仮説がなければテストではなく好奇心です。
  2. 対象キャンペーンを選び、下書きを作ります。下書きでは仮説にある1点だけを変更します。
  3. 分割は50/50にします。最も釣り合いの取れた比較になり、開始後は変更できません。
  4. 分割方法を選びます。Cookieベースの割り当ては各ユーザーを片側に固定でき、推奨される方法です。
  5. 開始日と終了日を最初に入力します。終了日を先に固定すると、数字を見てから期限をずらす誘惑を断てます。
  6. 主要指標を宣言します。コンバージョン数、コンバージョン値、CPA、ROAS のいずれかです。終わってから都合の良い指標を選ぶのは誠実な読み方ではありません。

何をテストすべきかを知ってから始める

Ads Sensor は Google、Meta、TikTok、Criteo、GA4 のデータを1つの画面で読み解き、根拠つきで優先順位のついた打ち手を出します。

ベータに登録 →

実験はどれくらい走らせ、何件のコンバージョンが必要ですか?

公式ドキュメントは最低4〜6週間を推奨しており、コンバージョンまでの遅延が長ければさらに必要です。ただし期間だけが基準ではありません。本当の制約は各群にたまるコンバージョン数で、計算は容赦がありません。検出したい差が小さくなるほど、必要なサンプルは二乗で増えます。狙う効果を半分にすれば、必要なデータは4倍になります。

1つの群に必要な コンバージョン数6.2005%改善1.55010%改善39020%改善17030%改善参考値: 基準CVR 3%、信頼度95%、検出力80%
検出したい改善幅が小さいほど、必要なデータ量は急に増えます。基準コンバージョン率3%、信頼度95%、検出力80%を前提とした参考計算です。
  • コンバージョン周期は2回以上:クリックから購入まで10日かかるなら、2週間の実験は話の半分しか語りません。
  • 週単位で区切る:平日と週末では行動が違い、半端な週は結果を歪めます。
  • 最初の7日間は除外される:プラットフォームは立ち上がり期間として扱うため、初週は判断材料になりません。
  • トラフィックの少ないキャンペーンで実験しない:月20件のコンバージョンでは、有意差に届くまでの時間が、その答えが有効でいられる時間を超えてしまいます。

結果はどう読みますか:有意とは何ですか?

統計的有意性とは、観測された差が偶然で生じる確率が、あらかじめ決めた閾値を下回ることです。Google 広告の実験ではその閾値が95%の信頼水準で、検定は両側です。つまり改善も悪化も同じ厳しさで判定されます。レポートの信頼区間がまだゼロを含むなら、結果は出ていません。「少し良さそう」は発見ではありません。

  • 95%の信頼水準:差が偶然のノイズである確率が5%未満に収まっている状態です。
  • 両側検定:上振れも下振れも同じ基準で評価します。片側だけ見るとリスクが隠れます。
  • リサンプリング:プラットフォームは各群のデータを20のバケットに分け、ジャックナイフ法で標本分散を推定します。データが少ないときほど慎重な推定になります。
  • 差が出ないことも結果です:差が見つからなければ効果はおそらく小さいということです。それは変更を適用する理由にはなりません。
95%
有意性の閾値
4〜6週間
推奨される実験期間
7日
レポートから除く立ち上がり
50/50
推奨トラフィック分割

なぜ一度に1つの変数だけなのですか?

2つ同時に変えると、どちらが結果を生んだのか永久に分からなくなるからです。実験が返すのは1つの数字、すなわち両群の差だけです。その数字を3つの変更に配分する方法はありません。さらに悪いことに、変更どうしが打ち消し合うこともあります。新しい広告文が勝っている裏で新しい入札戦略が負けていれば、合計はゼロになり、良い案を2つまとめて捨てることになります。

  • 正しい例:入札戦略だけを変える。選択肢は目標CPAと目標ROASの比較で扱っています。
  • 正しい例:ランディングページだけを差し替え、広告文には触れない。
  • 誤った例:同じ実験の中で予算を増やし、同時にマッチタイプも広げる。
  • 誤った例:実験の途中で元のキャンペーンに除外キーワードを追加する。対照群を途中でいじれば比較は成立しません。
  • クリエイティブは別の枠組みで:画像や動画の案を順番に試すならクリエイティブ テストの枠組みを参照してください。論理は同じで規模が違います。

よくある6つの失敗は何ですか?

実験の多くは設定ではなく読み方で壊れます。次の6つが、実務で結果を使い物にならなくする主な原因です。

  1. 判断が早すぎる:5日目に先行している群を勝ちと決めてしまう。何度も覗いて最初の良い瞬間で止めると偽陽性が生まれます。終了日を固定すれば防げます。
  2. 繁忙期に実験する:ブラックフライデー、連休、大型セール週はユーザー行動が変わります。出た答えはその週のもので、年間には持ち越せません。
  3. 実験が重なっている:同じアカウントで複数を同時に走らせると互いに干渉し、信頼性が落ちます。順番に実施してください。
  4. 指標を後から選ぶ:コンバージョンで差が出ないのでクリック率を見に行く。指標を十分に眺めれば、どれかは必ず有意になります。
  5. 手動で終了する:予定日に終了した実験は良好な結果が自動的に適用され得ますが、手動で止めた実験はその対象外になります。
  6. 結果を一般化する:1つのキャンペーンで勝った設定がアカウント全体で勝つとは限りません。指名キーワードで有効な入札戦略は一般キーワードでは別の挙動になります。この違いは品質スコアの記事でも触れています。

この流れの中で Ads Sensor はどこに立ちますか?

Ads Sensor が実験を代わりに設定することはありません。実験の作成は Google 広告の管理画面で行います。Ads Sensor が担うのは前と後です。前段では Google、Meta、TikTok、Criteo、GA4 のデータを1か所で読み、どのキャンペーンがテストに値するか、仮説がどの根拠に立っているかを整理します。後段では、画面上で承認して適用した推奨施策について、適用前後の結果を自動で追跡します。ここは正直に書きます。この追跡は変更の記録であって、因果関係の証明ではありません。因果を示すにはやはり実験が必要です。ベータに登録してアカウントを接続できます。

よくある質問

Google 広告の実験に追加の予算は必要ですか?
必要ありません。カスタム実験は元のキャンペーンのトラフィックと予算を共有します。50%で分割すると、費用のおよそ半分が実験側に配分されます。総支出は変わらず、二分されるだけです。
実験は最低どれくらい走らせるべきですか?
実務では4〜6週間が良い下限です。コンバージョンまでの遅延が長い場合は、少なくとも2周期分待ってください。最初の7日間は立ち上がりとして比較から除外されるため、2週間の実験は実質1週間分のデータしか残りません。
結果が有意にならなかったらどうしますか?
選択肢は3つです。期間を延ばす、より配信量の多いキャンペーンで同じ検証をやり直す、または差が本当に小さいと認めて別の仮説へ移る。結論が出ない結果を「それでも適用しよう」と読むのは、実験をしなかったのと同じ場所に戻ることです。
実験を同時に複数走らせてもよいですか?
技術的には可能ですが推奨されません。実験どうしがトラフィックと学習に干渉し、結果の信頼性が下がります。1つのキャンペーンに5件まで予約できても同時稼働は1件だけで、アカウント全体でも順番に進めるほうが安全です。
Cookieベースと検索ベースの分割はどう違いますか?
Cookieベースではユーザーは常に同じ群に留まります。検索ベースでは検索のたびに割り当て直されるため、同じ人が両方の版を見ることがあります。検索ベースは有意差に早く到達しやすく、Cookieベースはより澄んだ比較になり、推奨されるのは後者です。
実験に勝ちました。次は何をしますか?
予定日に終了した実験では、良好な結果が自動的に適用され得ます。手動で元のキャンペーンに反映することも、実験キャンペーンを恒久化することもできます。適用後は最低1か月は成果を観察してください。勝った設定も規模が変わると挙動が変わることがあります。

テストに値するものを見つける

Ads Sensor は5つのデータソースを1つの画面にまとめ、リスクと機会を根拠つきで並べます。どの仮説に実験を割り当てるかは、あなたが決めます。

ベータに登録 →