← 実践記事

OTSUMU KNOWLEDGE

A/Bテストの設計:サンプル数・期間・判定基準の決め方の基本

A/Bテストは開始前の設計で結果の信頼性が決まります。仮説・主指標・副指標・必要サンプル数・期間・判定基準の決め方と、有意差のよくある誤解、実装時の注意点、テストが向かない場面の代替手段までを解説します。

A/Bテストは、「テストを始める前に何を決めておくか」で結果の信頼性がほぼ決まります。具体的には、検証したい仮説、判定に使う主指標、見落としてはいけない副指標、必要なサンプル数、テストの期間、そして「どうなったら採用するか」という判定基準です。これらを事前に文書にしておけば、結果が出てから都合のよい解釈をしてしまう失敗を避けられます。

この記事は、Webサイトやサービスの改善でA/Bテストを始めたい、あるいは実施しているが結果の判断に自信がないマーケティング担当者、プロダクト担当者に向けて書いています。統計の専門知識がなくても理解できるよう、サンプル数や有意差の考え方を、判断に必要な範囲で説明します。

テストツールの操作方法ではなく、どのツールを使う場合にも共通する「設計の型」と「判断の作法」を身につけることが目的です。

A/Bテストとは:同じ時期に出し分けて比べる方法

A/Bテストは、ユーザーを無作為に二つ以上のグループに分け、それぞれに異なる画面や体験を見せて、成果を比べる方法です。現状のパターン(A)と変更したパターン(B)を同じ期間に並行して出すため、季節、曜日、広告の出稿量といった外部要因の影響を両方が同じように受けます。

この「同じ時期に比べる」という点が、変更前と変更後を比べる前後比較との大きな違いです。前後比較では、成果が上がったとしても、それが変更のおかげなのか、たまたまその時期に需要が増えたからなのかを区別できません。A/Bテストは、変更そのものの効果を取り出すための仕組みです。

ただし、A/Bテストは万能ではありません。十分な流入がないと結論が出るまでに長い時間がかかりますし、短期的な成果は測れても、長期的な継続や満足度への影響は見えにくいことがあります。どんな場面でテストを使い、どんな場面では別の方法を選ぶかも、この記事で整理します。

テスト前に決める6つの項目

A/Bテストの設計とは、次の6項目を事前に決めて文書にすることです。テスト計画書として1枚にまとめ、関係者と合意してから開始します。

項目決める内容記入例(架空)
仮説誰の、どんな行動が、なぜ変わるか料金表に「初期費用なし」を明記すると、費用への不安が減り、申し込み開始が増える
主指標採否を決める唯一の指標料金ページ閲覧者のうち、申し込みフォームを開いた割合
副指標(ガードレール)悪化してはいけない指標申し込み完了率、問い合わせ件数、表示速度
対象と割り当て誰を対象に、どの比率で分けるか料金ページを訪れた全ユーザーを半分ずつ
サンプル数と期間必要な人数と、それを集める期間各グループに必要な人数を見積もり、最低2週間
判定基準どうなったら採用・不採用・保留か主指標が改善し、統計的に偶然と言いにくく、副指標が悪化していなければ採用

主指標は一つに絞ります。複数の指標を並べて「どれかが良くなったら成功」とすると、偶然良く見える指標が出やすくなり、誤った判断につながります。他の指標は、副指標として「悪化していないか」を確認する役割にとどめます。

仮説と指標の決め方

仮説は「なぜ変わるか」まで書く

「ボタンを大きくすればクリックが増える」という仮説は、なぜ増えるのかが書かれていません。「スマートフォンでボタンが画面の外に出ていて気づかれていない。画面内に収まるよう配置を変えれば、申し込み開始が増える」のように理由まで書くと、結果が出たときに学びが残ります。仮説が外れた場合も、「気づかれていないことが原因ではなかった」という知見が得られます。

主指標は施策に近い場所を選ぶ

主指標は、施策が直接影響する行動を選ぶのが基本です。料金ページの文言を変えるなら、その直後の行動(申し込みフォームを開く)を主指標にします。売上や最終的な契約数のように遠い指標は、施策以外の要因でも大きく動くため、差を検出するのに膨大なサンプル数が必要になります。

ただし、近い指標だけを見ると、「クリックは増えたが申し込みは増えない」という事態を見逃します。そこで、最終成果に近い指標を副指標として必ず確認します。

副指標で「悪化」を見張る

副指標は、改善の裏で何かが壊れていないかを確認するためのものです。たとえば、申し込みの入力項目を減らすテストでは、申し込みは増えても、営業につながる情報が欠けて商談化率が下がるかもしれません。表示速度、エラー率、解約率なども、施策によっては副指標に入れます。

必要なサンプル数の考え方

A/Bテストで最もよく聞かれるのが「何人集めればよいか」です。必要なサンプル数は、主に次の4つの要素で決まります。

  1. 現在の値(ベースライン):主指標の現状の水準。現状の値が低いほど、差を見分けるのに多くの人数が必要です。
  2. 検出したい差の大きさ:どの程度の改善を見つけたいか。小さな差を見つけたいほど、必要な人数は急激に増えます。
  3. 偶然を許容する度合い(有意水準):本当は差がないのに「差がある」と判断してしまう誤りを、どこまで許すか。
  4. 差を見逃さない確率(検出力):本当に差があるときに、それを正しく検出できる確率。

これらの値を入れると必要な人数を計算できる、サンプルサイズの計算ツールが一般に公開されています。数式を覚える必要はありませんが、「小さな差を見つけようとすると、とても多くの人数が必要になる」という関係は理解しておいてください。

実務での使い方としては、まず自社の流入量から「1か月で集められる人数」を確認し、その人数で検出できる差の大きさを逆算します。もし、その差が現実的な施策では起こりそうにないほど大きいなら、そのページでのA/Bテストは向いていません。より流入の多いページでテストするか、主指標をより手前の行動に置き直すか、テスト以外の方法で判断することを検討します。

テスト期間の決め方

期間は、必要なサンプル数を集め終わるまで、かつ次の条件を満たすように決めます。

  • 曜日の影響が一巡する:平日と週末で行動が違うサービスは多いため、最低でも1週間単位、できれば2週間以上を確保します。
  • 購買や検討の周期を考える:検討期間が長い商材では、テスト期間中に意思決定まで至らない人が多くなります。主指標を手前の行動に置くか、期間を長めに取ります。
  • 大きなイベントと重ならない:大型セールや広告の大量出稿、メディア掲載などがある時期は、普段と違う層が流入するため、結果が一般化しにくくなります。
  • 長すぎない:期間が長くなると、Cookieの削除などで同じ人が両方のパターンを見る可能性が増え、外部環境も変わります。

最も重要なのは、期間を事前に決めて、途中で結果を見て止めないことです。この点は次の章で詳しく説明します。

有意差の誤解と、結果の正しい読み方

A/Bテストの結果でよく使われるのが統計的有意差という考え方です。これは「観測された差が、偶然だけで生じたとは考えにくい」ことを示すもので、判断の重要な材料です。ただし、誤解されやすい点がいくつもあります。

途中で何度も結果を見て止める

テストの途中で毎日結果を確認し、有意差が出た瞬間に止めると、偶然の差を「効果あり」と判断してしまう確率が大きく上がります。結果のぶれは、テストの序盤ほど大きいからです。事前に決めたサンプル数と期間が終わるまで、判定はしないのが原則です。途中経過を見ること自体は問題ありませんが、それを理由に止めないことが大切です。

有意差があれば「大きな効果」だと考える

有意差は「差がありそうか」を示すもので、「差が大きいか」は示しません。サンプル数が非常に多いと、事業的にはほとんど意味のない小さな差でも有意になります。判断では、差の大きさと、その差が事業にとってどれだけの意味を持つかを必ずあわせて見ます。p値の解釈も、この点を押さえておくと誤りにくくなります。

有意差がなければ「効果がない」と考える

有意差が出なかったことは、「効果がない」ことの証明ではありません。サンプル数が足りず、差を検出できなかっただけかもしれません。結果が出なかった場合は、検出できる差の大きさに照らして、「少なくとも大きな改善ではなかった」と解釈するのが妥当です。

セグメントを後から探す

全体では差がなかったテストで、「スマートフォンの新規ユーザーに限ると差があった」のように、後から切り口を探して成功を見つけるのは危険です。切り口を増やすほど、偶然の差が見つかる可能性が上がります。セグメント別に見たい場合は、事前に計画書に書いておきます。後から見つけた差は、次のテストの仮説として扱います。

架空の例:会員登録ページのテスト計画

架空の家計管理アプリを例に、テスト計画の流れを示します。このアプリでは、Webの紹介ページからアプリのダウンロードではなく、まずWeb上で会員登録をしてもらう導線を持っているとします。

チームは、登録ページで「登録すると何ができるか」が伝わっておらず、入力欄だけが並んでいることが離脱の原因だと考えました。そこで、入力欄の上に登録後にできることを3点だけ短く示すパターンを作り、次の計画を立てました。

  • 仮説:登録後の価値が伝わっていないため、ページを開いた人が入力を始めずに離脱している。価値を3点示せば入力開始が増える。
  • 主指標:登録ページ閲覧者のうち、最初の入力欄に入力を始めた割合
  • 副指標:登録完了率、登録後7日以内の初回利用率、ページの表示速度
  • 割り当て:登録ページを訪れたユーザーを無作為に半分ずつ
  • 期間:過去の流入量から必要人数を集めるのにかかる期間を見積もり、曜日の影響を考えて2週間単位で設定
  • 判定基準:主指標が改善し、統計的に偶然とは言いにくく、副指標が悪化していなければ採用。主指標が改善しても登録後の初回利用率が下がった場合は保留とし、追加で調査する

このように、結果が出る前に「どうなったらどうするか」を決めておくと、結果が出てからの議論が短く済みます。

仮に、このテストで主指標は改善したものの、登録完了率は両パターンでほとんど変わらなかったとします。この場合、「入力を始める人は増えたが、途中で離れる人も増えた」可能性があります。価値の説明に惹かれて入力を始めたものの、入力項目の多さに気づいて離脱した人がいるのかもしれません。計画書に副指標を入れていたからこそ、この現象に気づけます。チームは次のテストとして、入力項目の削減と価値の説明を組み合わせたパターンを検討することになります。一つのテストの結果が、次の仮説を生む流れです。

実装時の技術的な注意点

設計が正しくても、実装に問題があると結果は信頼できません。テストを開始する前に、技術面で次の点を確認しておきます。

割り当ての一貫性

同じユーザーには、テスト期間中ずっと同じパターンを見せる必要があります。訪問のたびにパターンが変わると、両方を見た人が混ざり、差が薄まります。ログイン済みのユーザーは会員IDで、未ログインのユーザーはCookieなどの識別子で割り当てを固定するのが一般的です。ログイン前後でパターンが入れ替わらないかも確認します。

表示のちらつき

ページを表示した後でスクリプトが内容を書き換える方式では、一瞬だけ元のパターンが見えてしまう「ちらつき」が起きることがあります。ちらつきは体験を損ない、パターンBの成果を不当に下げる原因になります。可能であれば、サーバー側でパターンを出し分ける方式を検討します。

計測の対称性

両方のパターンで、主指標と副指標が同じ定義で計測されているかを確認します。パターンBだけ新しい画面を作った結果、完了イベントの送信場所がずれていた、というのはよくある事故です。テスト開始前に、両パターンを実際に操作して計測を確かめます。

割り当て比率の検証

テスト開始後、各グループの人数が想定した比率になっているかを確認します。半分ずつに分けたはずなのに人数に大きな偏りがある場合は、割り当てか計測に問題がある可能性が高く、そのまま結果を読むと誤ります。

A/Bテストが向かない場面と代わりの方法

A/Bテストが向かない場面もあります。無理にテストをすると、時間がかかるうえに誤った結論を出しかねません。

  • 流入が少ない:必要なサンプル数が集まらない場合は、ユーザーへの聞き取りや操作の観察で仮説を確かめ、前後比較と組み合わせて判断します。
  • 大きな方針転換:料金体系の全面変更やサービスの大幅なリニューアルなどは、ユーザーごとに体験を変えると混乱や不公平感を生むことがあります。段階的な展開や地域・期間を区切った検証を検討します。
  • 長期的な効果を見たい:継続率や顧客満足の変化は、短期のテストでは見えにくいため、コホート分析などで時間をかけて追います。
  • 明らかなバグや使いにくさの修正:壊れているものを直すのに、テストは不要です。すぐに直しましょう。

A/Bテスト設計のチェックリストとよくある失敗

テスト開始前に、次の項目を確認してください。

  • 仮説が「誰が・なぜ・どう変わるか」の形で書かれている
  • 主指標が一つに絞られ、定義と計算方法が決まっている
  • 副指標(悪化してはいけない指標)が決まっている
  • 必要なサンプル数を見積もり、集まる期間を確認した
  • 期間が曜日の影響を一巡する長さになっている
  • 判定基準(採用・不採用・保留)を事前に文書にした
  • セグメント別に見たい場合は、その切り口を事前に決めた
  • 両パターンで計測が正しく動くことを確認した
  • 同じ時期に大きなキャンペーンやリリースが重ならない

よくある失敗としては、次のようなものがあります。テストの途中で他の画面を変更してしまい、結果が汚れる。パターンBだけ表示が遅く、内容ではなく速度の差を測ってしまう。結果を記録せず、半年後に同じテストを繰り返す。いずれも、計画書と結果の記録を残す習慣で防げます。

結果の記録と共有の仕方

テストの価値は、一回の採否だけでなく、組織に残る学びにあります。結果は次の形式で記録しておくと、後から振り返りやすくなります。

  • テストの名前と期間、対象のページ
  • 仮説(なぜ変わると考えたか)
  • 各パターンの内容(画面のキャプチャや変更点の説明)
  • 主指標と副指標の結果、差の大きさ、統計的な判断
  • 採否の判断と、その理由
  • 学び(仮説は支持されたか、次に何を試すか)

記録は一か所に集め、新しくテストを企画するときに過去の記録を確認する習慣を作ります。過去に同じ仮説を検証していれば、重複を避けられます。共有の場では、成功したテストだけでなく、差が出なかったテストや仮説が外れたテストも同じように紹介します。外れたテストの共有を避けると、組織は成功しそうなテストばかりを選ぶようになり、大胆な仮説が出にくくなります。

よくある質問

Q. A/Bテストのツールは何を選べばよいですか?

まず、自社サイトやアプリの構成で無理なく導入できるか、使っている分析ツールと計測の定義をそろえられるか、を確認してください。ツールの機能差よりも、計測の正しさと運用のしやすさのほうが結果の質に影響します。

Q. 3パターン以上を同時に比べてもよいですか?

可能ですが、パターンを増やすほど各グループの人数が減り、必要な期間が延びます。また、比べる組み合わせが増えるほど偶然の差が出やすくなります。流入が限られている場合は、2パターンで一つずつ確かめるほうが確実です。複数の要素を同時に検証する方法には多変量テストもあります。

Q. テストの結果、差がありませんでした。無駄だったのでしょうか?

無駄ではありません。「この変更では大きな改善は起きない」という知見が得られ、より影響の大きい別の仮説に資源を回す判断ができます。結果と仮説を記録しておくことが大切です。

Q. 有意水準は必ず決まった値にしなければなりませんか?

一般に使われる慣例的な水準はありますが、間違った採用による損失と、良い施策を見逃す損失のどちらが大きいかで考える余地があります。戻すのが簡単な小さな変更と、戻しにくい大きな変更では、求める確からしさを変えてもかまいません。いずれにしても、テスト前に決めておくことが重要です。

Otsumuに相談できること

十分な流入があり、テストツールと計測が整っていて、仮説を立てられる担当者がいる場合は、この記事の計画書の型を使って社内でA/Bテストを回していけます。最初は小さなテストを確実に回し、結果を記録する習慣を作ることが何より大切です。

一方で、そもそもテストに必要な計測が整っていない、流入が少なくテストの結論が出ない、結果の解釈で社内の意見が割れる、テストの実装に開発の手が回らない、といった状況では、計測の整備から施策の選び方までを一緒に設計できる相手がいると進めやすくなります。

Otsumuは自らも事業を手がける立場から、改善の仮説づくり、テスト計画、計測の整備、画面や機能の実装までを一気通貫で支援しています。KPI改善コンサルティングでは、テストをすべきか別の方法で判断すべきかの見極めも含め、限られた流入と開発の時間を最も効果の見込める施策に使えるようお手伝いします。

テスト計画書を見てほしい、結果の読み方を相談したい、という段階からご相談いただけます。まずは30分の無料相談で状況をお聞かせください。

この記事について

Otsumu株式会社が執筆しました。統計値や他社の事例には依拠せず、進め方と判断の枠組みを中心にまとめています。法務・税務・会計などの制度は、専門家や公的窓口で最新の情報をご確認ください。

執筆:Otsumu株式会社 / 編集日 2026.10.01

あわせて読む

次の一手を、一緒に。

事業の検証から開発・運用まで、現在の段階に合わせて支援します。

事業について相談する ↗
FROM KNOWLEDGE TO ACTION

知識を、次の一手へ。

30分の無料診断で、次の一手を整理する ↗