評価データセットとは
評価データセットとは、AIが正しく、期待どおりに動いているかを確かめるために用意する、「入力」と「期待する答えや採点基準」の組の集まりのことです。
平易に言えば、「AIに解かせる模擬試験の問題集と解答例」です。プロンプトを書き換えたとき、モデルを切り替えたとき、参照資料を増やしたときに、同じ問題集を解かせて点数を比べることで、改善したのか悪化したのかを感覚ではなく数字で判断できるようになります。
英語では evaluation dataset、略して eval とも呼ばれます。機械学習の分野では、学習に使うデータとは別に、性能を測るためのデータを取り分けておくのが基本で、その考え方を生成AIの業務利用にも当てはめたものです。
仕組み・ポイント
生成AI向けの評価データセットは、一般に次のような項目で構成します。
| 項目 | 内容 | 例 |
|---|---|---|
| 入力 | 実際の利用を想定した質問や文書 | 「有給休暇の繰越はできますか」 |
| 期待する答え | 正解、または含むべき要素 | 「繰越可能」「上限日数」「規程の条番号」 |
| 採点基準 | 何をもって合格とするか | 根拠の条文を示していれば合格 |
| 分類 | 問題の種類や難易度 | 規程質問/難/表を含む |
| 出典 | 正解の根拠となる資料 | 就業規則 第○条 |
採点のしかたは、仕事の種類によって選びます。
- 完全一致・ルール判定:分類や抽出など、答えが一つに決まる仕事に向きます。
- 要素の有無:「必ず触れるべき点」を挙げ、含まれているかを確かめます。
- 人による採点:表現の良し悪しなど、機械的に判定しにくい場合に使います。
- AIによる採点:採点基準を渡して別のAIに点を付けさせる方法で、大量の採点に向きます。
問題の数は多いほど良いというより、実際の利用で起きる入力の種類を偏りなく含むことが大切です。最初は数十問でも、よくある質問、間違えやすい質問、答えてはいけない質問をバランスよく入れれば、十分に役立ちます。
実務での使い方・具体例
ある会社が、社内規程に答えるAIチャットボットを作ったとします(架空の例)。開発の初期に、総務担当者が過去に受けた質問から50問を選び、正解と根拠の条文を書き出しました。そのうえで次の手順で運用しています。
- 新しいプロンプトや検索設定を試すたびに、50問を一括で解かせる
- 合格率と、不合格になった問題の内容を一覧で確認する
- 改善で合格率が上がっても、以前は正解できた問題を落としていないかを見る
- 本番で利用者から「間違っていた」と報告された質問を、評価データセットに追加する
この運用によって、「担当者が数問試して良さそうだったから本番に出す」という判断から脱却でき、変更のたびに品質を説明できるようになりました。
評価データセットは、次のような場面でも役立ちます。
- 複数のモデルやサービスを比較し、採用するものを決める
- モデル提供元の更新で、回答の傾向が変わっていないかを定期的に確かめる
- 開発を外部に委託する際に、受け入れの基準として発注側と共有する
- 経営層や利用部門に、AIの品質を数字で説明する
特に外部に開発を依頼する場合、評価データセットを発注側が持っていると、「どこまでできれば完成か」の認識をそろえやすくなります。
よくある誤解と注意点
評価用の問題を改善作業に使い回さないことです。 特定の問題に合わせてプロンプトを調整し続けると、その問題集でだけ点が高い状態になります。改善の検討に使う問題と、最終確認に使う問題を分けておくと安全です。
正解を作る人を決めておく必要があります。 業務知識を持つ担当者が正解を確認しないと、評価そのものが誤ります。開発者だけで作らず、現場の担当者と一緒に作りましょう。
一度作って終わりではありません。 業務や規程が変われば正解も変わります。資料の更新に合わせて評価データセットも見直す担当と時期を決めておくことが大切です。
合格率だけを見ないことも大切です。 全体の数字が同じでも、重要な質問を落として簡単な質問を拾っている場合があります。分類ごとの結果と、不合格の中身を必ず確認しましょう。
答えてはいけない質問も入れておきましょう。 業務範囲外の質問や、資料に答えがない質問に対して、AIが推測で答えず「分からない」と返せるかも重要な品質です。正解を答える問題だけでなく、断るべき問題を含めることで、本番での思わぬ誤回答を防げます。
関連用語
- LLM-as-a-Judge:評価データセットの採点をAIに任せる手法
- 適合率・再現率(Precision・Recall):検索や分類の精度を測る代表的な指標
- アノテーション:正解やラベルを人が付ける作業
- グラウンディング:AIの回答を根拠資料に結びつける考え方。根拠の確認も評価項目になる
- 実践記事:生成AIの出力品質をどう評価するか:評価セットと採点基準の作り方
Otsumuに相談できること
評価データセットを持たずに生成AIを運用すると、改善の判断が担当者の感覚頼みになり、本番での品質低下にも気づきにくくなります。Otsumuでは、開発の初期に現場の方と一緒に評価の問題と基準を作り、変更のたびに品質を確かめられる形で生成AIシステム開発を進めています。
「今のAIの精度をどう測ればよいか分からない」という段階からでもご相談ください。30分の無料相談で状況をお聞きします。
執筆:Otsumu株式会社 / 編集日 2026.10.01
この用語に関連する開発メニューは、LLM評価・プロンプト運用基盤の構築です。
- 変更の影響を測れる評価の仕組み
- プロンプトとログの一元管理
- 品質とコストを継続して監視