RAGの評価データを作る方法|最初の10問と採点基準

RAGの評価データを作る方法|最初の10問と採点基準 エンジニア
RAGの評価データを作る方法|最初の10問と採点基準

RAGの評価データを作る方法|最初の10問と採点基準

更新日:2026年9月29日

文書検索を使うAIは、答えの自然さだけでなく、根拠を正しく選べたかを評価します。

対象は、FAQや社内文書を検索して回答する仕組みを試す開発者です。10問は着手用の例で、品質保証に必要な件数ではありません。

10問の内訳

答えがある質問3、言い換え2、答えがない質問2、条件不足2、誤答を誘う質問1を用意します。各問に期待回答、根拠ID、回答を控える条件を付けます。

id,question,expected,source_id,allow_answer
q01,国内送料はいくら?,500円,shipping,true
q02,海外送料はいくら?,記載なし,shipping,false
q03,返品期限は?,30日,returns,true

評価データの正解は、検索結果ではなく原文と照合して作ります。allow_answer=false の質問で、モデルが推測した金額を返したら不合格です。

採点

項目 合格条件
検索 正しい文書を取得する
根拠 回答の主張と文書が一致する
拒否 情報がないとき不明とする
形式 必要な項目が欠けない

変更前後で同じ質問を使い、良くなった回答だけでなく悪化した回答も記録します。調整用と最終確認用の質問を分け、最終確認データで指示を調整しません。

完了条件

10問すべてに期待回答・根拠ID・不明時の条件があり、検索・根拠・拒否・形式の4項目を採点できれば一区切りです。

失敗例

検索順位だけを測ると、正しい文書を取得しても回答が誤っている問題を見逃します。逆に回答文だけを採点すると、根拠のない正答を合格にしてしまいます。検索結果、生成回答、採点理由を別々に保存します。

出典

コメント

タイトルとURLをコピーしました