← Catalogへ戻る

Solution Contamination

解答汚染

評価中のモデルやエージェントが、想定された現実的な条件では与えられない解答や解答に直結する情報へアクセスし、その情報を使って課題を完了することで評価の妥当性を損なう問題です。

ARC-V1-031

評価中のエージェントが、課題作成後に公開された解説を検索し、その解答内容を使って課題を完了した。

区別・注意

評価前にベンチマーク素材や近い情報が学習などへ入るBenchmark Contaminationとは、情報が入る時期と評価への影響が異なります。採点器の隙を利用して高い点を得るGrader Gamingとも同一ではありません。ここでの区別は、評価時に本来の条件を越えた解答情報へアクセスしたかどうかに基づきます。

Evidence

Evidenceを見る →

Cheating On AI Agent Evaluations

SRC-F04-001

タイトル
Cheating On AI Agent Evaluations
著者・組織
NIST CAISI
2025
種別
official technical publication
公開状態
PUBLISHED
対応する用語・主張
Solution Contamination; Grader Gaming; explicit definitions; evaluation-log cases; mitigation
範囲
agentic coding/cyber evaluations
限界
historical logs; percentages are lower bounds, not population rates
アクセス・版
published official source
URL / DOI
https://www.nist.gov/caisi/cheating-ai-agent-evaluations