DEMO
RESEARCH / RESEARCH NOTE
長文推論の自己検証を測る架空ベンチマーク『MirrorBench』公開
答えの正しさだけでなく、途中で誤りを発見して修正できるかを測る研究用データセットです。
架空の研究グループSeicho Instituteは、長文推論中の自己検証能力を測るデータセット「MirrorBench」を公開した、という想定だ。問題には意図的に不足情報や紛らわしい前提が含まれ、モデルが途中の矛盾に気づき、回答方針を修正できるかを観察する。これはサイト表示確認用の架空デモ記事であり、実在の論文や評価結果ではない。
正解だけでは見えない挙動
デモ設定の課題は、科学記事の比較、複数条件を含む計画、出典が不完全な要約などで構成する。最終回答が合っていても、根拠のない断定や偶然の一致は低く評価する。
- 矛盾する前提を指摘できたか
- 不足情報を質問として返せたか
- 修正後も元の制約を維持できたか
スコアを失敗地図として読む
研究チームは総合順位より、見落とし、過剰修正、回答回避といった失敗パターンの分布を公開する想定だ。同じ総合点でも改善すべき箇所はモデルごとに異なるためだ。ただし、説明文がもっともらしいだけで内部推論を証明できるわけではない。評価データへの過適合を避けるため、一部課題は期間限定で入れ替える構成としている。