TAG / TOPIC

Benchmark

「Benchmark」に関するAIニュースと解説記事の一覧です。

02 STORIES

LATEST STORIES

Benchmarkの新着記事

タグ一覧

RESEARCH / 04

StationeryBenchでGPT-6 Astraが両腕ロボット操作100試行中7件完遂 — 比較対象のMolmoAct2は0件、平均進捗は46対12

Robocurveが2026年9月10日に公開したStationeryBench(両腕ロボット5課題・計200試行)でGPT-6 Astraが7/100完遂・平均進捗46、MolmoAct2が0/100・平均12だったとする一次情報(レポート・GitHub)を整理。課題構成、採点方法、タスク別結果、制約条件を扱う。

RESEARCH / 04

Hugging FaceとHume AI、音声認識の「ベンチマーク最適化」を定量化 — 上位モデルほど誤った参照書き起こしを再現

Hugging Face Blogで2026年8月21日に公開されたHume AIらによる研究「Measuring benchmark optimization in speech recognition」を紹介。VoxPopuli・LibriSpeechを用いた3つのプローブ(consensus disagreement/masked entity retrieval/orthographic switching)で、11のオープンな音声認識モデルのベンチマーク最適化(benchmaxxing)を定量化。WERが低いモデルほど誤った参照を再現する傾向や、無音化した数値の復元、綴り揺れのベンチマーク準拠など、スコアが汎化性能を過大評価している可能性を実証した。