TAG / TOPIC

ベンチマーク

「ベンチマーク」に関するAIニュースと解説記事の一覧です。

19 STORIES

LATEST STORIES

ベンチマークの新着記事

タグ一覧

RESEARCH / 04

Microsoftがエージェント評価環境「ThinkingBox」を公開 — 応答ではなくDBの最終状態で採点、507業務×20回試行

Microsoftは2026年10月3日、AIエージェント評価環境ThinkingBoxとベンチマークThinkingBox-BenchをHugging Face Blogで公開した。507件の状態付き業務ワークフローを各20回実行し、DBの最終状態と副作用で採点する設計、12モデル約12万試行の分析結果、MITライセンスのフレームワークとデータセット公開を一次情報に基づき整理する。

MODELS / 01

Google DeepMind、次世代フロンティアモデル「Gemini 4 Argon」を発表 — 防御側への段階公開、出力上限100万トークン

Google DeepMindが2026年9月30日に次世代フロンティアモデルGemini 4 Argonを発表。長時間・多段階の実務ワークフロー向けに設計され、ソフトウェア工学・法務金融の知識業務・サイバー防御で最高水準の性能をうたう。出力上限100万トークン、導入価格、評価結果、段階公開と安全策、社内活用実績を一次情報に基づき整理する。

COMPUTE / 06

KTのAIモデルルーターが公開ベンチマークRouter Arenaで2位に — 精度とコストを両立するTDL方式をオープンソース公開

韓国KTのAutoModelRouter(KT-ModelRouter)がRouter ArenaのAcc-Cost Arenaで2位になった発表を一次情報(RouterArenaリーダーボード、KTのGitHubリポジトリ)に基づき整理。TDL分類・Pareto frontierによるルーティング方式、1,976件の較正クエリと8,400件のテストクエリでの評価、再現性の範囲を扱う。

RESEARCH / 04

ARC Prize、GPT-6 AstraのARC-AGI-3評価を公開 — 標準条件で62.7%、人間より少ない手数で96%のレベルを解く

ARC PrizeがOpenAIのGPT-6 AstraをARC-AGI-3で評価した結果を公開。Standardハーネスで62.7%(約2.6万ドル)、Provider Adapterハーネスで99.9%(約1.9万ドル)といずれもSOTA。約500人の人間ベースラインとの手数比較、独自の記号モデル、PRO-LONGでの自作ツール、今後の両条件併記方針を一次情報に基づき整理。

RESEARCH / 04

BenchMIRT: LLMベンチマークは本当に何を測っているのか — Allen Instituteが100モデル・3.4万問で監査

Allen Institute for AI(Ai2)がHugging FaceでBenchMIRTを公開。多次元項目反応理論でLLMベンチマーク16種・3.4万問を分析し、各設問が安全性と推論のどちらを測るかを分離。BBQの推論寄り、WMDPの負の相関、HarmBench内の異質性などを一次情報に基づき整理。

RESEARCH / 04

Artificial Analysisが「Search Index」公開 — AIエージェント向け検索APIを同一条件で比較する新ベンチマーク

独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェントの検索APIを比較する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を対象に、GPT-5.6 Luna(medium)を候補モデル、Stirrupハーネス(web_search・web_fetch・finish、最大25ターン)を固定して、検索プロバイダだけを変える同一条件で評価する。品質指標はDeepSearchQA(F1)・BrowseComp(正解率)・AA-Omniscience(正解率)の等加重平均。検索なしのモデル単体ベースライン(33点)に対し、上位はParallel Search(advanced)75点、Exa Search(auto)74点、Firecrawl Search 73点など。コスト(タスクあたり)と速度(タスクごとの所要時間)も併せて比較する。数値は全てArtificial Analysisの公開データに基づく。

RESEARCH / 04

Qwen3.8-27B、独立評価のArtificial Analysisインテリジェンス指標で52点 — 27BオープンウェイトがGPT-5.6 Luna級に

第三者のベンチマーク機関Artificial Analysisは2026年8月17日前後、Alibaba Qwen製の27Bオープンウェイトモデル「Qwen3.8-27B」の評価結果を公開した。インテリジェンス指標(9種の評価の複合)で52点を記録し、同指標でGPT-5.6 Luna(max)と同点、GLM-5.2(max)より1点低い水準。小規模なオープンウェイトモデルがフロンティア級のスコアに並んだ点が注目される一方、評価中の出力トークン数は160Mで中央値(43M)の約3.7倍と非常に冗長で、効率面の課題も明らかになった。数値は全てArtificial Analysis(一次情報)および同指標のデータに基づく。

RESEARCH / 04

Alibaba Accio、実業務を再現するエージェント用ベンチマーク「RealReplicaBench」公開 — 107タスクで最上位モデルも完遂率は約62%

Alibaba InternationalのAccioチーム(电商AI AgentプラットフォームAccio Workを開発)が、実サービスを再現するローカルレプリカ上でエージェントのタスク完遂能力を評価するRealReplicaBenchをGitHubで公開(v1.3.1)。107タスクは53 CLI・28ブラウザ・16ファイル・10 API/MCPで構成され、65がテキストのみ、20がブラウザ+テキスト、22が視覚情報必須。各タスクはフレッシュなコンテナで実行され、決定論的またはLLM支援の検証器が採点する。12モデルファミリーをOpenClaw/Accioの2ハーネスで評価した結果、最上位はClaude Opus 5の60/107(56.1%, OpenClaw)と66/107(61.7%, Accio)、次いでClaude Opus 4.8(51.4%/55.1%)、GPT-5.6 Sol(49.5%/51.4%)。Qwen 3.8 MaxはAccioハーネスでOpus 4.7と並ぶ56/107(52.3%)。採点ジャッジはgemini-3.1-pro-previewで、スコアはAccio管理の評価エンドポイントによる。ハーネス・コードはApache 2.0、タスクセットはCC BY 4.0で公開され、ライブリーダーボードも運用中。

RESEARCH / 04

「共同科学者」としてのLLMの研究誠実性を測る「IntegrityBench」— ピーク圧力下で約3回に1回、誠実性に関わる判断を誤る

arXiv:2608.12345で公開された「Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists」を、アブストラクトの一次情報に基づいて整理する。IntegrityBenchの設計(36対タスク・5段階圧力プロトコル・3領域・4研究段階)、18モデルでの評価結果、3側面の乖離とデプロイリスクを解説する。