MODELS / 01
TIIが音声認識モデル「Falcon-ASR」を公開 — 16億パラメーター、アラビア語WER 20.92%を報告
UAEのTIIが2026年10月7日に発表した音声認識モデルFalcon-ASRを公式発表の一次情報から整理する。16億パラメーターの構成、アラビア語・首長国方言・英語の公称評価、単語タイムスタンプや5言語同一重み対応を解説。
TAG / TOPIC
「ベンチマーク」に関するAIニュースと解説記事の一覧です。
19 STORIES
LATEST STORIES
MODELS / 01
UAEのTIIが2026年10月7日に発表した音声認識モデルFalcon-ASRを公式発表の一次情報から整理する。16億パラメーターの構成、アラビア語・首長国方言・英語の公称評価、単語タイムスタンプや5言語同一重み対応を解説。
MODELS / 01
Anthropicが2026年10月7日に発表したClaude Haiku 5.5を一次情報に基づき整理。ベンチマーク公称値、100kトークンを境とする新料金体系、対応プラットフォーム、安全対策、Sonnet 5.5のキャッシュ値下げとAPIクレジットを扱う。
MODELS / 01
UAEのTIIが2026年10月6日に発表した方言特化モデルFalcon-Emirati-7Bを公式発表の一次情報から整理する。Falcon-H1-Arabicベースの構成、3系統のデータ戦略、Alyahベンチマーク84.83%やLLMジャッジ評価の公称結果を解説。
RESEARCH / 04
Microsoftは2026年10月3日、AIエージェント評価環境ThinkingBoxとベンチマークThinkingBox-BenchをHugging Face Blogで公開した。507件の状態付き業務ワークフローを各20回実行し、DBの最終状態と副作用で採点する設計、12モデル約12万試行の分析結果、MITライセンスのフレームワークとデータセット公開を一次情報に基づき整理する。
MODELS / 01
Google DeepMindが2026年9月30日に次世代フロンティアモデルGemini 4 Argonを発表。長時間・多段階の実務ワークフロー向けに設計され、ソフトウェア工学・法務金融の知識業務・サイバー防御で最高水準の性能をうたう。出力上限100万トークン、導入価格、評価結果、段階公開と安全策、社内活用実績を一次情報に基づき整理する。
COMPUTE / 06
韓国KTのAutoModelRouter(KT-ModelRouter)がRouter ArenaのAcc-Cost Arenaで2位になった発表を一次情報(RouterArenaリーダーボード、KTのGitHubリポジトリ)に基づき整理。TDL分類・Pareto frontierによるルーティング方式、1,976件の較正クエリと8,400件のテストクエリでの評価、再現性の範囲を扱う。
RESEARCH / 04
Epoch AIが2026年9月23日に公開したFurniture Assembly Benchmark(FAB)の結果を一次情報に基づき整理。3種のIKEA家具・60枚の写真による評価設計、GPT-6 Astraの80%という結果、Claude各モデルとの比較、オープンモデルの遅れ、実時間利用の制約を扱う。
RESEARCH / 04
Forecasting Research Instituteが2026年9月22日に公開したAI進歩予測の精度検証レポートを一次情報に基づき整理。IMO・FrontierMath・収益予測などの具体値、過大評価の例、手法の限界を扱う。
RESEARCH / 04
OpenAIが2026年9月23日に公開したメンタルヘルス会話評価ベンチマークMentalHealthBenchを一次情報に基づき整理。22カ国80人超の専門家によるルーブリック、重み付き採点、10の行動次元、44人の利用者調査、オープン公開の方針を扱う。
MODELS / 01
Googleが2026年9月23日に発表したGemini 3.8 Flash TTS/Flash-Lite TTSを一次情報に基づき整理。声の設計・複製機能、行単位の演出指定、Hume AI・Voice Arenaのベンダー公表評価、提供形態と安全対策を扱う。
RESEARCH / 04
UK AISIとEvalEval Coalitionの連携による再現可能な評価報告の取り組みを一次情報中心に整理。Every Eval Everスキーマ、5ベンチマークと6モデルの公開データ、推論計算量と評価プロトコルの論文を扱う。
MODELS / 01
OpenAIが2026年9月22日に発表したGPT-6 Sol/GPT-6 Lunaを一次情報に基づき整理。API価格、AutomationBench・DeepSWE・OSWorldなどのベンダー公表ベンチマーク、提供形態を扱う。
RESEARCH / 04
Artificial Analysisが2026年9月4日にIntelligence Index v4.2を公開。新評価AA-BriefcaseとGDP.pdfの追加、GPQA Diamondの除外、非公開テスト40%への倍増など変更点を整理し、Claude Fable 5.1首位・GPT-6 Astraの追走という結果を一次情報に基づき伝える。
RESEARCH / 04
ARC PrizeがOpenAIのGPT-6 AstraをARC-AGI-3で評価した結果を公開。Standardハーネスで62.7%(約2.6万ドル)、Provider Adapterハーネスで99.9%(約1.9万ドル)といずれもSOTA。約500人の人間ベースラインとの手数比較、独自の記号モデル、PRO-LONGでの自作ツール、今後の両条件併記方針を一次情報に基づき整理。
RESEARCH / 04
Allen Institute for AI(Ai2)がHugging FaceでBenchMIRTを公開。多次元項目反応理論でLLMベンチマーク16種・3.4万問を分析し、各設問が安全性と推論のどちらを測るかを分離。BBQの推論寄り、WMDPの負の相関、HarmBench内の異質性などを一次情報に基づき整理。
RESEARCH / 04
独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェントの検索APIを比較する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を対象に、GPT-5.6 Luna(medium)を候補モデル、Stirrupハーネス(web_search・web_fetch・finish、最大25ターン)を固定して、検索プロバイダだけを変える同一条件で評価する。品質指標はDeepSearchQA(F1)・BrowseComp(正解率)・AA-Omniscience(正解率)の等加重平均。検索なしのモデル単体ベースライン(33点)に対し、上位はParallel Search(advanced)75点、Exa Search(auto)74点、Firecrawl Search 73点など。コスト(タスクあたり)と速度(タスクごとの所要時間)も併せて比較する。数値は全てArtificial Analysisの公開データに基づく。
RESEARCH / 04
第三者のベンチマーク機関Artificial Analysisは2026年8月17日前後、Alibaba Qwen製の27Bオープンウェイトモデル「Qwen3.8-27B」の評価結果を公開した。インテリジェンス指標(9種の評価の複合)で52点を記録し、同指標でGPT-5.6 Luna(max)と同点、GLM-5.2(max)より1点低い水準。小規模なオープンウェイトモデルがフロンティア級のスコアに並んだ点が注目される一方、評価中の出力トークン数は160Mで中央値(43M)の約3.7倍と非常に冗長で、効率面の課題も明らかになった。数値は全てArtificial Analysis(一次情報)および同指標のデータに基づく。
RESEARCH / 04
Alibaba InternationalのAccioチーム(电商AI AgentプラットフォームAccio Workを開発)が、実サービスを再現するローカルレプリカ上でエージェントのタスク完遂能力を評価するRealReplicaBenchをGitHubで公開(v1.3.1)。107タスクは53 CLI・28ブラウザ・16ファイル・10 API/MCPで構成され、65がテキストのみ、20がブラウザ+テキスト、22が視覚情報必須。各タスクはフレッシュなコンテナで実行され、決定論的またはLLM支援の検証器が採点する。12モデルファミリーをOpenClaw/Accioの2ハーネスで評価した結果、最上位はClaude Opus 5の60/107(56.1%, OpenClaw)と66/107(61.7%, Accio)、次いでClaude Opus 4.8(51.4%/55.1%)、GPT-5.6 Sol(49.5%/51.4%)。Qwen 3.8 MaxはAccioハーネスでOpus 4.7と並ぶ56/107(52.3%)。採点ジャッジはgemini-3.1-pro-previewで、スコアはAccio管理の評価エンドポイントによる。ハーネス・コードはApache 2.0、タスクセットはCC BY 4.0で公開され、ライブリーダーボードも運用中。
RESEARCH / 04
arXiv:2608.12345で公開された「Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists」を、アブストラクトの一次情報に基づいて整理する。IntegrityBenchの設計(36対タスク・5段階圧力プロトコル・3領域・4研究段階)、18モデルでの評価結果、3側面の乖離とデプロイリスクを解説する。