COMPANIES / TRACKED TOPIC

AI2

Allen Institute for AIのモデル、研究、公開ツールに関する記事。

07 STORIES

COMPANIES

AI2の新着記事

企業一覧

COMPUTE / 06

Ai2、MoE学習基盤「Olmo-core 3」を公開 — 1兆パラメータ級のオープンな学習スタック

アレンAI研究所(Ai2)が2026年10月1日にMoE学習フレームワーク「Olmo-core 3」を公開した。エキスパート並列・パイプライン並列・分散オプティマイザに加え、GPU常駐ルーティングやMXFP8対応で1兆パラメータ級の学習に対応。次世代Olmoの基盤にもなる完全オープンの学習スタックを一次情報に基づき整理する。

RESEARCH / 04

RoboHarm:危険指示に対するフロンティア・ロボットポリシーの拒否を実機300試行で評価 — Fable 5.1は20件拒否、Astraは2件

Robocurveが2026年9月18日に公開した実機安全ベンチマークRoboHarm。同一の両腕YAMアームでClaude Fable 5.1、GPT-6 Astra、MolmoAct2に5種の危険指示を各20試行ずつ与え、人手で採点。安全理由の拒否はFable 20/100、Astra 2/100、MolmoAct2 0/100、完遂は順に34・60・6件だった。

RESEARCH / 04

StationeryBenchでGPT-6 Astraが両腕ロボット操作100試行中7件完遂 — 比較対象のMolmoAct2は0件、平均進捗は46対12

Robocurveが2026年9月10日に公開したStationeryBench(両腕ロボット5課題・計200試行)でGPT-6 Astraが7/100完遂・平均進捗46、MolmoAct2が0/100・平均12だったとする一次情報(レポート・GitHub)を整理。課題構成、採点方法、タスク別結果、制約条件を扱う。

RESEARCH / 04

BenchMIRT: LLMベンチマークは本当に何を測っているのか — Allen Instituteが100モデル・3.4万問で監査

Allen Institute for AI(Ai2)がHugging FaceでBenchMIRTを公開。多次元項目反応理論でLLMベンチマーク16種・3.4万問を分析し、各設問が安全性と推論のどちらを測るかを分離。BBQの推論寄り、WMDPの負の相関、HarmBench内の異質性などを一次情報に基づき整理。

PRODUCTS / 03

AI2「OlmoEarth Studio」、地球観測の埋め込みベクトルを書き出せるように — 類似性検索・数ピクセルからのセグメンテーション・変化検出に対応

AI2(Allen Institute for AI)が2026年8月12日、地球観測モデル構築プラットフォーム「OlmoEarth Studio」で埋め込みベクトルの計算・エクスポート機能を発表した。エンコーダの選択肢、出力形式、応用例を一次情報に基づいて整理する。