MODELS / 01
Anthropic、最小モデル「Claude Haiku 5.5」を公開 — Haiku 4.5比で実行コスト約75%減をうたう
Anthropicが2026年10月7日に発表したClaude Haiku 5.5を一次情報に基づき整理。ベンチマーク公称値、100kトークンを境とする新料金体系、対応プラットフォーム、安全対策、Sonnet 5.5のキャッシュ値下げとAPIクレジットを扱う。
TAG / TOPIC
「LLM」に関するAIニュースと解説記事の一覧です。
09 STORIES
LATEST STORIES
MODELS / 01
Anthropicが2026年10月7日に発表したClaude Haiku 5.5を一次情報に基づき整理。ベンチマーク公称値、100kトークンを境とする新料金体系、対応プラットフォーム、安全対策、Sonnet 5.5のキャッシュ値下げとAPIクレジットを扱う。
PRODUCTS / 03
GitHubは2026年9月14日、Copilot の自動モデル選択に efficiency・balance・intelligence の3段階を追加したと発表した。プロンプトごとに最適なモデルを自動選択する仕組みは維持しつつ、コストと品質の重み付けを利用者が選べる。VS Code・CLI・アプリで順次提供。
AGENTS / 02
OpenHandsがv1.16.0を公開。LLMプロバイダ選択、Canvas Extensions、Linuxデスクトップインストーラなどの機能追加と多数のバグ修正を含む。GitHubで8.3万スターを集めるオープンなAIエージェントプラットフォームの最新安定版。
MODELS / 01
IBMが推論特化のGranite 4.2(3B/8B/30B)をApache 2.0で公開。512Kコンテキスト、思考/非思考切替、8B/30BのAgentic RLなどビルド手法を解説。
BUSINESS / 05
Thomson Reutersは2026年8月24日、独自の大規模言語モデル「Thomson」を発表。オープンソース基盤にWestlawやPractical Law等の独自コンテンツと数百名の専門家による学習で、4000万ドルの投資でフロンティア級性能を実現したと説明。Claude Opus 4.8に匹敵、GPT-5.5等を上回るとする社内ベンチマークを提示し、CoCounsel Legalで展開する。
GOVERNANCE / 07
OWASP GenAI LLM Top 10 2026(2026年8月4日公開)。数百人のAIセキュリティ専門家によるコミュニティ開発の最新版。数千件の実インシデント分析に基づく初のデータ駆動型ランキングを導入し、LLM01:2026 Prompt Injectionが1位を維持。Excessive Agency(過剰権限)が3位に浮上、Hidden Context Exposureが新規参入、Improper Output Handlingは5位→10位へ降下。NIST・MITRE ATLAS・CWE・OWASP Top 10 for Agentic Applicationsへのマッピングを備える。ライセンスはCC BY-SA 4.0。
RESEARCH / 04
arXiv 2608.13567。Pengrui Han氏・Jacob Andreas氏・Evelina Fedorenko氏・Andrea Gregor de Varda氏(MIT)。attribution patchingによる回路解析を言語・形式的推論・物理推論・社会的推論の46タスクで実施し、同じ認知領域に属するタスクはLLM内でも同じニューロン群を共有する(領域内オーバーラップ12.9% vs 領域間3.0%、約4.3倍)ことを確認。ドメイン別ニューロンの切除で当該領域だけ精度が25.9%低下(領域間切除は2.5%)と因果的にも特異的。6つのインストラクションチューニング済みLLM(24B〜123B・4ファミリ)すべてで同構造が出現し、能力の不十分なGPT-2では構造が現れない。
RESEARCH / 04
arXiv:2608.12345で公開された「Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists」を、アブストラクトの一次情報に基づいて整理する。IntegrityBenchの設計(36対タスク・5段階圧力プロトコル・3領域・4研究段階)、18モデルでの評価結果、3側面の乖離とデプロイリスクを解説する。
PRODUCTS / 03
LLMで大規模な分類語彙に出力を制約する際、構造化出力で全語彙を送る従来方式はプロンプト肥大・上限・コストが課題になる。Doug Turnbull氏が公開した「Don't classify. Hallucinate!」は、小型LLMに仮想的な分類を生成させ、実在分類の埋め込みインデックスとの類似度で解決するパターンを提案する。一次情報に基づいて整理する。