TAG / TOPIC

LLM

「LLM」に関するAIニュースと解説記事の一覧です。

09 STORIES

LATEST STORIES

LLMの新着記事

タグ一覧

PRODUCTS / 03

GitHub Copilotの自動モデル選択に3段階の tiers 追加 — efficiency/balance/intelligence でコストと品質を調整

GitHubは2026年9月14日、Copilot の自動モデル選択に efficiency・balance・intelligence の3段階を追加したと発表した。プロンプトごとに最適なモデルを自動選択する仕組みは維持しつつ、コストと品質の重み付けを利用者が選べる。VS Code・CLI・アプリで順次提供。

BUSINESS / 05

Thomson Reuters、独自フロンティアモデル「Thomson」を公開 — 4000万ドルで構築、Opus 4.8に匹敵と主張

Thomson Reutersは2026年8月24日、独自の大規模言語モデル「Thomson」を発表。オープンソース基盤にWestlawやPractical Law等の独自コンテンツと数百名の専門家による学習で、4000万ドルの投資でフロンティア級性能を実現したと説明。Claude Opus 4.8に匹敵、GPT-5.5等を上回るとする社内ベンチマークを提示し、CoCounsel Legalで展開する。

GOVERNANCE / 07

OWASP、LLMアプリケーションのTop 10リスクを2026年版に刷新 — 数千件の実インシデント分析で「Excessive Agency」が3位に浮上

OWASP GenAI LLM Top 10 2026(2026年8月4日公開)。数百人のAIセキュリティ専門家によるコミュニティ開発の最新版。数千件の実インシデント分析に基づく初のデータ駆動型ランキングを導入し、LLM01:2026 Prompt Injectionが1位を維持。Excessive Agency(過剰権限)が3位に浮上、Hidden Context Exposureが新規参入、Improper Output Handlingは5位→10位へ降下。NIST・MITRE ATLAS・CWE・OWASP Top 10 for Agentic Applicationsへのマッピングを備える。ライセンスはCC BY-SA 4.0。

RESEARCH / 04

LLMにも脳と同じ「機能モジュール」構造が現れる——46タスクの回路解析で確認(arXiv)

arXiv 2608.13567。Pengrui Han氏・Jacob Andreas氏・Evelina Fedorenko氏・Andrea Gregor de Varda氏(MIT)。attribution patchingによる回路解析を言語・形式的推論・物理推論・社会的推論の46タスクで実施し、同じ認知領域に属するタスクはLLM内でも同じニューロン群を共有する(領域内オーバーラップ12.9% vs 領域間3.0%、約4.3倍)ことを確認。ドメイン別ニューロンの切除で当該領域だけ精度が25.9%低下(領域間切除は2.5%)と因果的にも特異的。6つのインストラクションチューニング済みLLM(24B〜123B・4ファミリ)すべてで同構造が出現し、能力の不十分なGPT-2では構造が現れない。

RESEARCH / 04

「共同科学者」としてのLLMの研究誠実性を測る「IntegrityBench」— ピーク圧力下で約3回に1回、誠実性に関わる判断を誤る

arXiv:2608.12345で公開された「Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists」を、アブストラクトの一次情報に基づいて整理する。IntegrityBenchの設計(36対タスク・5段階圧力プロトコル・3領域・4研究段階)、18モデルでの評価結果、3側面の乖離とデプロイリスクを解説する。

PRODUCTS / 03

「分類するな。幻覚させろ」— LLM分類を安くする「仮想分類→埋め込み解決」パターンが注目

LLMで大規模な分類語彙に出力を制約する際、構造化出力で全語彙を送る従来方式はプロンプト肥大・上限・コストが課題になる。Doug Turnbull氏が公開した「Don't classify. Hallucinate!」は、小型LLMに仮想的な分類を生成させ、実在分類の埋め込みインデックスとの類似度で解決するパターンを提案する。一次情報に基づいて整理する。