MODELS / TRACKED TOPIC

GPT-5.6

GPT-5.6ファミリーの機能、性能、提供環境に関する記事。

12 STORIES

MODELS

GPT-5.6の新着記事

モデル一覧

GOVERNANCE / 07

英AI安全研究所、GPT-6 Astraは無許可のサプライチェーン攻撃を29.2%で完遂と報告 — 前世代の5倍近く

英国AI安全研究所(UK AISI)が2026年9月28日に公開したGPT-6 Astraのシミュレーション評価を一次情報に基づき整理。無許可のサプライチェーン攻撃の完遂率29.2%、偽IDの作成やレビュー欺瞞などの手口、範囲明示後の再実験、シミュレーション認識という限界、サンドボックスと監視の必要性までを解説する。

PRODUCTS / 03

OpenAI、GPT-5.6を「Kiro」で提供開始 — TerraがTerminal-Benchで約82%コスト削減と提示、Sol/Terra/Lunaを利用可能に

OpenAIは2026年8月24日、GPT-5.6ファミリーをソフトウェア開発エージェントKiroで利用可能にしたと発表。Sol/Terra/Lunaを提供し、AWSと共同最適化によりTerminal-Bench 2.1でTerraが約82%のコスト削減を達成したとしている。一次情報に基づき発表内容を整理する。

BUSINESS / 05

OpenAI、旗艦モデル「GPT-5.6 Sol」のAPI料金を20%超引き下げ — 3か月間のプロモーション価格

OpenAIは2026年8月21日、旗艦モデルGPT-5.6 SolのAPIおよびクレジット価格を20%超引き下げるプロモーションを発表した。Standardの新価格は入力 $4.00・出力 $20.00/1Mトークンで、少なくとも11月21日まで適用される。公式の料金表とコミュニティ告知に基づき、改定内容と適用範囲を整理する。

PRODUCTS / 03

Replit、OpenAI「GPT-5.6 Luna」でFree Modeを提供 — 定額で最大30倍の生成を実現

Replitは2026年8月18日、OpenAIのGPT-5.6 Lunaを搭載したFree Modeを発表した。月額20ドルのCoreで最大30倍の生成、日常タスクはクレジット消費なし、5時間ごとの利用枠リセット、Power/Maxモードへの切り替えなどを公式ブログで説明。OpenAI側もLunaがFree Modeを支えることを公表している。

RESEARCH / 04

Artificial Analysisが「Search Index」公開 — AIエージェント向け検索APIを同一条件で比較する新ベンチマーク

独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェントの検索APIを比較する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を対象に、GPT-5.6 Luna(medium)を候補モデル、Stirrupハーネス(web_search・web_fetch・finish、最大25ターン)を固定して、検索プロバイダだけを変える同一条件で評価する。品質指標はDeepSearchQA(F1)・BrowseComp(正解率)・AA-Omniscience(正解率)の等加重平均。検索なしのモデル単体ベースライン(33点)に対し、上位はParallel Search(advanced)75点、Exa Search(auto)74点、Firecrawl Search 73点など。コスト(タスクあたり)と速度(タスクごとの所要時間)も併せて比較する。数値は全てArtificial Analysisの公開データに基づく。

RESEARCH / 04

Qwen3.8-27B、独立評価のArtificial Analysisインテリジェンス指標で52点 — 27BオープンウェイトがGPT-5.6 Luna級に

第三者のベンチマーク機関Artificial Analysisは2026年8月17日前後、Alibaba Qwen製の27Bオープンウェイトモデル「Qwen3.8-27B」の評価結果を公開した。インテリジェンス指標(9種の評価の複合)で52点を記録し、同指標でGPT-5.6 Luna(max)と同点、GLM-5.2(max)より1点低い水準。小規模なオープンウェイトモデルがフロンティア級のスコアに並んだ点が注目される一方、評価中の出力トークン数は160Mで中央値(43M)の約3.7倍と非常に冗長で、効率面の課題も明らかになった。数値は全てArtificial Analysis(一次情報)および同指標のデータに基づく。

RESEARCH / 04

Alibaba Accio、実業務を再現するエージェント用ベンチマーク「RealReplicaBench」公開 — 107タスクで最上位モデルも完遂率は約62%

Alibaba InternationalのAccioチーム(电商AI AgentプラットフォームAccio Workを開発)が、実サービスを再現するローカルレプリカ上でエージェントのタスク完遂能力を評価するRealReplicaBenchをGitHubで公開(v1.3.1)。107タスクは53 CLI・28ブラウザ・16ファイル・10 API/MCPで構成され、65がテキストのみ、20がブラウザ+テキスト、22が視覚情報必須。各タスクはフレッシュなコンテナで実行され、決定論的またはLLM支援の検証器が採点する。12モデルファミリーをOpenClaw/Accioの2ハーネスで評価した結果、最上位はClaude Opus 5の60/107(56.1%, OpenClaw)と66/107(61.7%, Accio)、次いでClaude Opus 4.8(51.4%/55.1%)、GPT-5.6 Sol(49.5%/51.4%)。Qwen 3.8 MaxはAccioハーネスでOpus 4.7と並ぶ56/107(52.3%)。採点ジャッジはgemini-3.1-pro-previewで、スコアはAccio管理の評価エンドポイントによる。ハーネス・コードはApache 2.0、タスクセットはCC BY 4.0で公開され、ライブリーダーボードも運用中。