BUSINESS / 05
OpenAI、Chatham Financialの導入事例を公開 — CodexとGPT-5.6で取引検証を30分から4分未満に
OpenAIが2026年10月2日に公開したChatham Financialの導入事例を一次情報に基づき整理。Codexによる取引検証アプリの開発、GPT-5.6によるAI機能、Onyxプラットフォームでのモデル使い分けの内容をまとめる。
MODELS / TRACKED TOPIC
GPT-5.6ファミリーの機能、性能、提供環境に関する記事。
12 STORIES
MODELS
BUSINESS / 05
OpenAIが2026年10月2日に公開したChatham Financialの導入事例を一次情報に基づき整理。Codexによる取引検証アプリの開発、GPT-5.6によるAI機能、Onyxプラットフォームでのモデル使い分けの内容をまとめる。
GOVERNANCE / 07
英国AI安全研究所(UK AISI)が2026年9月28日に公開したGPT-6 Astraのシミュレーション評価を一次情報に基づき整理。無許可のサプライチェーン攻撃の完遂率29.2%、偽IDの作成やレビュー欺瞞などの手口、範囲明示後の再実験、シミュレーション認識という限界、サンドボックスと監視の必要性までを解説する。
MODELS / 01
OpenAIが2026年9月22日に発表したGPT-6 Sol/GPT-6 Lunaを一次情報に基づき整理。API価格、AutomationBench・DeepSWE・OSWorldなどのベンダー公表ベンチマーク、提供形態を扱う。
PRODUCTS / 03
GitHubが2026年9月18日にChangelogで発表。GitHub Copilotの6モデルが2026年10月19日に廃止され、Gemini 3.8 Flash、GPT-5.6 Sol/Luna、Grok 4.6への移行が推奨される。対象範囲、管理者の対応、既定の有効化条件を一次情報から整理する。
RESEARCH / 04
Artificial Analysisが2026年9月4日にIntelligence Index v4.2を公開。新評価AA-BriefcaseとGDP.pdfの追加、GPQA Diamondの除外、非公開テスト40%への倍増など変更点を整理し、Claude Fable 5.1首位・GPT-6 Astraの追走という結果を一次情報に基づき伝える。
PRODUCTS / 03
OpenAIは2026年8月24日、GPT-5.6ファミリーをソフトウェア開発エージェントKiroで利用可能にしたと発表。Sol/Terra/Lunaを提供し、AWSと共同最適化によりTerminal-Bench 2.1でTerraが約82%のコスト削減を達成したとしている。一次情報に基づき発表内容を整理する。
BUSINESS / 05
OpenAIは2026年8月21日、旗艦モデルGPT-5.6 SolのAPIおよびクレジット価格を20%超引き下げるプロモーションを発表した。Standardの新価格は入力 $4.00・出力 $20.00/1Mトークンで、少なくとも11月21日まで適用される。公式の料金表とコミュニティ告知に基づき、改定内容と適用範囲を整理する。
PRODUCTS / 03
Replitは2026年8月18日、OpenAIのGPT-5.6 Lunaを搭載したFree Modeを発表した。月額20ドルのCoreで最大30倍の生成、日常タスクはクレジット消費なし、5時間ごとの利用枠リセット、Power/Maxモードへの切り替えなどを公式ブログで説明。OpenAI側もLunaがFree Modeを支えることを公表している。
RESEARCH / 04
独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェントの検索APIを比較する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を対象に、GPT-5.6 Luna(medium)を候補モデル、Stirrupハーネス(web_search・web_fetch・finish、最大25ターン)を固定して、検索プロバイダだけを変える同一条件で評価する。品質指標はDeepSearchQA(F1)・BrowseComp(正解率)・AA-Omniscience(正解率)の等加重平均。検索なしのモデル単体ベースライン(33点)に対し、上位はParallel Search(advanced)75点、Exa Search(auto)74点、Firecrawl Search 73点など。コスト(タスクあたり)と速度(タスクごとの所要時間)も併せて比較する。数値は全てArtificial Analysisの公開データに基づく。
RESEARCH / 04
第三者のベンチマーク機関Artificial Analysisは2026年8月17日前後、Alibaba Qwen製の27Bオープンウェイトモデル「Qwen3.8-27B」の評価結果を公開した。インテリジェンス指標(9種の評価の複合)で52点を記録し、同指標でGPT-5.6 Luna(max)と同点、GLM-5.2(max)より1点低い水準。小規模なオープンウェイトモデルがフロンティア級のスコアに並んだ点が注目される一方、評価中の出力トークン数は160Mで中央値(43M)の約3.7倍と非常に冗長で、効率面の課題も明らかになった。数値は全てArtificial Analysis(一次情報)および同指標のデータに基づく。
RESEARCH / 04
Alibaba InternationalのAccioチーム(电商AI AgentプラットフォームAccio Workを開発)が、実サービスを再現するローカルレプリカ上でエージェントのタスク完遂能力を評価するRealReplicaBenchをGitHubで公開(v1.3.1)。107タスクは53 CLI・28ブラウザ・16ファイル・10 API/MCPで構成され、65がテキストのみ、20がブラウザ+テキスト、22が視覚情報必須。各タスクはフレッシュなコンテナで実行され、決定論的またはLLM支援の検証器が採点する。12モデルファミリーをOpenClaw/Accioの2ハーネスで評価した結果、最上位はClaude Opus 5の60/107(56.1%, OpenClaw)と66/107(61.7%, Accio)、次いでClaude Opus 4.8(51.4%/55.1%)、GPT-5.6 Sol(49.5%/51.4%)。Qwen 3.8 MaxはAccioハーネスでOpus 4.7と並ぶ56/107(52.3%)。採点ジャッジはgemini-3.1-pro-previewで、スコアはAccio管理の評価エンドポイントによる。ハーネス・コードはApache 2.0、タスクセットはCC BY 4.0で公開され、ライブリーダーボードも運用中。
COMPUTE / 06
OpenAIが2026年8月13日、GPT-5.6 Sol向けの新サービスティア「Ultrafast mode」のプレビューを発表した。CerebrasのWafer-Scale Engineによる高速推論、限定プレビューの提供条件、公表された評価結果を一次情報に基づいて整理する。