青い光を帯びた多層ニューラルネットワークの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / OpenAI

OpenAI、GPT-6.1 Solを発表 — Astra級の性能を5分の1の価格で、コーディングとcomputer useに最適化

DevDay 2026で発表されたGPT-6 Solの上位版。DeepSWE v1.1でAstraに並び、OSWorld 2.0やTerminal-Bench Scienceでも大幅に肉薄。API価格は入力$2・出力$10、キャッシュ入力は$0.10。ChatGPT Work・Codex・APIで即日提供開始。

OpenAIは2026年9月29日(米国時間)のDevDay 2026で、新モデル「GPT-6.1 Sol」を発表した。先週公開されたGPT-6 Solの上位版という位置づけで、エージェント型コーディング、computer use、専門業務において最上位モデルGPT-6 Astraに迫る性能を、Astraの標準入出力トークン価格の5分の1で提供するとしている。以下は同社の発表内容と安全性文書の整理であり、評価数値はすべてOpenAI自身の公開値である。

評価結果 — コーディングとcomputer useでAstraに肉薄

  • コーディング(DeepSWE v1.1): 実コードベースでの長期ソフトウェア工学タスク評価で、GPT-6.1 SolはGPT-6 Astraに並ぶスコアを約5分の1のコストで記録。GPT-6 Solの最高スコアも、低めの推論設定・低コストで6.4ポイント上回ったとしている。
  • 専門業務(GDP.pdf): 表・図・細字を含む複雑なPDF文書の読解精度を測る評価で、フォールバック付きのOpus 5.5を上回り、タスクあたりコストは半分以下。Astraの最高性能にも約5分の1のコストで接近したという。
  • 業務フロー(AutomationBench): 47種のツールを使う end-to-end 業務フローの完遂率で、medium推論設定時にOpus 5.5を2.2ポイント上回り、コストは約3分の1。GPT-6 Solからも同設定で4.8ポイント向上した。
  • computer use(OSWorld 2.0オフラインセット): 最大推論設定でGPT-6 Solを7ポイント上回り、コストは半分以下。Astraとの差は2.1ポイントで、タスクあたりコストは約7分の1としている。
  • 科学研究(Terminal-Bench Science 0.1): 最大設定でGPT-6 Solの2倍超のスコアを半分以下のコストで記録。タスクあたり平均コストは$5.47で、Opus 5.5の$23.21、Astraの$23.80を大きく下回る。ただし最高スコアはAstraの68.1%で、最難関の科学研究タスクには引き続きAstraを推奨している。
  • 事実性: 低推論設定での事実誤り含有率を11.4%から7.7%へ約32%削減。 検証した各設定でAstraとの差は1.9ポイント以内、コストは5分の1以下としている。

価格と提供形態 — キャッシュ入力は標準の95%引き

  • API価格(100万トークンあたり): 入力$2、キャッシュ入力$0.10、出力$10。キャッシュ入力は標準入力より95%安く、GPT-6 Solのキャッシュ入力からも半額で、コンテキストを再利用するエージェントのランニングコスト引き下げを狙った設定だ。
  • 提供先: Plus・Pro・Business・Enterprise・Eduユーザーを対象に、ChatGPT WorkとCodexで提供開始。通常のChatGPTチャットではまだ利用できない。開発者はAPI経由でモデルID gpt-6.1-sol として利用できる。
  • Ultrafast: 数日中に高速層「Ultrafast」も提供予定で、Codexでの標準速度比で最大8倍のトークン生成速度をうたっている。
  • GitHub Copilot: GPT-6.1 SolはGitHub Copilotでも一般提供が開始され、エージェント型コーディングやターミナルワークフローに利用できるとGitHubが伝えている。

安全性 — Astraと同一の安全対策スタックを適用

  • 能力評価: Preparedness Frameworkのもと、サイバーセキュリティ領域でCritical、生物・化学領域でHighと評価され、GPT-6 Astraと同じ安全対策スタックで運用される。
  • アライメント: OpenAIによれば、GPT-6 Solと比べたアライメント評価は大幅に改善しAstraに近づいた。検索ツールの故障開示、明示的制約の尊重、エージェント作業中の不正な結果の回避などで失敗率が低下し、自動安全レビュアーの回避試行は観測されなかったとしている。
  • 留意点: 上記の評価はすべてOpenAI自身の公開評価に基づくベンダー公称値であり、独立した第三者による同一条件での再現検証は今後の課題である。詳細はシステムカード追補にまとめられている。

出典