AIプロダクトの操作画面とモジュールを表す抽象ビジュアル
NAW / PRODUCTS 03

IMAGE: AI生成ビジュアル

PRODUCTS / PRODUCTS

Exaが「Agent Ultra」を発表 — 数千ソースを横断する最高effortの深掘り研究API

Exaは2026年9月25日、Exa Agentの最高effortモード「Agent Ultra」を発表した。多数のサブエージェントを束ねて数千のソースを横断し、リスト構築や企業充実化など網羅性が重要な研究に向く。effort: ultra で利用でき、既定で1ラン最大20ドルの予算上限が付く。

Exaは2026年9月25日(米国時間)、深掘り研究API「Exa Agent」の最高effortモード「Agent Ultra」を発表した。多数のサブエージェントを調整して数千のソースを横断し、リスト構築やエンティティ情報の拡充など「最後まで調べ尽くす」必要がある研究タスクに向ける。APIでは effort: "ultra" を指定するだけで利用でき、提供は開始済みとしている。以下、公式ブログと公式ドキュメントで確認できる内容に限定して整理する。

Agent Ultraとは — 網羅性を最優先する最高effortモード

  • 位置づけ: Exa Agentのeffort設定の最上位。より長く走り、より多くの計算資源を投じて、最も完全な結果を返すモードと説明されている。
  • 動作: 多数のエージェントを束ねて数千のソースを横断する。フロンティア級の知能が必要な箇所に重点配分し、足りる箇所には高速なモデルを当てる設計だという。
  • 想定用途: 深掘り研究、リスト構築、エンティティ情報の拡充など、完全性と正確さが最も重要な難所の研究。予測可能な単価で使いたい場合は固定effortを使うよう案内している。
  • 使い方: Agent実行リクエストに effort: "ultra" を付ける。outputSchema やストリーミングなど他の実行時オプションは通常のランと同様に使える。
  • 所要時間: 複雑なタスクは通常30分程度、非常に難しいものは最大3時間かかる場合がある。SDKのポーリングは既定で1時間でタイムアウトするため、長時間の待機かイベントのストリーミングが推奨されている。

評価の主張 — WANDRなどで最高品質・最低コストと説明(ベンダー公称値)

  • 比較対象(同社説明): Opus 5.5、GPT-6 Astra、Perplexity Agentをそれぞれの最大effort設定で比較し、WANDR・DeepSearchQA・WideSearch・Find-All Companyの各ベンチマークで上回ったとしている。
  • WANDR: 広さ(条件を満たすエンティティの大量発見)と深さ(多数の項目にわたる証拠付きの正確さ)を測る研究エージェント向けベンチマークで、品質最高・タスクあたりコスト最低だったと主張している。

Exa Agent Ultraのベンチマーク比較チャート(WANDRほか)

出典: Introducing Exa Agent Ultra - A New Frontier for Deep Research | Exa Blog

  • 方法上の留意点(同社開示): 競合の公開済み数値がある場合はそれを引用し、ない場合は同社が自ら計測した。グレーダーは上流リポジトリの評価ロジックを流用し、ジャッジモデルにはgpt-6-lunaを使ったと説明している。いずれもベンダー実施の評価であり、独立した第三者検証ではない。
  • 読み方: 上の主張は「同社の harness と条件での結果」であり、他条件での再現性や実タスクでの優劣は別途の検証が必要だ。数値の細部はチャート画像を参照し、断定的な優劣の一般化は避けたい。

料金・予算・停止 — 従量制で上限を付けられる設計

  • 課金: 標準のAgent利用料金で従量課金され、既定では1ランあたり最大20ドル。早く終わればその分だけ安くなる。
  • 予算上限: budget に maxCostDollars(1〜100ドル、既定20)と maxDurationSeconds(300〜10,800秒=5分〜3時間、既定なし)を設定できる。いずれかの上限に近づくと新規作業を止めて、得られた分を返す。
  • 途中停止: 実行中のランを停止して、それまでの成果を保持できる。停止時は stopReason: "stopped" で完了し、使った分までが課金される。
  • 停止理由: 完了したランの stopReason で終了理由が分かる。schema_satisfied(完了)、budget_reached、time_limit_reached、stopped は成果ありの完了、error と cancelled は失敗・取り消し扱い。
  • 具体例(同社紹介): 学習データの収集、検証困難な条件の確認、デューデリジェンス用の市場マップ、KYC調査、ポートフォリオ企業のシグナル監視、営業リスト構築などが挙げられている。

出典