評価グラフと実験構造を重ねたAI研究の抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / EVALUATION

Artificial Analysisが「Search Index」公開 — AIエージェント向け検索APIを同一条件で比較する新ベンチマーク

独立ベンチマーク機関Artificial Analysisは2026年8月19日、AIエージェント向けの検索APIを評価する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を、同じ候補モデル・同じハーネス・同じ設定で比較し、検索プロバイダだけを変えて品質・コスト・速度を評価する。DeepSearchQA・BrowseComp・AA-Omniscienceの3指標の平均により、検索ツールの選択を支援する。

独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェント向けの**検索APIを評価する新ベンチマーク「Search Index」**を公開した。検索APIは、エージェントが最新情報を取得して回答を裏付け(grounding)するために広く使われており、Deep Researchやコーディング、一般的な知識業務などで事実性や出力品質を左右する。

今回のベンチマークは、12の検索APIプロダクト(7プロバイダ)を対象に、候補モデルやハーネスを一切変えず、「検索プロバイダだけ」を変えた同一条件で評価する点に特徴がある。

評価設計 — 変えるのは検索プロバイダのみ

  • 候補モデル: GPT-5.6 Luna(medium)
  • ハーネス: Artificial AnalysisのStirrup(web_search・web_fetch・finish、最大25ターン)
  • 比較対象: 各検索APIプロバイダ(12種類)
  • 答えを生成するモデル・ハーネス・設定はすべて同一で、唯一の変数が検索APIプロバイダ
  • 品質指標は3つのベンチマークの等加重平均
    • DeepSearchQA(F1): 多くの検索が必要な広範な調査質問。900タスクの評価セット
    • BrowseComp(正解率): マルチホップの検索が必要な「見つけにくい事実」。200サンプルのハードサブセット
    • AA-Omniscience(正解率): 6ドメインにわたる600問のファクト質問(非公開サブセット)
  • 加えて、タスクあたりのコスト(モデルトークン+検索APIの定価)とタスクあたりの所要時間(モデル+検索時間)も比較する

主な結果(Search Indexスコア、0–100)

表内のSearch Indexは上記3指標の等加重平均、Baseline Liftは検索なしのモデル単体ベースライン(33点)との差。

プロバイダ(設定) Search Index Lift コスト /1kタスク(検索+モデル) タスクあたり時間
Parallel Search(advanced) 75 42 約$48+$36 38.3秒
Exa Search(auto) 74 41 約$66+$62 28.6秒
Firecrawl Search 73 40 約$30+$45 57.8秒
Parallel Search(basic) 73 40 約$45+$70 23.0秒
Parallel Search(fast) 73 40 約$8+$60 16.2秒
Exa Search(fast) 68 35 約$78+$81 23.4秒
You.com Search 68 35 約$69+$58 36.8秒
Parallel Search(turbo) 67 34 約$14+$47 21.6秒
Keenable Search(pro) 67 34 約$24+$73 25.5秒
Keenable Search(realtime) 67 34 約$27+$64 17.6秒
Tavily Search(basic) 66 33 約$126+$67 39.7秒
Brave Search 65 32 約$72+$75 29.9秒
モデル単体(検索なし) 33 — 約$2.9 16.9秒

(上表はArtificial Analysisの公開データに基づく。コスト・時間は同サイト掲載の数値)

  • 検索を行うと、どのプロバイダでも検索なしモデル単体(33点)に対し大幅にスコアが向上する
  • 上位はParallel Search(advanced)の75点で、Exa(auto)74点、Firecrawl 73点が続く
  • 品質とコスト・速度は必ずしも比例せず、Parallel Search(fast)は73点と上位クラスでありながら検索コストが1,000タスクあたり約$8.4と最も安いなど、プロバイダ間のトレードオフが明確になる
  • Tavily(basic)は品質66点ながら検索コストが1,000タスクあたり約$126と最も高額になる例も示された

開発者への示唆

  • Search APIは「裏付けるWebインデックス」「検索結果のモデルへの提示形式」「コスト・速度・取得品質のトレードオフ」がプロバイダごとに異なる
  • Search Indexは、答えモデルを固定した上で検索プロバイダだけを比較するため、エージェント開発者が検索ツールを選定する際の直接的な参考になる
  • Artificial Analysisは今後も比較対象(プロバイダ・プロダクト)を拡張していくとしている

※性能・コスト数値はArtificial Analysisの公称値・公開データによる。実際のエージェント運用では利用ケースに応じた検証が推奨される。

出典: