IMAGE: AI生成ビジュアル
RESEARCH / EVALUATION
Artificial Analysisが「Search Index」公開 — AIエージェント向け検索APIを同一条件で比較する新ベンチマーク
独立ベンチマーク機関Artificial Analysisは2026年8月19日、AIエージェント向けの検索APIを評価する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を、同じ候補モデル・同じハーネス・同じ設定で比較し、検索プロバイダだけを変えて品質・コスト・速度を評価する。DeepSearchQA・BrowseComp・AA-Omniscienceの3指標の平均により、検索ツールの選択を支援する。
独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェント向けの**検索APIを評価する新ベンチマーク「Search Index」**を公開した。検索APIは、エージェントが最新情報を取得して回答を裏付け(grounding)するために広く使われており、Deep Researchやコーディング、一般的な知識業務などで事実性や出力品質を左右する。
今回のベンチマークは、12の検索APIプロダクト(7プロバイダ)を対象に、候補モデルやハーネスを一切変えず、「検索プロバイダだけ」を変えた同一条件で評価する点に特徴がある。
評価設計 — 変えるのは検索プロバイダのみ
- 候補モデル: GPT-5.6 Luna(medium)
- ハーネス: Artificial AnalysisのStirrup(
web_search・web_fetch・finish、最大25ターン) - 比較対象: 各検索APIプロバイダ(12種類)
- 答えを生成するモデル・ハーネス・設定はすべて同一で、唯一の変数が検索APIプロバイダ
- 品質指標は3つのベンチマークの等加重平均
- DeepSearchQA(F1): 多くの検索が必要な広範な調査質問。900タスクの評価セット
- BrowseComp(正解率): マルチホップの検索が必要な「見つけにくい事実」。200サンプルのハードサブセット
- AA-Omniscience(正解率): 6ドメインにわたる600問のファクト質問(非公開サブセット)
- 加えて、タスクあたりのコスト(モデルトークン+検索APIの定価)とタスクあたりの所要時間(モデル+検索時間)も比較する
主な結果(Search Indexスコア、0–100)
表内のSearch Indexは上記3指標の等加重平均、Baseline Liftは検索なしのモデル単体ベースライン(33点)との差。
| プロバイダ(設定) | Search Index | Lift | コスト /1kタスク(検索+モデル) | タスクあたり時間 |
|---|---|---|---|---|
| Parallel Search(advanced) | 75 | 42 | 約$48+$36 | 38.3秒 |
| Exa Search(auto) | 74 | 41 | 約$66+$62 | 28.6秒 |
| Firecrawl Search | 73 | 40 | 約$30+$45 | 57.8秒 |
| Parallel Search(basic) | 73 | 40 | 約$45+$70 | 23.0秒 |
| Parallel Search(fast) | 73 | 40 | 約$8+$60 | 16.2秒 |
| Exa Search(fast) | 68 | 35 | 約$78+$81 | 23.4秒 |
| You.com Search | 68 | 35 | 約$69+$58 | 36.8秒 |
| Parallel Search(turbo) | 67 | 34 | 約$14+$47 | 21.6秒 |
| Keenable Search(pro) | 67 | 34 | 約$24+$73 | 25.5秒 |
| Keenable Search(realtime) | 67 | 34 | 約$27+$64 | 17.6秒 |
| Tavily Search(basic) | 66 | 33 | 約$126+$67 | 39.7秒 |
| Brave Search | 65 | 32 | 約$72+$75 | 29.9秒 |
| モデル単体(検索なし) | 33 | — | 約$2.9 | 16.9秒 |
(上表はArtificial Analysisの公開データに基づく。コスト・時間は同サイト掲載の数値)
- 検索を行うと、どのプロバイダでも検索なしモデル単体(33点)に対し大幅にスコアが向上する
- 上位はParallel Search(advanced)の75点で、Exa(auto)74点、Firecrawl 73点が続く
- 品質とコスト・速度は必ずしも比例せず、Parallel Search(fast)は73点と上位クラスでありながら検索コストが1,000タスクあたり約$8.4と最も安いなど、プロバイダ間のトレードオフが明確になる
- Tavily(basic)は品質66点ながら検索コストが1,000タスクあたり約$126と最も高額になる例も示された
開発者への示唆
- Search APIは「裏付けるWebインデックス」「検索結果のモデルへの提示形式」「コスト・速度・取得品質のトレードオフ」がプロバイダごとに異なる
- Search Indexは、答えモデルを固定した上で検索プロバイダだけを比較するため、エージェント開発者が検索ツールを選定する際の直接的な参考になる
- Artificial Analysisは今後も比較対象(プロバイダ・プロダクト)を拡張していくとしている
※性能・コスト数値はArtificial Analysisの公称値・公開データによる。実際のエージェント運用では利用ケースに応じた検証が推奨される。
出典: