NAW / RESEARCH 04
IMAGE: AI生成ビジュアル
RESEARCH / Anthropic
Anthropic、エージェント同士が本を交換する市場実験「Project Swap」を公開 — 律速は交渉ではなく「理解」だった
Anthropicは2026年9月24日、Claudeを基盤とするエージェント同士に書籍の物々交換をさせた市場実験「Project Swap」を公開した。6拠点・201人の従業員が参加し、5分のintake会話からエージェントが構築した好みの順位は本人の順位と61%一致。市場効率の不足分の85%は好みの理解の誤差に起因し、交渉の失敗は15%にとどまったとしている。
Anthropicは2026年9月24日(米国時間)、Claudeを基盤とするエージェント同士を市場で取引させた実験「Project Swap」を公開した。6拠点の従業員201人が読み終えた本を持ち寄り、各自のClaudeエージェントがデジタル上の「取引フロア」で提示・値切り・合意を重ね、夏の読書用の本を交換する物々交換経済だ。分類広告型の市場で実物を売買させた前回の実験「Project Deal」に続く第2弾で、今回は好みを順位として測定できる単純な市場にすることで、成果の良し悪しを定量化した点が特徴だ。以下は同社公開内容の整理である。

出典: Project Swap: What happens when agents trade for us?(Anthropic)
実験設計 — 201人・6拠点の書籍バーター市場
- 参加者: サンフランシスコ、ニューヨーク、ロンドン、シアトル、ワシントンD.C.、ダブリンの6拠点・計201人。各拠点が取引プールとなり、規模は3人(ダブリン)〜115人(サンフランシスコ)。ダブリンは分析の大部分から除外している
- intake会話: 各参加者はClaudeと短い半構造化の会話を交わし、読書の好みや夏に読みたい本の方向性を伝えた。中央値は8メッセージ・216語だった。ここからClaude(Fable 5を使用)がプール内の全書籍に対する好み順位を推定し、エージェントはその順位を持って取引に臨んだ
- 真値の取得: 参加者自身にもプール内の10冊の順位付けを求め、エージェントの理解度を測る基準とした。エージェント側がこの真値を見ることはなかった
- 取引フロア: 各エージェントは参加者の本を1冊持って開始し、共有チャンネルへの投稿(交換提案・承諾・拒否・雑談)で交渉した。提案は2者間の交換も多者間の回転交換も可能で、全当事者の承諾でのみ成立した。フロアの全履歴は公開され、時間切れか沈黙で終了した。実際の取引フロアはOpus 4.8で実行された
- 指示の割付: 各フロアの半数は「夏に読みたい本を自分の人に取らせることだけが目的」のruthless指示、残り半数は同じ主目的に加えて「全員が良い本を得る」という副目的を持つprosocial指示をランダムに割り当てた
- 再実行実験: ライブの1回限りでは偶然の影響が分離できないため、条件を1変数ずつ変えて数十回再実行した。Haiku 4.5・Sonnet 4.5・Opus 4.8・Fable 5での中立指示フロア80回、Opusと他モデルの混合フロア60回などを含む
- 中央集権ベンチマーク: 比較用に、真の好みを正直に申告させて最適割当を計算する「効用主義的最適」(正直性を仮定)と、正直申告が本人の利益になるよう設計されたTop Trading Cyclesルールを算出した
結果1 — 5分の会話で好み一致率61%、入力が多いほど正確に
- 一致率61%: 全ての書籍ペアについてClaudeの推定順位と本人の順位が一致した割合は61%で、ランダム推測の50%を上回った
- 単純な基準との比較: プール内の人気順(Goodreadsの読みたい登録数ベース)は約53%、intakeで挙がった本との共起に基づく協調フィルタリングは約55%の一致率で、Claudeの61%が上回った。他人のジョークの好みを当てる先行研究のアルゴリズムも約61%、友人の予測は約57%だったと参照している
- 入力の効果: intakeに手をかけた参加者ほど正確に表現された。150語程度から300語程度に増やすと約4ポイント一致率が上がる関係(対数語数の回帰、p<0.01)があり、短い会話でも入力差が感知できる水準だったとしている
結果2 — 交渉は良好、不足の85%は「理解」の誤差に起因
- 効率の水準: 参加者が最終的に得た本を本人の真の順位で採点(1位=1、最下位=0の平均)すると、分散型市場は0.55(10冊中およそ5位)だった。実現可能な最適割当は0.89(およそ2位)で、差が不足分となる
- 不足の分解: Claudeの推定順位のまま最良割当をしても0.60にしかならないため、不足分の大部分(85%)は推定順位のノイズ、すなわち「理解」の誤差で説明され、自由交渉フロアに送り込むこと自体の寄与は残り15%だったとしている
- 市場設計の差は小さい: 推定順位ベースのTop Trading Cyclesを本人の真の順位で採点すると0.60で、分散型市場の0.55と大差ない。ノイズのある順位で市場を回す限り、設計の違いは結果に効きにくいと述べている
- モデル差が指示差を上回る: 再実行では、エージェントへの指示(ruthless/prosocialの差は0.02)より、動作モデル(Haiku〜Opus/Fable)の違いが交渉結果に大きく効いた。強いモデルが動く市場ほど効率的で、同一エージェントを別モデルで走らせるとOpusフロアがHaikuフロアを0.12上回った(Claude順位ベース、p<0.001)などの差が出たとしている
- 受容: 終了3週間後の調査では、本を読んだ参加者の多くが満足し、平均的には年間の書籍予算の約3分の1を同様のエージェントに任せると回答したという
含意と限界 — 市場を作る側・使う側への示唆
- 作る側への示唆: エージェントを市場に送る設計者は、エージェントが参加者をどれだけ理解しているかを検証する手段が必要になる。市場やプラットフォームを設計する側は、参加資格・不成立時の扱い・取引の可視性などのルールを明確にする必要があるとしている
- 限界: 対象は社内の書籍交換という小規模・低リスクの市場で、実市場への一般化は未検証だ。好みの線形効用化や補完方法などの測定上の仮定があり、詳細は論文の付録に記載されている。効果量の多くはClaudeの推定順位ベースの評価に依存する
- 留意点: 本記事の数値は全て同社報告値の整理であり、独立した検証ではない。市場効率の主張は同実験の設定内での比較に基づく