SNAPSHOT
BTC/USD$83,642+0.7%
ETH/USD$2,536.60+1.0%
Coinbase(perp)$182.93+1.0%
S&P 500(perp)7,822.50+0.2%
米テック100(perp)30,975.00+0.2%
日経225(perp)68,962+0.1%
EUR/USD(perp)1.1209+0.0%
USD/JPY(perp)158.250+0.0%
Gold(perp)$4,201.80+0.3%
WTI(perp)$91.22+0.5%
米10年金利5.24%+0.4%
BTCボラティリティ(BVIV)39.17+0.9%
審査状態: auto_collectedソース: collected_liveas-of 05:03 JSTパケットID: alt20_2026101205トップの市場価格は Hyperliquid 上の先物(perp)価格です(米10年金利は米財務省)
SNAPSHOT 2026-10-12 05:03 JST

Signal

📡 Signal|Anthropic の書籍交換実験、最適との差の 85% は選好の把握不足

Anthropic が 201 人の社員で開いた書籍交換市場で、エージェントに任せた結果は理論上の最善 0.89 に対し 0.55。差の 85% は交渉ではなく、好みを写し取る入口で生まれていた。

LiveMakers 編集デスク

📡 Signal|Anthropic の書籍交換実験、最適との差の 85% は選好の把握不足

Anthropic が 9 月 24 日、6 拠点の社員 201 人が代理エージェントに書籍の交換を任せた社内実験の結果を公開した。参加者が受け取った本は自分の順位で 0.55 の位置にとどまり、理論上の最善 0.89 との差の 85% は、交渉の巧拙ではなく好みを写し取る工程で生まれていた。

Project Swap (Anthropic Research・2026-09-24)anthropic.com

エージェント同士が直接取引する市場がどこで詰まるのかを、実地のデータで測った例は多くない。

何を測ったか

参加者は 201 人、サンフランシスコ・ニューヨーク・ロンドン・シアトル・ワシントン DC・ダブリンの 6 拠点に分かれた。各人は手放す本を出し、Claude と短い聞き取りの会話をする。その会話から Claude が本人の選好の順位を作り、エージェントがデジタルの取引フロアに出て、二者間の交換や複数人をまたぐ持ち回りで取引をまとめる。

人間が交渉に立ち会う場面はない。人が渡すのは好みだけで、あとは代理人が動く。今回の実験は、先行する Project Deal に続く二本目にあたる。

0.55 と 0.89 の距離

結果の指標は、参加者が自分で付けた 10 冊の順位のどこに着地したかである。全体の平均は 0.55、順位でいえばおよそ 5 番目の選択にあたる。

ここで比較対象になるのは 1.0 ではない。全員が 1 位の本を取れるわけではないため、参加者全員の満足の合計が最大になる配り方 (効用最適) でも、この実験では 0.89 にしかならない。0.55 と 0.89 の差が、市場が取りこぼした分になる。

なお参加者本人の評価は悪くない。受け取った本の満足度は 10 点満点で平均 7.2 点で、5 点が「まあよい」、10 点が「今年読んだ中でも上位」という目盛りである。年間の書籍予算のうちどれくらいをエージェントに任せてよいかという問いには、平均でおよそ 30% という答えが返っている。

取りこぼしの 85% は入口で生まれた

取りこぼしの内訳が、この実験でいちばん重い数字だ。Anthropic の分析では、Claude が作った順位の不正確さが差の 85% を説明し、エージェントを自由な取引フロアに放ったことによる分は残りの 15% にとどまる。

順位の精度そのものも示されている。短い聞き取りの会話をもとにした Claude の並べ方は、参加者本人の並べ方と、本の組み合わせの 61% で一致した。当てずっぽうなら 50% になる水準に対して、11 ポイント上である。

損失の大半は、人と代理人のあいだ、好みを言葉にして受け渡す入口で出ている。参加者の一部は、自分の好みがそもそも不完全で、言葉にしづらいとも答えている。この部分は、モデルを強くすれば消えるとは限らない。

モデルの強さが交渉力になる

取引フロアは、動かすモデルを変えて複数用意された。Haiku のフロアは平均 0.75、Opus のフロアは平均 0.88。Sonnet はその中間で、Fable は Opus に近いがやや下だった。強いモデルを載せたフロアほど、市場全体の効率が高い。

さらに、強いモデルと弱いモデルを混ぜたフロアでは、Opus のエージェントが相手方を一貫して上回った。同じ市場に立っても、どのモデルを代理人にしているかで取り分が変わる。

エージェント同士が取引する経済では、これは設計上の論点になる。モデルへのアクセスの差が、そのまま交渉力の差として現れるからだ。半数のエージェントには本人の利益を最大化する指示を、残りの半数には他者の状況にも配慮する指示を与えた比較も行われたが、こちらの差は Claude の順位基準でおよそ 0.02 と小さかった。

実験が置いた前提

Anthropic 自身が、この結果を一般化しにくくする条件を並べている。参加者は同社の社員であり、一般の利用者を代表しない。Claude への信頼も平均より高いと見てよい。

取引フロアに立ったのは、同社の製品版から取った行儀のよい Claude だけである。相手をだしぬこうとする敵対的なエージェントは入っていない。参加者全員が Claude を使い、本人確認が完全にできている前提も置かれている。市場の開催期間や参加人数の上限、ルールも固定されていた。

運用面の綻びも記録されている。全員が実際に本を送ったわけではなく、成立したのに履行されない取引が出た。それを体系的に追跡する仕組みは用意されていなかった。

代理人を強くする前に

この実験が示したのは、順番の問題だ。エージェント経済の議論は交渉プロトコルや決済手段に寄りやすいが、少なくともこの市場では、取りこぼしの大半は交渉が始まる前の段階で生まれていた。人が自分の好みを十分に言えないという問題は、プロトコルの側では解けない。

確認先は Anthropic の research ページに並ぶ同系列の報告で、Project Deal の次が今回の Project Swap だった。次の一本が出たとき、敵対的なエージェントを入れるのか、本人確認が完全という前提を外すのか。その 2 点を見れば、この結果がどこまで実際の市場に持ち出せるかが分かる。

ことば

  • エージェント市場 — 人の代理として動く AI 同士が直接やり取りして取引を成立させる場。人は条件を伝えるだけで、交渉そのものには立ち会わない。
  • 効用最適 — 参加者全体の満足の合計が最大になる配り方。全員が 1 位を取れるわけではないので、理論上の最高点も 1.0 にはならない。今回は 0.89 だった。
  • 選好の引き出し — AI が人の好みを会話から推定して順位に直す工程。今回の実験では、ここでの取りこぼしが最適との差の大半を占めた。

🔗 一次ソース

関連記事