SNAPSHOT
BTC/USD$83,642+0.7%
ETH/USD$2,536.60+1.0%
Coinbaseperp$182.93+1.0%
S&P 500perp7,822.50+0.2%
米テック100perp30,975.00+0.2%
日経225perp68,962+0.1%
EUR/USDperp1.1209+0.0%
USD/JPYperp158.250+0.0%
Goldperp$4,201.80+0.3%
WTIperp$91.22+0.5%
ç±³10幎金利5.24%+0.4%
BTCボラティリティBVIV39.17+0.9%
審査状態: auto_collected゜ヌス: collected_liveas-of 05:03 JSTパケットID: alt20_2026101205トップの垂堎䟡栌は Hyperliquid 䞊の先物perp䟡栌です米10幎金利は米財務省
SNAPSHOT 2026-10-12 05:03 JST

Signal

📡 Signal䜕時間も走る仕事に賭けた Grok 4.7、テスラの車内にも

xAI は Grok 4.7 で、䜕時間もかかる課題に重みを眮いた孊習ぞ資源を寄せた。翌日テスラは車内の Grok が受信箱やカレンダヌの仕事をハンズフリヌでこなせるようになったず投皿しおいる。法務業務の゚ヌゞェント評䟡 Harvey Legal Agent は19.6%。䜎く芋えるのは採点が党基準パスだからで、この領域はただ誰も解いおいない。

LiveMakers 線集デスク

📡 Signal䜕時間も走る仕事に賭けた Grok 4.7、テスラの車内にも

9月21日に xAI が公開した Grok 4.7 は、䜕時間もかかる課題に重みを眮いお孊習された。その翌日、テスラは車内の Grok が受信箱やカレンダヌの仕事をハンズフリヌでこなせるようになったず投皿した。

xAI が挙げた倉曎は、難しい課題を厚く混ぜた匷化孊習を長く回したこず、自己怜蚌ず長い文脈の管理を改善したこず、そしお自瀟の゚ヌゞェント環境を最初から理解する圢で仕䞊げたこずである。鍛えた堎所ず、テスラが車ぞ茉せた堎所は同じ圢をしおいる。

賭けの圢は比范衚にも出おいる。法務業務の゚ヌゞェント評䟡 Harvey Legal Agent で19.6%を取り、Claude Fable 5.1 の6.7%、GPT-5.6 Sol の2.5%を倧きく離した䞀方、端末䞊の䜜業を枬る Terminal-Bench 4.0 は37.6%で Fable 5.1 の57.9%に20.3ポむント届いおいない。総合点で銖䜍を取りに行ったモデルではない。長い工皋を最埌たで持たせる偎に、資源を寄せた。

足したものはすべお工皋の長さに効く

xAI は基盀モデルそのものも倧きくしおいる。ただし挙げられた倉曎のうち、1回の応答の質を盎接抌し䞊げるのはそこだけだ。残りは工皋が長くなるほど効いおくる。自己怜蚌は途䞭で自分の出力の誀りに気づいお戻る働きで、10手で終わる仕事より1,000手続く仕事で差が出る。長い文脈の管理は、序盀に読んだ資料を終盀たで保぀力である。゚ヌゞェント環境の理解は、道具の呌び出し方を毎回教わらずに枈むずいうこずだ。

「䜕時間もかかる問題に重みを眮いた」ずいう䞀行は、鍛える堎所をそこに遞んだずいう意味になる。朝から晩たで走らせた先に䜿える成果物が残るかどうかを、評䟡の察象に据えたずいうこずだ。

勝ち方ず負け方が分かれた比范衚

xAI が公開した衚は、Grok 4.7 を Grok 4.6・GPT-5.6 Sol・Claude Fable 5.1 ず5぀のベンチマヌクで䞊べおいる。巊から Grok 4.7 / Grok 4.6 / GPT-5.6 Sol / Fable 5.1 の順。

  • CursorBench 4.0: 46.3% / 40.4% / 41.7% / 51.8%
  • DeepSWE v1.1: 71.0%(高い掚論匷床) / 65.2% / 72.7% / 70.0%
  • EEBench: 64.0% / 53.0% / 39.4% / 56.4%
  • Terminal-Bench 4.0: 37.6% / 20.3% / 37.3% / 57.9%
  • Harvey Legal Agent: 19.6% / 15.8% / 2.5% / 6.7%

銖䜍は EEBench ず Harvey Legal Agent の2぀。Harvey では xAI が2䞖代続けお他瀟を離しおおり、前の版の Grok 4.6 でさえ15.8%で Fable 5.1 の6.7%を䞊回っおいる。逆に、開発環境での䜜業を枬る CursorBench 4.0 ず Terminal-Bench 4.0 では Fable 5.1 が先行し、DeepSWE v1.1 は71.0%で GPT-5.6 Sol の1.7ポむント䞋に付けた。

読み取れるのは、モデルの序列が1本ではないこずだ。汎甚のコヌディングでは Fable 5.1 が頭ひず぀出おおり、専門領域の業務゚ヌゞェントでは Grok 4.7 が出おいる。問いは、どの仕事にどれを圓おるかぞ现かくなっおいる。

党基準パスで枬る Harvey の採点

Harvey Legal Agent は、法務 AI の Harvey が公開したオヌプン゜ヌスの評䟡で、同瀟は「長い工皋の法務業務」「筋曞きの決たっおいない䟝頌をこなせるか」を枬るものだず説明しおいる。゚ヌゞェントは案件の資料を読み、メモや開瀺スケゞュヌルのような、そのたたレビュヌに出せる成果物を䜜る。1,200件を超えるタスクが24の実務分野にたたがり、専門家が曞いた採点基準は7侇5,000項目を超える。

採点は党基準パスである。Harvey は「すべおの基準を満たしたずきだけタスクを完了ずする」ず曞き、その理由をこう説明しおいる。10件のリスクのうち8件を挙げた案件報告は、80%圹に立぀のではなく、䞍完党なのだ、ず。

だから19.6%は「5件に1件、党基準を満たす成果物を出せた」ずいう意味になる。事実・結論・匕甚・構成・分析の運びのどれか1぀でも欠ければ0点だ。他の3モデルが2.5%から15.8%に収たるこずを合わせお芋るず、この領域はただ誰も解いおいない。゚ヌゞェントに職胜の工皋を任せる話は、勝ち負けの前に「レビュヌに出せる氎準ぞ届くか」の段階にある。その入口に最初に指がかかっおいるのがどこかを、この1行が瀺しおいる。

同じ週に車ぞ茉った Grok Bot

9月22日、テスラは公匏アカりントで「あなたのテスラの䞭の Grok が、意味のある仕事をこなせるようになった」ず投皿した。Connectors ずいう接続の仕組みを通じお、受信箱を片づける、カレンダヌを敎理する、手元のファむルやチャットやタスクに぀いお話しながら進める、ずいったこずがすべおハンズフリヌでできるずいう。

車内で動くモデルの版は、䞡瀟ずも明かしおいない。それでも、xAI が「最初から理解する圢で孊習させた」ず曞いた察象ず、テスラが車に茉せた仕組みは、同じもの——同瀟の゚ヌゞェント環境——を指しおいる。

車内は、長い工皋の゚ヌゞェントにずっお条件のそろった堎所である。䜿い手は画面を芋おおらず、途䞭で现かく操䜜を挟めない。指瀺を出しおから結果を受け取るたでの間が空いおも構わない。1回の速い応答より、任せお攟っおおける完遂率のほうが効く堎面だ。Grok 4.7 が資源を寄せた偎が、そのたた補品の芁件になっおいる。

50䞇トヌクンの窓の䜿い切り方

Grok 4.7 の文脈の窓は50䞇トヌクン、掚論の匷床は low・medium・high(既定)・xhigh の4段階から遞べる。䟡栌は発衚文の入力2ドル・出力6ドルが基本だが、開発者向けドキュメントには条件が付く。プロンプトが20䞇トヌクン未満のずき100䞇トヌクンあたり入力2ドル・キャッシュ入力0.50ドル・出力6ドル、20䞇トヌクンを超えるず入力4ドル・キャッシュ入力1ドル・出力12ドルになる。出力を2倍の速さで返す fast 版も䟡栌は2倍である。

長い工皋に賭けたモデルだから、売りを䜿い切るほどこの階段の䞊に乗る。裏を返せば、20䞇の手前で文脈を畳む蚭蚈を組めるかどうかが、そのたた費甚の蚭蚈になる。匷床の4段階ず階段を組み合わせる䜙地は䜿う偎にあり、同じモデルでも1回あたりの費甚は倧きく倉わる。

䟡栌そのものは前の版ず同じに据え眮かれた。翌9月22日には Anthropic が Claude Opus 5.5 を「兞型的な䜜業で Opus 5 より40%安い」ずしお、OpenAI が GPT-6 Sol ず Luna を「GPT-5.6 のプロモヌション䟡栌ず比べお API 䟡栌50%枛」ずしお公開しおおり、3瀟が同じ週に費甚の話を性胜の話ず䞊べお前に出したこずになる。新しい賭けを詊すコストが䞊がらなかったこずは、詊す偎には効く。

次に芋るもの

䞀぀は Harvey Legal Agent の次の数字である。オヌプン゜ヌスで公開されおいるので各瀟が自瀟の衚に茉せおくる。19.6%がどこたで動くかで、この賭けが䌞びる線なのか頭打ちなのかが分かる。あわせお、同じ圢の職胜別゚ヌゞェント評䟡が法務の倖ぞ広がるかどうかも芋る。

二぀目はテスラの゜フトりェア曎新である。Grok Bot が車内でどこたで実務に䜿われるかは、曎新のリリヌスノヌトず配信の広がりに出る。運転䞭ずいう手の塞がった時間に、どの皮類の仕事が任されおいくかが芋える。

䞉぀目は Terminal-Bench の公開リヌダヌボヌド(tbench.ai)。37.6%は xAI の公衚衚による倀なので、独立の蚈枬が同じ垯に収たるかをこのペヌゞで照合できる。

四぀目は xAI の開発者向けドキュメントのリリヌスノヌトで、20䞇トヌクンを超える垯の4ドル・12ドルが据え眮かれるかどうか。長い工皋を売りにするほど、この垯の䟡栌が実際の採甚を決める。

䜕時間も走り続ける仕事は、ただどのモデルも5件に1件しか終えられない。そこに2䞖代続けお資源を眮いおいるのが、いたの xAI である。

こずば

  • Harvey Legal Agent — 法務 AI の Harvey が公開したオヌプン゜ヌスの評䟡。案件の資料を読んでレビュヌに出せる成果物を䜜らせ、専門家の採点基準をすべお満たしたずきだけ完了ず数える。郚分点が付かないので、数字は実務で䜿える割合に近い。
  • 自己怜蚌 — モデルが自分の出力を途䞭で点怜し、誀りに気づいお盎す働き。手数の少ない仕事では差が出にくく、䜕時間も続く工皋ほど最埌の成吊を分ける。
  • 掚論の匷床 — 答えを出す前にどれだけ考えるかの蚭定。Grok 4.7 は4段階を持ち、䞊げるほど粟床ず費甚が同時に䞊がるため、仕事ごずの遞び分けがそのたた費甚の蚭蚈になる。

🔗 䞀次゜ヌス

関連蚘事