SNAPSHOT
BTC/USD$83,606+0.7%
ETH/USD$2,532.64+1.0%
Coinbase(perp)$182.83+1.1%
S&P 500(perp)7,820.70+0.1%
米テック100(perp)30,976.00+0.2%
日経225(perp)69,021+0.3%
EUR/USD(perp)1.1204-0.0%
USD/JPY(perp)158.240-0.1%
Gold(perp)$4,188.60-0.1%
WTI(perp)$91.97+1.0%
米10年金利5.24%+0.4%
BTCボラティリティ(BVIV)39.40+1.6%
Review status: auto_collectedSource: collected_liveas-of 07:30 JSTPacket ID: alt20_2026101207Top-page market prices are Hyperliquid perpetual-futures prices (US 10Y from the U.S. Treasury).
SNAPSHOT 2026-10-12 07:30 JST

Signal

📡 Signal|Meta が Muse Glimmer を Apache 2.0 で公開——推論の置き場所が、端末側へ開いた

Meta が 30B のエージェント向けモデルの重みを Apache 2.0 で公開した。フル精度で 55GB 超のモデルが量子化で 20GB を切り、消費者向け GPU 1 枚に載る。動いたのは性能ではなく、推論をどこに置くかという前提だ。

LiveMakers Editorial Desk

📡 Signal|Meta が Muse Glimmer を Apache 2.0 で公開——推論の置き場所が、端末側へ開いた

Meta が 8 月 10 日、30B パラメータのエージェント向けモデル「Muse Glimmer」の重みを公開した。ライセンスは Apache 2.0 で、Llama 系列がまとってきた自社条項ではない。ここで見るべきは順位表ではなく、置き場所だ。フル精度なら 55GB を超えるモデルが、量子化で 20GB を切り、手元の GPU 1 枚に載る。エージェントを常時走らせる設計を、従量課金のメーターの外側でも組めるようになったということである。動いたのは性能ではなく、前提だ。

Meta AI Research — Introducing Muse Glimmer: An Open Agentic Model That Runs on Your DeviceMeta AI Research

55GB を 20GB 未満へ押し込む

Meta の説明では、30B のモデルはフル精度で「55GB を超えるメモリ」を要する。これを量子化で 20GB 未満に落とす。モデルカードは BF16 の重みに加えて 4bit 量子化版(K-Quant-Dynamic / K-Quant-17GB)を同梱し、エージェント系タスクでの劣化を「最小からゼロ」と記す。

速度側には投機的デコーディングを当てている。軽量な drafter(DFlash)を併走させ、RTX 5090 で最大 3.1 倍、M5 Max で 1.8 倍。倍率そのものより、狙いの形が重要だ。容量を消費者向けハードウェアに収めることと、応答をエージェントのループに耐える速さへ戻すこと。この二つが揃って初めて「端末で動く」が実務の話になる。

配布の設計も同じ方向を向いている。llama.cpp、MLX、ExecuTorch 向けの統合が用意され、Ollama、LM Studio、vLLM 経由の展開が案内されている。研究者が論文用に落とすための公開ではなく、手元で回す前提の公開だ。

Apache 2.0 が変えるのは、性能ではなく条件

モデルカードは全ての成果物を Apache 2.0 で公開すると明記する。Llama 系列が使ってきたのは「Llama Community License Agreement」という Meta 自身が定めた条項であり、標準的な OSS ライセンスではなかった。今回の分岐点はここにある。

Apache 2.0 は商用利用・改変・再配布を標準的な条件で許す。派生モデルの命名規則や利用規模に応じた追加条件といった、事業計画に載せにくい変数が減るということだ。重みの中身が同じでも、法務が読む文書が変われば、企業が取れる選択肢は変わる。モデルの評価軸として、ライセンスはベンチマークと同じ列に並ぶ。

ただし無制限ではない。モデルカードは違法な利用の禁止と、18 歳未満による利用を想定しないことを記す。音声の入出力は対象外で、入力はテキストと画像、出力はテキストに限られる(画像あたりの視覚トークンは最大 4,096)。文脈長は 131,072 トークン以上、対応言語は 100 を超える。Muse Spark からの蒸留で作られたモデルであることも明示されている。

常時稼働という前提が、経済を書き換える

一回の問い合わせなら、推論をどこに置いても差は小さい。エージェントが常時動く前提に変わると、話が変わる。計画を立て、ツールを呼び、失敗から復帰する——この繰り返しでは呼び出し回数が桁で増える。積算したとき、従量課金と手元の電力費は別の曲線を描く。

Meta が「always-on local agent workflows」向けと書いているのは、この差を指している。同社は Gemma4-31B や Qwen3.6-27B と同じサイズ帯での比較を提示しており、この階層に競争が集まっていることも同時に示している。最上位モデルの順位争いとは別に、「十分な性能を、自分の機械の上で、条件の緩いライセンスで」という層が厚くなりつつある。

そしてこれは、データの置き場所の話でもある。端末で完結する推論は、送信しない情報が増えるということだ。規制の重い領域ほど、この一点が採用可否を決める。モデルの賢さではなく、情報が組織の外へ出るかどうかが判断材料になる。

次に見るもの

  • 量子化版の実測。「劣化は最小からゼロ」はエージェント系タスクでの主張だ。長い手順を回したときの失敗率が、公開時の評価と一致するか。
  • Apache 2.0 が続くかどうか。今回の 1 本で方針そのものが変わったのか、このサイズ帯に限った判断なのか。次の公開が答えになる。
  • 受け皿側の動き。ローカル実行環境とハードウェアベンダーが最適化を出す速さは、この層に賭けている度合いを測る指標になる。

推論の置き場所に選択肢が増えたこと自体が、今回の中身だ。

🔗 一次ソース

Related articles