Signal
📡 Signal|Meta が Muse Glimmer を Apache 2.0 で公開——推論の置き場所が、端末側へ開いた
Meta が 30B のエージェント向けモデルの重みを Apache 2.0 で公開した。フル精度で 55GB 超のモデルが量子化で 20GB を切り、消費者向け GPU 1 枚に載る。動いたのは性能ではなく、推論をどこに置くかという前提だ。
Meta が 8 月 10 日、30B パラメータのエージェント向けモデル「Muse Glimmer」の重みを公開した。ライセンスは Apache 2.0 で、Llama 系列がまとってきた自社条項ではない。ここで見るべきは順位表ではなく、置き場所だ。フル精度なら 55GB を超えるモデルが、量子化で 20GB を切り、手元の GPU 1 枚に載る。エージェントを常時走らせる設計を、従量課金のメーターの外側でも組めるようになったということである。動いたのは性能ではなく、前提だ。
55GB を 20GB 未満へ押し込む
Meta の説明では、30B のモデルはフル精度で「55GB を超えるメモリ」を要する。これを量子化で 20GB 未満に落とす。モデルカードは BF16 の重みに加えて 4bit 量子化版(K-Quant-Dynamic / K-Quant-17GB)を同梱し、エージェント系タスクでの劣化を「最小からゼロ」と記す。
速度側には投機的デコーディングを当てている。軽量な drafter(DFlash)を併走させ、RTX 5090 で最大 3.1 倍、M5 Max で 1.8 倍。倍率そのものより、狙いの形が重要だ。容量を消費者向けハードウェアに収めることと、応答をエージェントのループに耐える速さへ戻すこと。この二つが揃って初めて「端末で動く」が実務の話になる。
配布の設計も同じ方向を向いている。llama.cpp、MLX、ExecuTorch 向けの統合が用意され、Ollama、LM Studio、vLLM 経由の展開が案内されている。研究者が論文用に落とすための公開ではなく、手元で回す前提の公開だ。
Apache 2.0 が変えるのは、性能ではなく条件
モデルカードは全ての成果物を Apache 2.0 で公開すると明記する。Llama 系列が使ってきたのは「Llama Community License Agreement」という Meta 自身が定めた条項であり、標準的な OSS ライセンスではなかった。今回の分岐点はここにある。
Apache 2.0 は商用利用・改変・再配布を標準的な条件で許す。派生モデルの命名規則や利用規模に応じた追加条件といった、事業計画に載せにくい変数が減るということだ。重みの中身が同じでも、法務が読む文書が変われば、企業が取れる選択肢は変わる。モデルの評価軸として、ライセンスはベンチマークと同じ列に並ぶ。
ただし無制限ではない。モデルカードは違法な利用の禁止と、18 歳未満による利用を想定しないことを記す。音声の入出力は対象外で、入力はテキストと画像、出力はテキストに限られる(画像あたりの視覚トークンは最大 4,096)。文脈長は 131,072 トークン以上、対応言語は 100 を超える。Muse Spark からの蒸留で作られたモデルであることも明示されている。
常時稼働という前提が、経済を書き換える
一回の問い合わせなら、推論をどこに置いても差は小さい。エージェントが常時動く前提に変わると、話が変わる。計画を立て、ツールを呼び、失敗から復帰する——この繰り返しでは呼び出し回数が桁で増える。積算したとき、従量課金と手元の電力費は別の曲線を描く。
Meta が「always-on local agent workflows」向けと書いているのは、この差を指している。同社は Gemma4-31B や Qwen3.6-27B と同じサイズ帯での比較を提示しており、この階層に競争が集まっていることも同時に示している。最上位モデルの順位争いとは別に、「十分な性能を、自分の機械の上で、条件の緩いライセンスで」という層が厚くなりつつある。
そしてこれは、データの置き場所の話でもある。端末で完結する推論は、送信しない情報が増えるということだ。規制の重い領域ほど、この一点が採用可否を決める。モデルの賢さではなく、情報が組織の外へ出るかどうかが判断材料になる。
次に見るもの
- 量子化版の実測。「劣化は最小からゼロ」はエージェント系タスクでの主張だ。長い手順を回したときの失敗率が、公開時の評価と一致するか。
- Apache 2.0 が続くかどうか。今回の 1 本で方針そのものが変わったのか、このサイズ帯に限った判断なのか。次の公開が答えになる。
- 受け皿側の動き。ローカル実行環境とハードウェアベンダーが最適化を出す速さは、この層に賭けている度合いを測る指標になる。
推論の置き場所に選択肢が増えたこと自体が、今回の中身だ。
🔗 一次ソース
