Meta Muse Glimmer 徹底レビュー:30B ローカルオンデバイス Agent モデル

Meta Muse Glimmer 徹底レビュー:30B ローカルオンデバイス Agent モデル

Meta Muse Glimmer 徹底レビュー:30B ローカルオンデバイス Agent モデル

2026年8月10日、Meta Superintelligence Labs は Muse Glimmer を正式にオープンソース化しました。これは、常時稼働のローカルエージェントワークフローに最適化された300億パラメータのモデルです。Apache 2.0 ライセンスで公開されており、個人開発者も企業も無料で利用可能です。

これは単なる「また大きな」言語モデルではありません。Muse Glimmer の核心的なポジショニングは:Mac または PC 上のシングルコンシューマー GPU で動作する、常時オンのローカル AI エージェント。画面を見たり、ツールを呼び出したり、コードを書いたり、失敗したら自分でリトライしたり——すべてインターネット接続なしで実行できます。

1. Muse Glimmer とは?

Muse Glimmer は Meta の最新のオープンソースオンデバイスエージェントモデルです。より大きな Muse モデルから知識蒸留により圧縮され、パラメータを300億に抑えつつ、エージェントシナリオ向けに深く最適化されています。

主要スペック

属性詳細
パラメータ数300億(30B)
ライセンスApache 2.0(完全オープン、商用利用可)
アーキテクチャ2B ビジョンエンコーダ + 28B テキストデコーダ
コンテキストウィンドウ120K+ トークン
量子化後サイズ~17-20 GB(4ビット量子化)
最小VRAM24 GB(32 GB 推奨)
対応言語100以上の言語
公開日2026年8月10日

Muse Spark との関係

Muse Glimmer はゼロから学習されたものではありません。Meta のより大きな Muse Spark モデルから知識蒸留により蒸留されました。学習は3つのフェーズに分かれています:

  1. 事前学習:Muse Spark の出力を使用したログット蒸留
  2. 中間学習:より長いコンテキストとエージェント重視のデータで継続学習
  3. 後学習:SFT + オンポリシー蒸留 + 強化学習の組み合わせ

2. 技術アーキテクチャ

2.1 デュアルモジュールアーキテクチャ

Muse Glimmer-30B
├── Perception Encoder — 2Bパラメータ ViT ビジョンタワー
│   ├── 50層 Transformer
│   ├── 2D RoPE 位置エンコーディング
│   ├── 画像・動画入力対応
│   └── Pixel Shuffle 4x 圧縮

└── Text Decoder — 28B パラメータ
    ├── 52層 ハイブリッドアテンション
    ├── Gated Grouped-Query Attention(16:1 KV共有)
    ├── Q-K 正規化 + 追加クエリスケーリング
    └── 120K+ コンテキストウィンドウ

2.2 エージェント向けコア機能

  • エンドツーエンドのエージェントタスク完了:DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Bench で高いパフォーマンス
  • 信頼性の高いツール呼び出し:JSON Schema ツール定義を理解
  • マルチステップ推論:数十ステップにわたって一貫した計画を維持
  • 失敗回復:エラーを診断してリトライ
  • マルチモーダル入力:スクリーンショット、チャート、ドキュメント写真を理解
  • 制御可能な推論強度:タスクの複雑さに応じた推論レベル

3. ベンチマーク比較

エージェント能力

ベンチマークMuse Glimmer-30BGemma4-31BQwen3.6-27B
MCP Atlas75.554.262.5
DeepSearch QA74.661.771.1
τ³-Banking23.515.116.7
OSWorld-Verified65.958.575.6

プログラミング能力

ベンチマークMuse Glimmer-30BGemma4-31BQwen3.6-27B
SWE-Bench Pro51.236.950.2
SWE-Bench Verified76.066.677.2
TerminalBench 2.151.743.460.7

4. ローカルデプロイガイド

ハードウェア要件

レベル最小推奨
GPU24 GB VRAM(RTX 4090/3090)32 GB+ VRAM
RAM32 GB64 GB
ストレージ25 GB(量子化版)60 GB+(フル精度)
MacM4 Max(36 GB+ 統合メモリ)M5 Max(64 GB+)

Ollama(最も簡単)

curl -fsSL https://ollama.com/install.sh | sh
ollama run muse-glimmer

llama.cpp(最も柔軟)

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make -j$(nproc)

./llama-server \
  -m ./models/muse-glimmer-30b-q4_k_m.gguf \
  --draft-model ./models/muse-glimmer-drafter-q4_k_m.gguf \
  -c 32768 --port 8080

Transformers(Python ネイティブ)

from transformers import AutoProcessor, AutoModelForMultimodalLM

MODEL_ID = "meta-models/Muse-Glimmer-30B"
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForMultimodalLM.from_pretrained(
    MODEL_ID, dtype="auto", device_map="auto"
)

5. 評価

項目スコア(10点満点)
エージェント能力9.0
プログラミング8.5
マルチモーダル8.0
デプロイ容易性7.5
推論速度8.0
オープンソース親和性10.0
総合8.5

総評

Muse Glimmer は2026年現在最も重要なローカルエージェントモデルです。30Bモデルがターゲットを絞った蒸留と最適化により、コンシューマーハードウェア上で複雑なエージェントタスクを処理できることを証明しました。プライバシーを重視し、オフライン機能が必要で、ローカルAIワークフローを構築したい開発者にとって——これが現時点での最良の選択です。


FAQ

Q1: Muse Glimmer にはどんなGPUが必要ですか?

A: 量子化版(4ビット、約17-20 GB)で最低24 GBのVRAMが必要です。推奨:NVIDIA RTX 4090/3090(24 GB)または RTX 5090(32 GB)。Mac ユーザーは M4 Max または M5 Max チップと36 GB以上の統合メモリが必要です。

Q2: Muse Glimmer と ChatGPT/Claude の違いは何ですか?

A: ChatGPT と Claude はインターネットを必要とするクラウドモデルです。Muse Glimmer は完全にローカルで動作し、データがマシンから出ることはありません。ただし、30Bのローカルモデルは数千億パラメータのクラウドモデルに完全に取って代わることはできません。

Q3: Muse Glimmer でコードは書けますか?

A: はい、SWE-Bench Pro で51.2、SWE-Bench Verified で76.0 を記録しており、Qwen3.6-27B と同等のレベルです。

Q4: Muse Glimmer は日本語に対応していますか?

A: はい、学習データは100以上の言語をカバーしています。ただし、学習データは英語が中心のため、日本語の性能は特化モデルに劣る可能性があります。

Q5: モデルの重みはどうやって入手できますか?

A: Hugging Face(meta-models/Muse-Glimmer-30B)で Apache 2.0 ライセンスのオープンソースとして公開されています。


Hope this review was helpful!