專為單張消費級 GPU 設計的 300 億參數模型

Meta 於 2026 年 8 月 10 日發布 Muse Glimmer,這是一款可在配備單張消費級顯示卡的 Mac 或 PC 上執行的開源權重模型。該模型於 Hugging Face 提供免費下載,採用 Apache 2.0 授權,允許商業使用、修改與再散佈,且不受其他競爭開源權重版本所附加的使用限制。Meta 表示,該模型瞄準代理式任務,例如行程管理、檔案整理、本機程式撰寫,以及函式呼叫。
模型如何符合消費級硬體需求
在完整浮點精度下,300 億參數模型需要超過 55 GB 的記憶體,超越市面上任何消費級顯示卡。Meta 將權重量化至約 4 位元精度,並將語言模型壓縮至 20 GB 以下,在 24 GB 或 32 GB 的記憶體容量中保留空間給 KV 快取、影像處理感知編碼器,以及推測式解碼草稿器。Meta 量測解碼速度在 NVIDIA RTX 5090 上提升 3.1 倍,在 Apple M5 Max 上提升 1.8 倍,在 M4 Max 上提升 1.5 倍,輸出品質與標準逐詞元生成相當。
訓練流程與基準測試結果
Muse Glimmer 是 Meta 更大規模模型 Muse Spark 1.2 的蒸餾版本,Spark 於 8 月 5 日以封閉式旗艦模型身分推出。訓練分為三個階段:來自 Spark 的 logit 蒸餾、針對長上下文與代理任務密集資料的中段訓練,以及結合監督式微調、on-policy 蒸餾與強化學習的最終階段。Meta 報告,在 DeepSearch QA、MCP-Atlas、τ-Bench 與 SWE-Bench 等衡量檢索、多步驟代理規劃、程式碼撰寫與除錯的基準上,該模型在其尺寸級距中對 Gemma4-31B 與 Qwen3.6-27B 表現優異。
功能、工具與生態系支援
該模型設計用於診斷失敗的工具呼叫並重試,而非中止執行;接受包含螢幕擷圖與文件在內的交錯文字與影像;可與 OpenClaw 等代理協調器協作;支援可調整的推理力度;並涵蓋超過 100 種語言。Meta 表示,本機運作允許在無網路連線的狀態下使用裝置,且不會將查詢外傳至本機之外。針對 llama.cpp、MLX 與 ExecuTorch 的最佳化整合預計於數日內推出,而 Ollama、LM Studio、Unsloth、Together AI、Fireworks AI 與 OpenRouter 在發布時即已支援該模型。Meta 將規模較大的推論工作負載指向 vLLM 與 SGLang,並正與 AMD、Arm、Dell、Intel 與 NVIDIA 進行硬體最佳化合作。
開源政策推動與競爭論述
與發布同步,執行長 Mark Zuckerberg 發表一篇 14 頁的專文,主張美國應降低開源 AI 發展的障礙,而非將超級智慧集中化。他表示,美國開源開發者在訓練資料使用與蒸餾技術等議題上,面臨相對於中國競爭者的法規劣勢。路透社在相關報導中引述指出,包括 Moonshot、阿里巴巴集團與 DeepSeek 在內的中國新創公司已取得「領先地位」。開權重 AI的開發,所推出的模型可媲美美國領先系統,而 OpenAI、Anthropic 及 Alphabet 旗下 Google 的頂級產品並未以開權重系統形式公開釋出。路透社亦報導 Meta 計畫釋出其旗艦產品 Muse Spark 1.2 的權重,不過該計畫在 Meta 自身的資料中並未獲得證實。在發布當日,Meta 股票在盤前交易中上漲近 3%。
仍不明朗之處
根據 Quartz 報告,量化後的實際記憶體用量約為 17 GB,而 BetaNews 報告則描述為 20 GB 以下,這項差異源自兩家媒體的整理方式不同,並非 Meta 本身的說法有所矛盾。路透社報導 Meta 計畫公開釋出 Muse Spark 1.2 的權重,但在來源資料中未獲 Meta 自身資料佐證;即便該釋出計畫獲得確認,其時間點也未明確說明。
分享這篇文章







