Llama 4 基準測試結果確認造假

A hand holding sparklers glowing brightly in a dark night, capturing the essence of celebration.

Meta 前首席 AI 科學家 Yann LeCun 於 2026 年 1 月確認,根據 WION 的報導,所公佈的 Llama 4 基準測試結果遭到「動過手腳」。LeCun 表示,Meta 團隊訓練了模型的多個檢查點,並選取每個個別基準測試中取得的最高分,再將結果呈現為單一綜合效能,而實際上沒有任何單一版本的模型達成該成績。他稱此做法「完全違反了公平評估的原則」。

這場爭議可追溯至 2025 年 4 月,當時 Meta 將新發布的 Llama 4 Maverick 模型的一個版本提交至 LMArena。該提交版本的分數足以讓 Maverick 在公開排行榜上名列第二。一旦開發者取得實際發布的版本後,其排名跌至第 32 名,凸顯出提交版本與出貨版本之間存在實質差異。Meta 生成式 AI 副總裁 Ahmad Al-Dahle 當時否認任何造假行為,將此不一致歸因於「不同的雲端實作方式」。

Meta 轉向付費專有 AI,推出 Muse Spark 1.1

Meta 於 2026 年 7 月 9 日推出 Muse Spark 1.1,根據 MarketScale 引述 CNBC 的報導,公開的開發者預覽 API 定價為輸入 token 每百萬 1.25 美元、輸出 token 每百萬 4.25 美元。新帳戶可獲得 20 美元免費額度,且須透過 Meta 開發者入口網站的候補名單才能取得使用權限。此次發布標誌著該公司迄今最明確的一次轉向,進軍由 Anthropic 與 OpenAI 所建立的付費專有 AI 模型市場。

該模型由 Meta Superintelligence Labs 在 AI 主管 Alexandr Wang 領導下訓練,專為程式設計與代理任務而設計,因為 Wang 向 CNBC 表示,程式設計能力是打造高效 AI 代理機器人的基礎。Wang 表示,該模型運行於 Meta 自有基礎設施上,使工作負載不依賴第三方雲端平臺與聚合服務商。他亦指出正在開發一個開源變體,但未給出發布時間表,同時一款代號為 Watermelon 的更強大模型仍在訓練中。目前的 Muse Spark 1.1 在內部以代號 Avocado 開發。

業界反對限制開放權重 AI

包括 Nvidia、微軟、Meta 與 Palantir 在內逾 20 家科技公司連署一封信件,敦促政策制定者避免對開放權重 AI 模型施加「過早的限制」,以免「扼殺競爭或將創新驅往海外」,根據 Briefs.co 的報導。這項反彈聲浪出現之際,Meta 自家的 Llama 系列已成為該公司開放權重策略的基石,Llama 4 Scout 與 Maverick 可在 Meta 與 Hugging Face 下載,但歐洲用戶無法取得。

Box 執行長 Aaron Levie 為簽署人之一,他在受訪時表示,美國企業要保持競爭力,必須能取得最優良的技術,不論其源自何處。他表示,產業的發展軌跡是朝向更高的 AI 進展與更低的成本邁進。Google AI 負責人 Jeff Dean 則另行表示,蒸餾是一種「讓較小模型更強大的關鍵技術」,需要以最前沿模型作為起點,而 Nvidia 已將該技術整合進其 Llama Nemotron 系列。

中國對手 Kimi K3 加劇對 Meta 的開源壓力

Moonshot AI 的Kimi K3,擁有 2.8 兆參數,根據《國家報》(El País) 報導,將於 2026 年 7 月 27 日釋出。這家中國新創公司公佈了公開基準測試結果,宣稱該模型領先 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT5.6 Sol。與 Meta 的 Llama 系列及 DeepSeek 先前的模型類似,Kimi K3 將以開源形式釋出,使其成為全球最大的開放權重模型,並超越 DeepSeek 擁有 1.6 兆參數的旗艦模型。

前 Meta 產品總監 Xiaowin Qu 在 X 平臺上質疑,當最強的開放權重模型超越最強的閉源模型時,Anthropic 將如何為其 Fable 定價合理化。白宮顧問 Michael Kratsios 公開指控 Moonshot 以「工業規模」透過蒸餾技術複製 Anthropic 的模型,而 Anthropic 本身已在其服務條款中禁止蒸餾,並將阻止未經授權的蒸餾行為視為國家安全議題。

分享這篇文章

FacebookX

7 條來源

引用來源