V4 Flash Vision Exp 發布與可用性

DeepSeek於週五釋出名為 V4 Flash Vision Exp 的實驗性多模態大型語言模型,該模型衍生自其純文字版 V4 Flash 模型。這家總部位於杭州的公司初期透過付費的開發者 API 提供新模型,並可能依循先前 V4 系列的發布模式,於稍後釋出開源版本。V4 Flash Vision Exp 是 DeepSeek V4 系列中首款多模態模型,該系列先前僅包含以文字為主的模型。據《Deccan Chronicle》報導,該公司表示此模型在文字能力方面與 V4 Flash 持平,包括代理、推理與世界知識,同時新增解讀圖片與螢幕截圖的能力。
與 V4 Flash 和 Opus 4.8 的基準測試結果
DeepSeek 在七項文字基準測試中將 V4 Flash Vision Exp 與其前代模型進行比較,新模型在其中六項的表現優於 V4 Flash,唯一例外是 Cybergym,該基準測試評估模型尋找軟體漏洞的能力。在四項視覺基準測試中,V4 Flash Vision Exp 在其中兩項的得分比 V4 Flash 高出逾 10%。該模型也在名為 ALE 與 ZeroBench 的兩項視覺測試中勝過 Anthropic 的 Opus 4.8。ALE 包含逾 1,000 個多步驟任務,要求模型與應用程式互動、撰寫程式碼並解讀媒體檔案;而 ZeroBench 則包含 100 個設計來挑戰前沿系統的影像分析任務。《The Next Web》報導,DeepSeek 自行公佈的比較表顯示,V4 Flash Vision Exp 在與 Opus 4.8 的十一場一對一基準對決中贏得三場。
底層的 V4 Flash 架構
DeepSeek 並未揭露 V4 Flash Vision Exp 的具體架構細節,但其 Hugging Face 頁面記錄了上層 V4 Flash 模型的相關資訊。V4 Flash 是一款混合專家模型,總參數量達 2840 億,分佈於多個神經網路中,每個網路各含 130 億參數;每次查詢僅會啟動最相關的網路。兩項稱為 HCA 與 CSA 的技術可壓縮模型的 KV 快取,使處理 100 萬 token 提示所需的運算量減少 73%。該模型採用名為 Muon 的演算法進行訓練,可加速隱藏層的校準。體積更大的姊妹模型 V4 Pro 擁有五倍以上的參數,未來有望從中衍生出更多專業化模型。
中國 AI 開發者的競爭態勢
DeepSeek 今年稍早釋出其旗艦模型,改變了外界對低成本、開源權重系統所能達成水準的期待,而中國開發者持續在性價比上與美國前沿實驗室緊密競爭。此次新版本將這場競爭延伸至多模態代理能力領域,而 Anthropic 的 Opus 4.8 一直被視為該領域的標竿。DeepSeek 過去曾推出多模態與視覺模型,包括 DeepSeek-VL 系列,但 V4 Flash Vision Exp 是首款建構於其最先進 V4 系列之上的同類產品。
待解問題與下一個里程碑
DeepSeek 並未說明 V4 Flash Vision Exp 是否會從付費 API 存取轉為免費方案,也未確認是否會在 V4 Pro 基礎上推出對應的多模態版本。針對該模型多模態代理能力說法的獨立第三方評測目前尚未公開。後續報導預計將聚焦於定價分級、是否釋出開源權重,以及在 DeepSeek 內部數據之外,針對 Opus 4.8 的基準測試驗證結果。
分享這篇文章







