DeepSeek 揭曉 V4.1-Flash,作為全新架構系列中最小成員

中國 AI 新創公司DeepSeek於 2026 年 9 月 10 日(星期四)推出 DeepSeek-V4.1-Flash,並稱其為全新架構系列中規模最小的模型。根據公司聲明,該模型旨在提供更強的能力、更快的推論、更高的吞吐量,並可擴展至更大的模型。此次發布適逢 DeepSeek 開始準備於上海以科技為主的 STAR Market 進行首次公開發行(IPO)。
架構、參數與訓練規模
V4.1-Flash 是一款擁有 5,520 億參數的混合專家(MoE)模型,具備原生多模態視覺理解能力。DeepSeek 表示,該模型在輸入時僅啟用 80 億參數,在輸出時啟用 160 億參數,並支援影像與文字輸入,推理強度可於 1 至 100 之間調整。模型採用 Causal Encoder-Decoder 架構,搭配稀疏注意力與 FP4 KV 快取,使全域 KV 快取使用量降至每個 token 890 位元組,並僅需前一代四分之一的 HBM 與八分之一的 SSD 儲存空間。
此架構由 20 層編碼器與 20 層解碼器組成,搭配一個將影像轉換為視覺嵌入並與文字一併處理的 DeepSeek-ViT 視覺編碼器。先進的 MoE 設計將 1 個共用專家與 384 個路由專家搭配,每個 token 啟用 6 個路由專家。DeepSeek-V4.1-Flash 從零開始,於包含 45 兆 token 的多模態語料上進行訓練,其中稀疏注意力以 64K 序列長度進行訓練,並在訓練 34 兆 token 後將上下文窗口延伸至 100 萬 token。
上下文視窗、棄用與價格定位
DeepSeek 已透過其 API 提供 V4.1-Flash,上下文視窗最高可達 100 萬個 tokens。該公司已將 V4-Flash 與V4-Flash-Vision-Exp汰除,而舊版模型名稱 deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 將暫時將請求路由至 V4.1-Flash。DeepSeek 表示,多方測試發現 V4.1-Flash 在效能、成本、速度與整體完成時間上皆優於 V4-Pro,因此決定逐步淘汰舊版模型。該公司對新模型採取積極的定價策略,據報每百萬 tokens 的收費最低僅需零點幾美分,加劇了中國開放權重模型與美國同類模型之間的價格戰。
競爭基準與生態系採用
DeepSeek 聲稱 V4.1-Flash 在 Terminal-Bench 3.0、DeepSWE v1.1、CyberGym 與 Automation-Best 等基準上表現優於 Anthropic 的 Opus 5,並在部分基準上擊敗 OpenAI 的GPT-5.6 Sol。該模型在 DeepSeek 的測試中同樣超越 Z.AI 的 GLM-5.3;Z.AI 於八月以約 GLM-5.3 十分之一的價格開源了更便宜的 GLM-5.3-Flash。寒武紀科技(Cambricon Technologies)對 V4.1-Flash 實現「Day 0」支援,使該模型能在發布當日立即於其硬體上運行,而騰訊則透過其 WorkBuddy 與 CodeBuddy 產品整合該模型,並與 OpenCode 共同擔任官方合作夥伴。
地緣政治背景與 IPO 準備
此次發布之前,美國政府指控 DeepSeek 與其他五家中國 AI 公司利用 AI 模型蒸餾技術自美國前沿模型中萃取能力。此外,根據路透社報導,DeepSeek 已聘請中信證券籌備於上海科創板上市,流程預計將於今年啟動,但發行時間、規模與估值尚未定案。
後續追蹤訊號
下一個可驗證的里程碑是 DeepSeek 於中信證券正式啟動科創板上市程序,預計將於 2026 年稍後展開,同時伴隨著隨著 V4.1-Flash 模型由合作夥伴如寒武紀科技與騰訊部署,所可能公佈的更多定價或基準資訊。
分享這篇文章







