Qwen3.8-Omni-Flash 架構與長上下文設計

阿里巴巴的 Qwen 團隊釋出了 Qwen3.8-Omni-Flash,這是一款原生全模態模型,可在單一工作流程中接受文字、影像、音訊和影片輸入,並支援一百萬 token 的上下文窗口。根據 Qwen 的說明,該模型目前已透過 Qwen AI 平臺提供,並直接建構於 2026 年 8 月釋出開源權重的 Qwen3.8-Flash-Next 架構之上,而非將文字模型與獨立的感知編碼器組合而成。在內部,該系統採用稀疏專家混合設計,總參數約 1,250 億,其中每個 token 在 512 位專家中約啟動 60 億參數,Qwen 表示此配置旨在壓低推論成本,同時保留大量可用的專業參數。據報最大輸入量接近一百萬 token,約 99.1 萬 token,且該模型可在單一請求中接受最長兩小時的影片檔案和三小時的音訊。
代理式感知與基準測試表現
Qwen 將主打能力定位為代理式感知(agentic perception),由模型自行決定要檢視錄影的哪些段落,再以由粗到細的方式蒐集證據,而非以固定間隔對每個畫面進行取樣。在一項內部長影片基準測試中,Qwen 表示此做法將準確率由 63.4 提升至 67.8,同時將每次查詢所需的 token 數減少約 46%,從約 145,700 降至 79,100。該公司表示,相較於 Qwen3.5-Omni-Plus,Qwen3.8-Omni-Flash 在 29 項評測中的平均分數提升超過 25%,在約 30 項評測中提升超過 26%,其中在結合感知、規劃與工具使用的代理導向測試上進步最大。Qwen 也表示,該模型的音視覺表現接近 Google 的Gemini 3.8 Flash,整體音訊表現則超越該模型,但仍承認 Gemini 在部分純影片推理基準上仍居領先。來源資料中並未提供對這些說法的獨立測試。
定價、地區可用性與開源工具
Qwen3.8-Omni-Flash 的 API 定價為每百萬輸入 token 0.15 美元、每百萬輸出 token 0.47 美元,快取輸入 token 為每百萬 0.016 美元,且 API 輸入價格已降至最低每百萬 token 人民幣 0.8 元。以處理的媒體時數計算,Qwen 表示相較於 Qwen3.5-Omni-Plus,音訊輸入成本下降約 98%,音訊與影片合併成本下降約 89%,該公司將此降幅部分歸因於代理式感知所帶來的較低取樣率。該模型已透過 Qwen Chat 上線,AlibabaCloud Model Studio 以及 QwenCloud API 跨六個區域提供服務,包括新加坡、東京和法蘭克福,但僅以託管服務形式提供,此版本並未釋出開放權重。伴隨模型推出,Alibaba 以 Apache 2.0 授權開源了一套名為 Qwen-MM-Plugins 的配套工具包,旨在為編碼代理框架(包括 Claude Code、Codex、Gemini CLI 和 Qwen Code)提供原生支援,使其能在本機讀取圖片、影片幀與音訊,而不必完全仰賴託管 API;此外,該公司也推出了 Qwen-Live Harness,用於長時間運行與即時的多模態工作流程。
從會議到電影製作的目標工作流程
Qwen 將此模型定位於一系列端對端的媒體與生產力工作流程。在長影片方面,該模型能根據使用者提示分析角色、鏡頭、燈光與音效,Qwen 表示此方法在 OmniVideoBench 上減少了約 45.7% 的 token 使用量。在會議應用方面,Qwen3.8-Omni-Flash 支援長達一小時的音視訊輸入,可識別講者、轉錄討論內容、生成會議紀錄、萃取行動項目、分析專案風險,並在串接工具時,根據會議需求發送電子郵件、整理任務或開始撰寫程式。在媒體製作方面,Qwen 表示該模型能先分析音樂,再規劃音樂 MV,並執行涵蓋轉錄、翻譯、聲音複製、配音、音訊混音與最終審核的影片翻譯工作流程;另一個獨立代理則處理完整長片的劇情萃取、腳本規劃、配樂、音樂、剪輯、算圖與品質檢查。
即時變體與語言涵蓋範圍
Qwen 也推出了 Qwen3.8-Omni-Flash-Realtime,能在回應與使用工具的同時處理即時音訊與影片,該公司表示它能結合視覺資訊與空間音訊,判斷聲音來源方位,並輔助定位與導航。即時變體支援 74 種語言的語音辨識,包括烏爾都語與旁遮普語,語音生成則涵蓋 29 種語言。Qwen 尚未公佈即時串流版本的正式釋出日期,該版本以即時語音與影片互動的 live harness 形式先行展示。
分享這篇文章







