推出多模態 Qwen 模型,涵蓋影像與音訊

Abstract black and white graphic featuring a multimodal model pattern with various shapes.

阿里巴巴過去一週推出三款全新的多模態模型,將 Qwen 系列從文字領域延伸至影像與音訊生成。該公司發布了 Qwen-Image-3.0,這是一款支援最長 4.5k token 超長輸入的影像生成模型,相較前一代提升約 4.5 倍,能夠一鍵生成知識圖表、複雜 UI 以及涵蓋 12 種語言、超過 20 種字型風格的多語言海報。阿里巴巴還推出兩款語音模型:Qwen-Audio-3.0-Realtime,具備毫秒級延遲、支援工具呼叫並具備上下文感知記憶的對話模型;以及 Qwen-Audio-3.0-TTS,一款支援 16 種語言和 20 種中文方言的文字轉語音模型。TTS 模型的 Plus 版本提供 48kHz 錄音室級輸出,並在 Artificial Analysis 的 Speech Arena Leaderboard 拔得頭籌。阿里巴巴表示,這些模型鎖定短片、漫畫、互動教育及沉浸式娛樂等應用場景。

自研超節點運行 2.4 兆參數推論

阿里雲於 7 月 23 日表示,其真武 M890 AI 超節點已透過百鍊 AI 平臺完成改裝,用於運行 Qwen 3.8 基礎模型(擁有 2.4 兆參數)的推論工作。阿里巴巴指出,這次部署是首次以國產 AI 超節點執行參數量超過 2 兆的模型推論。真武 M890 是阿里巴巴最新的自研 AI 晶片,支援從 FP32 到 FP4 的精度。其超節點架構透過自研 ICN Switch 1.0 互連技術整合 64 顆晶片,提供 800 GB/s 頻寬與 9 TB 聚合記憶體,容量適合用於大型混合專家模型的專家平行推論。阿里巴巴表示,橫跨晶片、網路與雲端軟體的端到端最佳化,使代理型 AI 推論工作負載的效能提升最高達 1.5 倍。真武 M890 晶片與盤九 AI 超節點伺服器於本月初獲選為 2026 世界人工智慧大會的旗艦展品。

獨立 Qwen Office 產品進入內部測試

據 TechNode 引述中國媒體《藍鯨》報導,阿里巴巴正在內部測試一款名為 Qwen Office 的產品,將其定位為與通義千問分開的職場 AI 產品。該產品聚焦於辦公流程的智慧協作,可能於近期釋出。阿里巴巴正為此專案招募解決方案架構師、業務開發專員及 AI 產品經理。報導指出,該公司已將 QoderWork、悟空及 MuleRun 整合為一款企業生產力產品,由釘釘執行長陳玉琛(Chen Yusen)負責。

垂直整合的 AI 基礎設施策略

超級節點里程碑展現了阿里巴巴更宏觀的佈局,透過垂直整合系統(而非僅仰賴單一晶片)在 AI 基礎建設領域與對手競爭。藉由將自研 AI 晶片、基礎模型與雲端服務整合為單一架構,阿里巴巴正試圖打造 Nvidia 生態系之外的替代方案。產業預估指出,中國國產超級節點市場規模到 2028 年可望達到 3,414 億人民幣(約 476 億美元),華為、騰訊、中科曙光與聯想等企業皆已投入該領域。儘管技術成熟度與開發者採用率仍是長期挑戰,但能在本土平臺上運行兆級參數模型,已為中國大規模 AI 部署勾勒出更可信的替代選項。

分享這篇文章

FacebookX

3 條來源

引用來源