阿里巴巴旗下千問(Qwen)團隊於8月3日正式發布千問3.8-Max,總參數量2.4萬億,激活參數95B,是千問家族迄今規模最大、能力最強的模型。這也是千問首次將Max級別模型開源——權重將於下周在開源社區Hugging Face和ModelScope發布。
定價方面,千問3.8-Max通過千問AI平台(阿里雲)提供API調用:輸入2.0美元/百萬tokens,輸出6.0美元/百萬tokens,隱式緩存0.25美元/百萬tokens。
基準測試顯示,千問3.8-Max在編程智能體和通用智能體多項指標上與Anthropic Fable5表現相當,部分指標超越後者。例如,PaperBench得分93.0,高於Fable5的88.8;CoWorkBench得分74.8,與Fable5的75.9接近;WideSearch得分81.9,與Fable5的81.2持平。

性能:與 Fable 5 相當,部分超越
根據千問團隊發布的完整基準測試數據,Qwen3.8-Max 在多個核心指標上與 Anthropic Claude Fable 5 持平或超出:
- PaperBench(論文能力):Qwen3.8-Max 得分 93.0,超過 Fable 5 的 88.8 和 GPT-5.6 Sol 的 90.5
- IFBench:Qwen3.8-Max 82.8,Fable 5 為 63.5,GPT-5.6 Sol 為 72.7
- HealthBench:Qwen3.8-Max 60.2,超過 GPT-5.6 Sol 的 55.3
- CoWorkBench(通用協作):Qwen3.8-Max 74.8,Fable 5 為 75.9,差距極小
- JobBench(AI工作能力):Qwen3.8-Max 53.4,接近 Fable 5 的 57.4
多模態方面同樣表現突出:
- OSWorld-Verified:Qwen3.8-Max 86.1,超過 Fable 5 的 85.0
- AndroidWorld:85.3,Fable 5 為 88.8
- MLVU(長視頻):90.8,Fable 5 無數據
值得注意的是,Fable 5 的部分結果可能包含回退機制,千問團隊在註釋中對此作了說明。

編程能力:從空文件夾到生產級交付
千問團隊用三個真實案例測試了千問3.8-Max的自主編程能力,全程無人工介入。
案例一:十天級自動編程。 模型從零創建oh-my-cli項目,自主運行約16天,累計完成265次commits、127個PR、151個issues。它將用戶反饋、社區實踐與自測結果統一納入工程循環,實現需求自動領取、代碼生成、測試驗證的完整閉環。

案例二:復現並超越論文。 模型獨立工作約125小時,寫下約7,600行代碼,執行超過1,100步操作,跑了33輪GPU訓練,完整復現了論文《Unified Data Selection for LLM Reasoning》的六項主要結論。隨後進入"自我進化"階段,提出並測試18種改進方案,最終在競賽級數學基準AIME24上比論文原方法再提升2.7分。

案例三:24小時擊敗87%人類隊伍。 模型參加WWW2025多模態對話意圖識別挑戰賽,在526支人類隊伍中,經45次提交迭代,準確率從0.60升至0.853,擊敗458支隊伍。

辦公與長程任務:數百職業場景的生產級驗證
千問團隊在數百種高價值職業場景中測試了千問3.8-Max的實際交付能力。
-
企業合規律師:單次通讀數百份文檔,標出1,284條相關條款,一小時內完成——同等工作通常需要法務團隊約一周。
-
UI/UX設計師:生成包含8個頁面的高保真可交互原型,全程未經人工返修。
-
結構工程師:僅憑一份圖紙,在瀏覽器中還原30層寫字樓的抗震結構模型,傳統流程需一周以上。
-
量化研究:從一句任務描述出發,調度約330個子智能體,完成約6,000次回測,將原本需要數周的量化研究壓縮為一次對話內完成。
在E-Commerce Bench(365天電商經營模擬基準)中,千問3.8-Max以¥416,252(4.16倍回報)勝出,超過第二名GLM 5.2達38%,較上一代千問3.7-Max提升152%。

芯片設計:500輪交互,面積縮減81%
千問3.8-Max在芯片設計優化任務中展示了長程自主規劃能力。
目標是優化一個G CD/RSA密碼硬件加速器的邏輯門數量。模型在無參考設計、無人工干預的條件下,歷經約500輪交互、71次評估,跨越13個關鍵里程碑,將初始設計從8,298門優化至678門,在所有參評模型中表現最優。
物理實現層面,芯片面積從106×106 µm²收縮至46×46 µm²,佈線長度從33,369 µm降至4,187 µm,並實現500 MHz頻率下的時序閉合,芯片面積整體縮減81%。

多模態能力:視覺貫穿執行全流程
千問3.8-Max的視覺能力不止於"看懂圖片",而是作為持續反饋迴路貫穿任務執行。
模型在執行過程中會持續觀察中間產物——檢查頁面佈局、物體方向、動畫效果——發現問題後自主定位偏差並修正。千問團隊將這一能力定義為"原生視覺反饋迴路"。
基準測試方面,千問3.8-Max在OSWorld-Verified得分86.1,超過Fable5的85.0;AndroidWorld得分85.3,接近Fable5的88.8;ParametricCAD Bench得分91.5,超過Fable5的87.5。
為便於開發者接入,千問團隊同步推出千問-MM-Plugins,為不同智能體框架提供圖像與視頻處理、多模態記憶、視覺工具調用等擴展支持。

開放接入:支持Claude Code、Codex等主流框架
千問3.8-Max現已通過千問AI平台提供API服務,支持OpenAI兼容協議和Anthropic兼容協議,可直接與Claude Code、Codex、Qoder CLI、千問 Code、OpenClaw等主流開發工具集成。
API支持reasoning_effort參數調節推理深度:xhigh(默認,適合複雜任務)、medium(平衡準確性與速度)、low(優化速度與成本)。
模型權重將於下周在Hugging Face和ModelScope開源,屆時千問3.8-27B也將同步開源。