性能与Anthropic Fable 5相当!阿里巴巴发布千问3.8-MAX,2.4万亿个参数,长程自动编程表现出色

华尔街见闻
Aug 03

阿里巴巴旗下千问(Qwen)团队于8月3日正式发布千问3.8-Max,总参数量2.4万亿,激活参数95B,是千问家族迄今规模最大、能力最强的模型。这也是千问首次将Max级别模型开源——权重将于下周在开源社区Hugging Face和ModelScope发布。

定价方面,千问3.8-Max通过千问AI平台(阿里云)提供API调用:输入2.0美元/百万tokens,输出6.0美元/百万tokens,隐式缓存0.25美元/百万tokens。

基准测试显示,千问3.8-Max在编程智能体和通用智能体多项指标上与Anthropic Fable5表现相当,部分指标超越后者。例如,PaperBench得分93.0,高于Fable5的88.8;CoWorkBench得分74.8,与Fable5的75.9接近;WideSearch得分81.9,与Fable5的81.2持平。

性能:与 Fable 5 相当,部分超越

根据千问团队发布的完整基准测试数据,Qwen3.8-Max 在多个核心指标上与 Anthropic Claude Fable 5 持平或超出:

  • PaperBench(论文能力):Qwen3.8-Max 得分 93.0,超过 Fable 5 的 88.8 和 GPT-5.6 Sol 的 90.5
  • IFBench:Qwen3.8-Max 82.8,Fable 5 为 63.5,GPT-5.6 Sol 为 72.7
  • HealthBench:Qwen3.8-Max 60.2,超过 GPT-5.6 Sol 的 55.3
  • CoWorkBench(通用协作):Qwen3.8-Max 74.8,Fable 5 为 75.9,差距极小
  • JobBench(AI工作能力):Qwen3.8-Max 53.4,接近 Fable 5 的 57.4

多模态方面同样表现突出:

  • OSWorld-Verified:Qwen3.8-Max 86.1,超过 Fable 5 的 85.0
  • AndroidWorld85.3,Fable 5 为 88.8
  • MLVU(长视频)90.8,Fable 5 无数据

值得注意的是,Fable 5 的部分结果可能包含回退机制,千问团队在注释中对此作了说明。

编程能力:从空文件夹到生产级交付

千问团队用三个真实案例测试了千问3.8-Max的自主编程能力,全程无人工介入。

案例一:十天级自动编程。 模型从零创建oh-my-cli项目,自主运行约16天,累计完成265次commits、127个PR、151个issues。它将用户反馈、社区实践与自测结果统一纳入工程循环,实现需求自动领取、代码生成、测试验证的完整闭环。

案例二:复现并超越论文。 模型独立工作约125小时,写下约7,600行代码,执行超过1,100步操作,跑了33轮GPU训练,完整复现了论文《Unified Data Selection for LLM Reasoning》的六项主要结论。随后进入"自我进化"阶段,提出并测试18种改进方案,最终在竞赛级数学基准AIME24上比论文原方法再提升2.7分。

案例三:24小时击败87%人类队伍。 模型参加WWW2025多模态对话意图识别挑战赛,在526支人类队伍中,经45次提交迭代,准确率从0.60升至0.853,击败458支队伍。

办公与长程任务:数百职业场景的生产级验证

千问团队在数百种高价值职业场景中测试了千问3.8-Max的实际交付能力。

  • 企业合规律师:单次通读数百份文档,标出1,284条相关条款,一小时内完成——同等工作通常需要法务团队约一周。

  • UI/UX设计师:生成包含8个页面的高保真可交互原型,全程未经人工返修。

  • 结构工程师:仅凭一份图纸,在浏览器中还原30层写字楼的抗震结构模型,传统流程需一周以上。

  • 量化研究:从一句任务描述出发,调度约330个子智能体,完成约6,000次回测,将原本需要数周的量化研究压缩为一次对话内完成。

在E-Commerce Bench(365天电商经营模拟基准)中,千问3.8-Max以¥416,252(4.16倍回报)胜出,超过第二名GLM 5.2达38%,较上一代千问3.7-Max提升152%。

芯片设计:500轮交互,面积缩减81%

千问3.8-Max在芯片设计优化任务中展示了长程自主规划能力。

目标是优化一个G CD/RSA密码硬件加速器的逻辑门数量。模型在无参考设计、无人工干预的条件下,历经约500轮交互、71次评估,跨越13个关键里程碑,将初始设计从8,298门优化至678门,在所有参评模型中表现最优。

物理实现层面,芯片面积从106×106 µm²收缩至46×46 µm²,布线长度从33,369 µm降至4,187 µm,并实现500 MHz频率下的时序闭合,芯片面积整体缩减81%。

多模态能力:视觉贯穿执行全流程

千问3.8-Max的视觉能力不止于"看懂图片",而是作为持续反馈回路贯穿任务执行。

模型在执行过程中会持续观察中间产物——检查页面布局、物体方向、动画效果——发现问题后自主定位偏差并修正。千问团队将这一能力定义为"原生视觉反馈回路"。

基准测试方面,千问3.8-Max在OSWorld-Verified得分86.1,超过Fable5的85.0;AndroidWorld得分85.3,接近Fable5的88.8;ParametricCAD Bench得分91.5,超过Fable5的87.5。

为便于开发者接入,千问团队同步推出千问-MM-Plugins,为不同智能体框架提供图像与视频处理、多模态记忆、视觉工具调用等扩展支持。

开放接入:支持Claude Code、Codex等主流框架

千问3.8-Max现已通过千问AI平台提供API服务,支持OpenAI兼容协议和Anthropic兼容协议,可直接与Claude Code、Codex、Qoder CLI、千问 Code、OpenClaw等主流开发工具集成。

API支持reasoning_effort参数调节推理深度:xhigh(默认,适合复杂任务)、medium(平衡准确性与速度)、low(优化速度与成本)。

模型权重将于下周在Hugging Face和ModelScope开源,届时千问3.8-27B也将同步开源。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10