AI大模型周榜:阿里千问3.8-Max空降综合前五,字节即梦5.0生图第六

IT之家
Aug 03

IT之家 8 月 3 日消息,Arena(arena.ai)平台 AI 大模型 2026 年第 31 周排行榜发布,本期统计周期为 2026 年 7 月 27 日至 8 月 2 日。

本周榜单迎来大量新模型更新,国产模型亮点突出:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,月之暗面 kimi-k3-max 位列综合榜第 13 名,字节跳动 seedream-5.0-pro 排名大幅上升 5 位进入 AI 生图榜 Top 6,多款国产模型在细分榜单取得亮眼成绩。整体来看,本周国产模型在头部梯队占位进一步提升,与海外顶级模型差距继续缩小。

综合榜

本周综合榜头部几乎被 Anthropic 新品包揽,claude-fable-5 以 1509 分蝉联榜首,第二到第四名分别为 claude-opus-4-6-thinking ( 1505 分)、 claude-opus-4-7-thinking ( 1502 分)、 claude-opus-4-6 ( 1497 分),分数差距均在 30 分以内,在统计误差范围内视为接近。阿里最新发布的 qwen3.8-max 以 1496 分位列第 5 名,仅比榜首低 13 分,成为目前排名最高的国产模型,表现极为突出。

国产模型在本次综合榜已有多款进入前 25 名,梯队分布如下:

阿里 qwen3.8-max 排名第 5,ELO 1496 分,为本次新入榜模型;

月之暗面 kimi-k3-max 排名第 13,ELO 1485 分,本次新入榜;

阿里 qwen3.7-max-preview 排名第 22,ELO 1475 分,排名持平。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 claude-fable-5 Anthropic 1509 ±6 17799 $10 / $50 1M
2 🇺🇸 claude-opus-4-6-thinking Anthropic 1505 ±4 67203 $5 / $25 1M
3 🇺🇸 claude-opus-4-7-thinking Anthropic 1502 ±4 54781 $5 / $25 1M
4 🇺🇸 claude-opus-4-6 Anthropic 1497 ±4 70970 $5 / $25 1M
5 🇨🇳 qwen3.8-max 阿里 1496 ±10 3327 $2 / $6 1M
6 🇺🇸 claude-opus-4-7 Anthropic 1492 ±4 55992 $5 / $25 1M
7 🇺🇸 claude-opus-5-high Anthropic 1492 ±6 10704 $5 / $25 1M
8 🇺🇸 claude-opus-5-max Anthropic 1490 ±9 5124 $5 / $25 1M
9 🇺🇸 muse-spark-1.1 Meta 1490 ±6 12086 $1.25 / $4.25 N/A
10 🇺🇸 muse-spark Meta 1488 ±6 13486 N/A N/A
— 以下为 Top 10 外的国产模型 —
13 🇨🇳 kimi-k3-max 预发布 月之暗面 1485 ±10 3556 $3 / $15 1.05M
22 🇨🇳 qwen3.7-max-preview 预发布 阿里 1475 ±10 3695 $1.48 / $4.43 1M

代码榜

代码榜方面,claude-fable-5 以 1553 分从第二名升至榜首,claude-opus-4-7-thinking 以 1552 分紧随其后,两款模型分差仅 1 分,在统计误差范围内并列。头部前 8 名中,阿里 qwen3.8-max 以 1530 分位列第 10 名,月之暗面 kimi-k3-max 同样以 1531 分排在第 8 名,国产模型首次有两款同时杀入代码榜 Top 10,进步显著。

国产模型在代码榜的具体排名如下:

月之暗面 kimi-k3-max 排名第 8,ELO 1531 分,本次新入榜,预发布状态;

阿里 qwen3.8-max 排名第 10,ELO 1530 分,本次新入榜,预发布状态;

阿里 qwen3.7-max-preview 排名第 17,ELO 1525 分,排名持平;

智谱 glm-5.1 排名第 28,ELO 1518 分,较上周下降 7 位;

小米 mimo-v2.5-pro 排名第 29,ELO 1518 分,排名下降 5 位。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 claude-fable-5 Anthropic 1553 ±9 4823 $10 / $50 1M
2 🇺🇸 claude-opus-4-7-thinking Anthropic 1552 ±6 15649 $5 / $25 1M
3 🇺🇸 claude-opus-4-6-thinking Anthropic 1551 ±6 17433 $5 / $25 1M
4 🇺🇸 claude-opus-4-6 Anthropic 1548 ±6 19814 $5 / $25 1M
5 🇺🇸 claude-opus-4-7 Anthropic 1547 ±6 15915 $5 / $25 1M
6 🇺🇸 claude-opus-4-8-thinking Anthropic 1534 ±7 9830 $5 / $25 1M
7 🇺🇸 claude-opus-5-high Anthropic 1532 ±12 2918 $5 / $25 1M
8 🇨🇳 kimi-k3-max 预发布 月之暗面 1531 ±20 947 $3 / $15 1.05M
9 🇺🇸 claude-opus-4-5-20251101-thinking-32k Anthropic 1530 ±7 7606 $5 / $25 200K
10 🇨🇳 qwen3.8-max 预发布 阿里 1530 ±19 991 $2 / $6 1M
— 以下为 Top 10 外的国产模型 —
17 🇨🇳 qwen3.7-max-preview 预发布 阿里 1525 ±18 1113 $1.48 / $4.43 1M
28 🇨🇳 glm-5.1 智谱 1518 ±7 9822 $1.4 / $4.4 202.8K
29 🇨🇳 mimo-v2.5-pro 小米 1518 ±7 12665 $0.44 / $0.87 1.05M

前端开发榜

前端开发榜中,claude-opus-5-max 以 1705 分守住榜首位置,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四,国产模型共有三款进入 Top 8,占据半壁江山。kimi-k3-max 仅落后榜首 29 分,在统计误差范围内与头部海外模型非常接近。

国产模型整体处于中上游,具体排名如下:

月之暗面 kimi-k3-max 排名第 2,ELO 1676 分,预发布状态;

阿里 qwen3.8-max 排名第 4,ELO 1668 分,预发布状态;

智谱 glm-5.2-max 排名第 7,ELO 1586 分;

字节跳动 seed-2.1-pro-preview 排名第 19,ELO 1527 分,预发布状态;

阿里 qwen3.7-max-20260517 排名第 23,ELO 1517 分。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 claude-opus-5-max Anthropic 1705 ±15 2192 $5 / $25 1M
2 🇨🇳 kimi-k3-max 预发布 月之暗面 1676 ±12 4366 $3 / $15 1.05M
3 🇺🇸 claude-opus-5-high Anthropic 1669 ±11 3873 $5 / $25 1M
4 🇨🇳 qwen3.8-max 预发布 阿里 1668 ±18 1563 $2 / $6 1M
5 🇺🇸 claude-fable-5 Anthropic 1630 ±9 6310 $10 / $50 1M
6 🇺🇸 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1620 ±9 6000 $5 / $30 1.05M
7 🇨🇳 glm-5.2-max 预发布 智谱 1586 ±9 6361 $1.4 / $4.4 1M
8 🇨🇳 deepseek-v4-flash-high 预发布 深度求索 1577 ±18 1319 $0.14 / $0.28 1.05M
9 🇺🇸 claude-opus-4-8-thinking Anthropic 1566 ±8 8934 $5 / $25 1M
10 🇺🇸 claude-opus-4-7 Anthropic 1561 ±7 11755 $5 / $25 1M
— 以下为 Top 10 外的国产模型 —
19 🇨🇳 seed-2.1-pro-preview 预发布 字节跳动 1527 ±9 5513 N/A N/A
23 🇨🇳 qwen3.7-max-20260517 阿里 1517 ±8 7840 $1.48 / $4.43 1M
24 🇨🇳 hy3 预发布 腾讯 1517 ±17 1491 $0.13 / $0.53 262.1K
25 🇨🇳 glm-5.1 预发布 智谱 1516 ±8 7377 $1.4 / $4.4 202.8K
26 🇨🇳 kimi-k2.6 预发布 月之暗面 1510 ±8 9256 $0.95 / $4 262.1K
30 🇨🇳 minimax-m3 预发布 MiniMax 1491 ±8 8155 $0.6 / $2.4 N/A

智能体榜

智能体榜采用百分比信号评分体系,本周 Claude Fable 5 (High) 以 12.58% 的净提升度稳居第一,Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二三位,头部格局基本稳定。Anthropic 旗下模型占据前七名中的五席,在智能体任务领域仍保持明显优势。工具幻觉率最低的模型是腾讯 hy3 ,仅为 0.33% ,可控性最强的模型是 Nemotron 3 Ultra,达到 20.73% 。

国产模型在智能体榜的排名和净提升度如下:

MiniMax minimax-m3 排名第 33 名,净提升度 2.55% ,任务确认成功率 5.67%;

深度求索 DeepSeek V4 Flash 排名第 34 名,净提升度 2.96% ,任务确认成功率 4.9%;

小米 Mimo V2.5 Pro 排名第 32 名,净提升度 2.52% ,任务确认成功率 3.81%;

阿里 Qwen3.7 Max 排名第 25 名,净提升度 0.53% ,任务确认成功率 1.95%;

月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 9.91% ,任务确认成功率 14.23%,进入智能体榜 Top 5。

排名 模型 厂商 净提升度 (±CI) 任务确认成功率 好评 / 差评比 可控性 会话数
1 🇺🇸 Claude Fable 5 (High) Anthropic 12.58 ±2.19 10.26 24.42 12.93 23807
2 🇺🇸 Claude Opus 5 (Max) Anthropic 11.88 ±2.81 17.56 25.63 1.81 7253
3 🇺🇸 Claude Opus 5 (High) Anthropic 11.73 ±1.66 16.6 24.4 5.49 11114
4 🇺🇸 GPT 5.6 Sol (xHigh) OpenAI 10.02 ±1.63 8.61 21.9 8.96 16966
5 🇺🇸 Kimi K3 (Max) 月之暗面 9.91 ±1.19 14.23 17.45 9.67 19586
6 🇺🇸 Claude Opus 4.8 (Thinking) Anthropic 9.43 ±1.64 8.75 21.05 9.77 34477
7 🇺🇸 Claude Sonnet 5 (High) Anthropic 8.57 ±2.0 7.95 16.12 6.74 24657
8 🇺🇸 GPT 5.5 (xHigh) OpenAI 8.49 ±0.95 5.82 12.91 8.24 43122
9 🇺🇸 Claude Opus 4.7 (Thinking) Anthropic 8.19 ±1.26 6.19 11.2 9.65 35471
10 🇺🇸 GPT 5.5 (High) OpenAI 7.89 ±0.88 5.63 11.31 9.18 68340
— 以下为 Top 10 外的国产模型 —
19 🇨🇳 Claude Opus 4.8 Anthropic 3.34 ±1.94 8.24 12.75 8.39 32551
20 🇨🇳 Claude Sonnet 4.6 Anthropic 3.18 ±1.2 0.07 0.88 2.39 35966
23 🇨🇳 Kimi K2.7 Code 月之暗面 0.44 ±1.82 4.73 3.42 3.71 10359
25 🇨🇳 Qwen3.7 Max 阿里 0.53 ±0.97 1.95 5.89 0.2 20914
26 🇨🇳 DeepSeek V4 Pro 深度求索 0.78 ±0.94 3.61 5.37 0.39 21459
27 🇨🇳 hy3 腾讯 1.03 ±1.88 1.55 2.83 8.17 8506
29 🇨🇳 Kimi K2.6 月之暗面 1.09 ±1.95 3.1 1.58 4.9 10436
30 🇨🇳 gemini-3.6-flash 谷歌 1.59 ±2.68 0.15 6.2 2.59 2532
31 🇨🇳 Qwen3.7 Plus 阿里 1.65 ±1.29 1.72 7.98 4.63 14112
32 🇨🇳 Mimo V2.5 Pro 小米 2.52 ±1.01 3.81 8.05 2.11 21399
33 🇨🇳 Minimax M3 MiniMax 2.55 ±0.93 5.67 9.01 4.56 20996
34 🇨🇳 DeepSeek V4 Flash 深度求索 2.96 ±0.95 4.9 8.38 3.98 20775
41 🇨🇳 Minimax M2.7 MiniMax 11.59 ±1.17 14.67 15.74 14.94 21221

AI 生图榜

AI 生图榜本周最大亮点是字节跳动 seedream-5.0-pro 排名大幅上升 5 位,从第 11 名升至第 6 名,ELO 分数达到 1257 分,仅落后榜首 gpt-image-2 (medium) 124 分,成功杀入 Top 6,成为排名最高的国产 AI 生图模型。另有多款国产模型进入前 30 名,hunyuan-image-3.0 排名第 25,seedream-4.5 排名第 28,整体表现稳定。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 gpt-image-2 (medium) OpenAI 1381 ±5 66665 N/A N/A
2 🇺🇸 reve-2.1 Reve 1300 ±8 6131 N/A N/A
3 🇺🇸 muse-image Meta 1281 ±7 13261 N/A N/A
4 🇺🇸 reve-2.0 Reve 1270 ±6 14563 N/A N/A
5 🇺🇸 gemini-3.1-flash-image (nano-banana-2) [web-search] 谷歌 1263 ±6 25351 N/A N/A
6 🇨🇳 seedream-5.0-pro 预发布 字节跳动 1257 ±6 20977 N/A N/A
7 🇺🇸 mai-image-2.5 Microsoft AI 1254 ±5 41589 N/A N/A
8 🇺🇸 gemini-3.1-flash-lite-image (nano-banana-2-lite) 谷歌 1251 ±6 16201 N/A N/A
9 🇺🇸 gemini-3-pro-image-2k (nano-banana-pro) 谷歌 1246 ±3 135981 N/A N/A
10 🇺🇸 gpt-image-1.5-high-fidelity OpenAI 1239 ±3 139642 N/A N/A
— 以下为 Top 10 外的国产模型 —
14 🇨🇳 qwen-image-2.0-pro-2026-06-22 预发布 阿里 1191 ±6 11952 N/A N/A
25 🇨🇳 hunyuan-image-3.0 预发布 腾讯 1151 ±3 172741 N/A N/A
28 🇨🇳 seedream-4.5 预发布 字节跳动 1147 ±3 229805 N/A N/A
30 🇨🇳 seedream-4-2k 预发布 字节跳动 1140 ±7 12599 N/A N/A

AI 视频榜

AI 视频榜头部格局稳定,gemini-omni-flash 以 1513 分继续排名第一,字节跳动 dreamina-seedance-2.0-720p 以 1479 分守住第二的位置,阿里 happyhorse-1.0 以 1428 分排名第四,两款国产模型稳居前五,表现稳定。国产模型共有 7 款进入前 30,整体占据中上游位置。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 🇺🇸 gemini-omni-flash 谷歌 1513 ±12 14571 N/A N/A
2 🇨🇳 dreamina-seedance-2.0-720p 预发布 字节跳动 1479 ±11 47067 N/A N/A
3 🇺🇸 muse-video Meta 1458 ±15 2160 N/A N/A
4 🇨🇳 happyhorse-1.0 预发布 阿里 1428 ±13 21979 N/A N/A
5 🇺🇸 sora-2-pro OpenAI 1365 ±8 44543 $0 / $0.3 N/A
6 🇺🇸 veo-3.1-audio 谷歌 1364 ±14 13687 $0 / $0.4 N/A
7 🇺🇸 veo-3.1-audio-1080p 谷歌 1363 ±10 24846 N/A N/A
8 🇺🇸 veo-3.1-fast-audio 谷歌 1362 ±11 39301 $0 / $0.15 N/A
9 🇺🇸 veo-3.1-fast-audio-1080p 谷歌 1358 ±10 25637 N/A N/A
10 🇺🇸 grok-imagine-video-720p SpaceXAI 1349 ±8 151774 N/A N/A
— 以下为 Top 10 外的国产模型 —
12 🇨🇳 wan2.7-t2v 预发布 阿里 1347 ±9 15246 N/A N/A
15 🇨🇳 wan2.6-t2v 预发布 阿里 1330 ±9 41706 N/A N/A
16 🇨🇳 seedance-v1.5-pro 预发布 字节跳动 1256 ±7 75653 N/A N/A
18 🇨🇳 wan2.5-t2v-preview 预发布 阿里 1252 ±10 25895 N/A N/A
27 🇨🇳 hailuo-2.3 预发布 MiniMax 1202 ±7 72127 N/A N/A
28 🇨🇳 hailuo-02-pro 预发布 MiniMax 1198 ±13 9365 N/A N/A
29 🇨🇳 seedance-v1-pro 预发布 字节跳动 1190 ±11 12117 N/A N/A
30 🇨🇳 hailuo-02-standard 预发布 MiniMax 1180 ±12 9333 N/A N/A

总结来看,本周 Arena AI 大模型周榜迎来密集更新,大量新模型首次入榜,国产模型整体取得突破性进展:阿里 qwen3.8-max 首次亮相即杀入综合榜 Top 5,代码榜和前端开发榜也均有国产模型进入 Top 10;字节跳动 seedream-5.0-pro 大幅提升排名进入 AI 生图榜 Top 6;AI 视频榜始终有两款国产模型稳居前五,月之暗面 kimi-k3-max 在智能体榜也进入 Top 5。国产大模型在多个维度持续缩小与海外顶级模型的差距,后续新品发布值得期待。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10