AI大模型周榜:阿里千問3.8-Max空降綜合前五,字節即夢5.0生圖第六

IT之家
08/03

IT之家 8 月 3 日消息,Arena(arena.ai)平台 AI 大模型 2026 年第 31 周排行榜發布,本期統計周期為 2026 年 7 月 27 日至 8 月 2 日。

本周排行榜迎來大量新模型更新,國產模型亮點突出:阿里 qwen3.8-max 首次亮相即殺入綜合榜 Top 5,月之暗面 kimi-k3-max 位列綜合榜第 13 名,字節跳動 seedream-5.0-pro 排名大幅上升 5 位進入 AI 生圖榜 Top 6,多款國產模型在細分排行榜取得亮眼成績。整體來看,本周國產模型在頭部梯隊佔位進一步提升,與海外頂級模型差距繼續縮小。

綜合榜

本周綜合榜頭部幾乎被 Anthropic 新品包攬,claude-fable-5 以 1509 分蟬聯榜首,第二到第四名分別為 claude-opus-4-6-thinking ( 1505 分)、 claude-opus-4-7-thinking ( 1502 分)、 claude-opus-4-6 ( 1497 分),分數差距均在 30 分以內,在統計誤差範圍內視為接近。阿里最新發布的 qwen3.8-max 以 1496 分位列第 5 名,僅比榜首低 13 分,成為目前排名最高的國產模型,表現極為突出。

國產模型在本次綜合榜已有多款進入前 25 名,梯隊分佈如下:

阿里 qwen3.8-max 排名第 5,ELO 1496 分,為本次新入榜模型;

月之暗面 kimi-k3-max 排名第 13,ELO 1485 分,本次新入榜;

阿里 qwen3.7-max-preview 排名第 22,ELO 1475 分,排名持平。

排名 模型 廠商 分數 (±CI) 票數 價格 ($/M) 輸入 / 輸出 上下文
1 🇺🇸 claude-fable-5 Anthropic 1509 ±6 17799 $10 / $50 1M
2 🇺🇸 claude-opus-4-6-thinking Anthropic 1505 ±4 67203 $5 / $25 1M
3 🇺🇸 claude-opus-4-7-thinking Anthropic 1502 ±4 54781 $5 / $25 1M
4 🇺🇸 claude-opus-4-6 Anthropic 1497 ±4 70970 $5 / $25 1M
5 🇨🇳 qwen3.8-max 阿里 1496 ±10 3327 $2 / $6 1M
6 🇺🇸 claude-opus-4-7 Anthropic 1492 ±4 55992 $5 / $25 1M
7 🇺🇸 claude-opus-5-high Anthropic 1492 ±6 10704 $5 / $25 1M
8 🇺🇸 claude-opus-5-max Anthropic 1490 ±9 5124 $5 / $25 1M
9 🇺🇸 muse-spark-1.1 Meta 1490 ±6 12086 $1.25 / $4.25 N/A
10 🇺🇸 muse-spark Meta 1488 ±6 13486 N/A N/A
— 以下為 Top 10 外的國產模型 —
13 🇨🇳 kimi-k3-max 預發布 月之暗面 1485 ±10 3556 $3 / $15 1.05M
22 🇨🇳 qwen3.7-max-preview 預發布 阿里 1475 ±10 3695 $1.48 / $4.43 1M

代碼榜

代碼榜方面,claude-fable-5 以 1553 分從第二名升至榜首,claude-opus-4-7-thinking 以 1552 分緊隨其後,兩款模型分差僅 1 分,在統計誤差範圍內並列。頭部前 8 名中,阿里 qwen3.8-max 以 1530 分位列第 10 名,月之暗面 kimi-k3-max 同樣以 1531 分排在第 8 名,國產模型首次有兩款同時殺入代碼榜 Top 10,進步顯著。

國產模型在代碼榜的具體排名如下:

月之暗面 kimi-k3-max 排名第 8,ELO 1531 分,本次新入榜,預發布狀態;

阿里 qwen3.8-max 排名第 10,ELO 1530 分,本次新入榜,預發布狀態;

阿里 qwen3.7-max-preview 排名第 17,ELO 1525 分,排名持平;

智譜 glm-5.1 排名第 28,ELO 1518 分,較上周下降 7 位;

小米 mimo-v2.5-pro 排名第 29,ELO 1518 分,排名下降 5 位。

排名 模型 廠商 分數 (±CI) 票數 價格 ($/M) 輸入 / 輸出 上下文
1 🇺🇸 claude-fable-5 Anthropic 1553 ±9 4823 $10 / $50 1M
2 🇺🇸 claude-opus-4-7-thinking Anthropic 1552 ±6 15649 $5 / $25 1M
3 🇺🇸 claude-opus-4-6-thinking Anthropic 1551 ±6 17433 $5 / $25 1M
4 🇺🇸 claude-opus-4-6 Anthropic 1548 ±6 19814 $5 / $25 1M
5 🇺🇸 claude-opus-4-7 Anthropic 1547 ±6 15915 $5 / $25 1M
6 🇺🇸 claude-opus-4-8-thinking Anthropic 1534 ±7 9830 $5 / $25 1M
7 🇺🇸 claude-opus-5-high Anthropic 1532 ±12 2918 $5 / $25 1M
8 🇨🇳 kimi-k3-max 預發布 月之暗面 1531 ±20 947 $3 / $15 1.05M
9 🇺🇸 claude-opus-4-5-20251101-thinking-32k Anthropic 1530 ±7 7606 $5 / $25 200K
10 🇨🇳 qwen3.8-max 預發布 阿里 1530 ±19 991 $2 / $6 1M
— 以下為 Top 10 外的國產模型 —
17 🇨🇳 qwen3.7-max-preview 預發布 阿里 1525 ±18 1113 $1.48 / $4.43 1M
28 🇨🇳 glm-5.1 智譜 1518 ±7 9822 $1.4 / $4.4 202.8K
29 🇨🇳 mimo-v2.5-pro 小米 1518 ±7 12665 $0.44 / $0.87 1.05M

前端開發榜

前端開發榜中,claude-opus-5-max 以 1705 分守住榜首位置,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四,國產模型共有三款進入 Top 8,佔據半壁江山。kimi-k3-max 僅落後榜首 29 分,在統計誤差範圍內與頭部海外模型非常接近。

國產模型整體處於中上游,具體排名如下:

月之暗面 kimi-k3-max 排名第 2,ELO 1676 分,預發布狀態;

阿里 qwen3.8-max 排名第 4,ELO 1668 分,預發布狀態;

智譜 glm-5.2-max 排名第 7,ELO 1586 分;

字節跳動 seed-2.1-pro-preview 排名第 19,ELO 1527 分,預發布狀態;

阿里 qwen3.7-max-20260517 排名第 23,ELO 1517 分。

排名 模型 廠商 分數 (±CI) 票數 價格 ($/M) 輸入 / 輸出 上下文
1 🇺🇸 claude-opus-5-max Anthropic 1705 ±15 2192 $5 / $25 1M
2 🇨🇳 kimi-k3-max 預發布 月之暗面 1676 ±12 4366 $3 / $15 1.05M
3 🇺🇸 claude-opus-5-high Anthropic 1669 ±11 3873 $5 / $25 1M
4 🇨🇳 qwen3.8-max 預發布 阿里 1668 ±18 1563 $2 / $6 1M
5 🇺🇸 claude-fable-5 Anthropic 1630 ±9 6310 $10 / $50 1M
6 🇺🇸 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1620 ±9 6000 $5 / $30 1.05M
7 🇨🇳 glm-5.2-max 預發布 智譜 1586 ±9 6361 $1.4 / $4.4 1M
8 🇨🇳 deepseek-v4-flash-high 預發布 深度求索 1577 ±18 1319 $0.14 / $0.28 1.05M
9 🇺🇸 claude-opus-4-8-thinking Anthropic 1566 ±8 8934 $5 / $25 1M
10 🇺🇸 claude-opus-4-7 Anthropic 1561 ±7 11755 $5 / $25 1M
— 以下為 Top 10 外的國產模型 —
19 🇨🇳 seed-2.1-pro-preview 預發布 字節跳動 1527 ±9 5513 N/A N/A
23 🇨🇳 qwen3.7-max-20260517 阿里 1517 ±8 7840 $1.48 / $4.43 1M
24 🇨🇳 hy3 預發布 騰訊 1517 ±17 1491 $0.13 / $0.53 262.1K
25 🇨🇳 glm-5.1 預發布 智譜 1516 ±8 7377 $1.4 / $4.4 202.8K
26 🇨🇳 kimi-k2.6 預發布 月之暗面 1510 ±8 9256 $0.95 / $4 262.1K
30 🇨🇳 minimax-m3 預發布 MiniMax 1491 ±8 8155 $0.6 / $2.4 N/A

智能體榜

智能體榜採用百分比信號評分體系,本周 Claude Fable 5 (High) 以 12.58% 的淨提升度穩居第一,Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二三位,頭部格局基本穩定。Anthropic 旗下模型佔據前七名中的五席,在智能體任務領域仍保持明顯優勢。工具幻覺率最低的模型是騰訊 hy3 ,僅為 0.33% ,可控性最強的模型是 Nemotron 3 Ultra,達到 20.73% 。

國產模型在智能體榜的排名和淨提升度如下:

MiniMax minimax-m3 排名第 33 名,淨提升度 2.55% ,任務確認成功率 5.67%;

深度求索 DeepSeek V4 Flash 排名第 34 名,淨提升度 2.96% ,任務確認成功率 4.9%;

小米 Mimo V2.5 Pro 排名第 32 名,淨提升度 2.52% ,任務確認成功率 3.81%;

阿里 Qwen3.7 Max 排名第 25 名,淨提升度 0.53% ,任務確認成功率 1.95%;

月之暗面 Kimi K3 (Max) 排名第 5 名,淨提升度 9.91% ,任務確認成功率 14.23%,進入智能體榜 Top 5。

排名 模型 廠商 淨提升度 (±CI) 任務確認成功率 好評 / 差評比 可控性 會話數
1 🇺🇸 Claude Fable 5 (High) Anthropic 12.58 ±2.19 10.26 24.42 12.93 23807
2 🇺🇸 Claude Opus 5 (Max) Anthropic 11.88 ±2.81 17.56 25.63 1.81 7253
3 🇺🇸 Claude Opus 5 (High) Anthropic 11.73 ±1.66 16.6 24.4 5.49 11114
4 🇺🇸 GPT 5.6 Sol (xHigh) OpenAI 10.02 ±1.63 8.61 21.9 8.96 16966
5 🇺🇸 Kimi K3 (Max) 月之暗面 9.91 ±1.19 14.23 17.45 9.67 19586
6 🇺🇸 Claude Opus 4.8 (Thinking) Anthropic 9.43 ±1.64 8.75 21.05 9.77 34477
7 🇺🇸 Claude Sonnet 5 (High) Anthropic 8.57 ±2.0 7.95 16.12 6.74 24657
8 🇺🇸 GPT 5.5 (xHigh) OpenAI 8.49 ±0.95 5.82 12.91 8.24 43122
9 🇺🇸 Claude Opus 4.7 (Thinking) Anthropic 8.19 ±1.26 6.19 11.2 9.65 35471
10 🇺🇸 GPT 5.5 (High) OpenAI 7.89 ±0.88 5.63 11.31 9.18 68340
— 以下為 Top 10 外的國產模型 —
19 🇨🇳 Claude Opus 4.8 Anthropic 3.34 ±1.94 8.24 12.75 8.39 32551
20 🇨🇳 Claude Sonnet 4.6 Anthropic 3.18 ±1.2 0.07 0.88 2.39 35966
23 🇨🇳 Kimi K2.7 Code 月之暗面 0.44 ±1.82 4.73 3.42 3.71 10359
25 🇨🇳 Qwen3.7 Max 阿里 0.53 ±0.97 1.95 5.89 0.2 20914
26 🇨🇳 DeepSeek V4 Pro 深度求索 0.78 ±0.94 3.61 5.37 0.39 21459
27 🇨🇳 hy3 騰訊 1.03 ±1.88 1.55 2.83 8.17 8506
29 🇨🇳 Kimi K2.6 月之暗面 1.09 ±1.95 3.1 1.58 4.9 10436
30 🇨🇳 gemini-3.6-flash 谷歌 1.59 ±2.68 0.15 6.2 2.59 2532
31 🇨🇳 Qwen3.7 Plus 阿里 1.65 ±1.29 1.72 7.98 4.63 14112
32 🇨🇳 Mimo V2.5 Pro 小米 2.52 ±1.01 3.81 8.05 2.11 21399
33 🇨🇳 Minimax M3 MiniMax 2.55 ±0.93 5.67 9.01 4.56 20996
34 🇨🇳 DeepSeek V4 Flash 深度求索 2.96 ±0.95 4.9 8.38 3.98 20775
41 🇨🇳 Minimax M2.7 MiniMax 11.59 ±1.17 14.67 15.74 14.94 21221

AI 生圖榜

AI 生圖榜本周最大亮點是字節跳動 seedream-5.0-pro 排名大幅上升 5 位,從第 11 名升至第 6 名,ELO 分數達到 1257 分,僅落後榜首 gpt-image-2 (medium) 124 分,成功殺入 Top 6,成為排名最高的國產 AI 生圖模型。另有多款國產模型進入前 30 名,hunyuan-image-3.0 排名第 25,seedream-4.5 排名第 28,整體表現穩定。

排名 模型 廠商 分數 (±CI) 票數 價格 ($/M) 輸入 / 輸出 上下文
1 🇺🇸 gpt-image-2 (medium) OpenAI 1381 ±5 66665 N/A N/A
2 🇺🇸 reve-2.1 Reve 1300 ±8 6131 N/A N/A
3 🇺🇸 muse-image Meta 1281 ±7 13261 N/A N/A
4 🇺🇸 reve-2.0 Reve 1270 ±6 14563 N/A N/A
5 🇺🇸 gemini-3.1-flash-image (nano-banana-2) [web-search] 谷歌 1263 ±6 25351 N/A N/A
6 🇨🇳 seedream-5.0-pro 預發布 字節跳動 1257 ±6 20977 N/A N/A
7 🇺🇸 mai-image-2.5 Microsoft AI 1254 ±5 41589 N/A N/A
8 🇺🇸 gemini-3.1-flash-lite-image (nano-banana-2-lite) 谷歌 1251 ±6 16201 N/A N/A
9 🇺🇸 gemini-3-pro-image-2k (nano-banana-pro) 谷歌 1246 ±3 135981 N/A N/A
10 🇺🇸 gpt-image-1.5-high-fidelity OpenAI 1239 ±3 139642 N/A N/A
— 以下為 Top 10 外的國產模型 —
14 🇨🇳 qwen-image-2.0-pro-2026-06-22 預發布 阿里 1191 ±6 11952 N/A N/A
25 🇨🇳 hunyuan-image-3.0 預發布 騰訊 1151 ±3 172741 N/A N/A
28 🇨🇳 seedream-4.5 預發布 字節跳動 1147 ±3 229805 N/A N/A
30 🇨🇳 seedream-4-2k 預發布 字節跳動 1140 ±7 12599 N/A N/A

AI 視頻榜

AI 視頻榜頭部格局穩定,gemini-omni-flash 以 1513 分繼續排名第一,字節跳動 dreamina-seedance-2.0-720p 以 1479 分守住第二的位置,阿里 happyhorse-1.0 以 1428 分排名第四,兩款國產模型穩居前五,表現穩定。國產模型共有 7 款進入前 30,整體佔據中上游位置。

排名 模型 廠商 分數 (±CI) 票數 價格 ($/M) 輸入 / 輸出 上下文
1 🇺🇸 gemini-omni-flash 谷歌 1513 ±12 14571 N/A N/A
2 🇨🇳 dreamina-seedance-2.0-720p 預發布 字節跳動 1479 ±11 47067 N/A N/A
3 🇺🇸 muse-video Meta 1458 ±15 2160 N/A N/A
4 🇨🇳 happyhorse-1.0 預發布 阿里 1428 ±13 21979 N/A N/A
5 🇺🇸 sora-2-pro OpenAI 1365 ±8 44543 $0 / $0.3 N/A
6 🇺🇸 veo-3.1-audio 谷歌 1364 ±14 13687 $0 / $0.4 N/A
7 🇺🇸 veo-3.1-audio-1080p 谷歌 1363 ±10 24846 N/A N/A
8 🇺🇸 veo-3.1-fast-audio 谷歌 1362 ±11 39301 $0 / $0.15 N/A
9 🇺🇸 veo-3.1-fast-audio-1080p 谷歌 1358 ±10 25637 N/A N/A
10 🇺🇸 grok-imagine-video-720p SpaceXAI 1349 ±8 151774 N/A N/A
— 以下為 Top 10 外的國產模型 —
12 🇨🇳 wan2.7-t2v 預發布 阿里 1347 ±9 15246 N/A N/A
15 🇨🇳 wan2.6-t2v 預發布 阿里 1330 ±9 41706 N/A N/A
16 🇨🇳 seedance-v1.5-pro 預發布 字節跳動 1256 ±7 75653 N/A N/A
18 🇨🇳 wan2.5-t2v-preview 預發布 阿里 1252 ±10 25895 N/A N/A
27 🇨🇳 hailuo-2.3 預發布 MiniMax 1202 ±7 72127 N/A N/A
28 🇨🇳 hailuo-02-pro 預發布 MiniMax 1198 ±13 9365 N/A N/A
29 🇨🇳 seedance-v1-pro 預發布 字節跳動 1190 ±11 12117 N/A N/A
30 🇨🇳 hailuo-02-standard 預發布 MiniMax 1180 ±12 9333 N/A N/A

總結來看,本周 Arena AI 大模型周榜迎來密集更新,大量新模型首次入榜,國產模型整體取得突破性進展:阿里 qwen3.8-max 首次亮相即殺入綜合榜 Top 5,代碼榜和前端開發榜也均有國產模型進入 Top 10;字節跳動 seedream-5.0-pro 大幅提升排名進入 AI 生圖榜 Top 6;AI 視頻榜始終有兩款國產模型穩居前五,月之暗面 kimi-k3-max 在智能體榜也進入 Top 5。國產大模型在多個維度持續縮小與海外頂級模型的差距,後續新品發布值得期待。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10