IT之家 8 月 3 日消息,Arena(arena.ai)平台 AI 大模型 2026 年第 31 周排行榜發布,本期統計周期為 2026 年 7 月 27 日至 8 月 2 日。
本周排行榜迎來大量新模型更新,國產模型亮點突出:阿里 qwen3.8-max 首次亮相即殺入綜合榜 Top 5,月之暗面 kimi-k3-max 位列綜合榜第 13 名,字節跳動 seedream-5.0-pro 排名大幅上升 5 位進入 AI 生圖榜 Top 6,多款國產模型在細分排行榜取得亮眼成績。整體來看,本周國產模型在頭部梯隊佔位進一步提升,與海外頂級模型差距繼續縮小。
綜合榜
本周綜合榜頭部幾乎被 Anthropic 新品包攬,claude-fable-5 以 1509 分蟬聯榜首,第二到第四名分別為 claude-opus-4-6-thinking ( 1505 分)、 claude-opus-4-7-thinking ( 1502 分)、 claude-opus-4-6 ( 1497 分),分數差距均在 30 分以內,在統計誤差範圍內視為接近。阿里最新發布的 qwen3.8-max 以 1496 分位列第 5 名,僅比榜首低 13 分,成為目前排名最高的國產模型,表現極為突出。
國產模型在本次綜合榜已有多款進入前 25 名,梯隊分佈如下:
阿里 qwen3.8-max 排名第 5,ELO 1496 分,為本次新入榜模型;
月之暗面 kimi-k3-max 排名第 13,ELO 1485 分,本次新入榜;
阿里 qwen3.7-max-preview 排名第 22,ELO 1475 分,排名持平。
| 排名 | 模型 | 廠商 | 分數 (±CI) | 票數 | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 claude-fable-5 | Anthropic | 1509 ±6 | 17799 | $10 / $50 | 1M |
| 2 | 🇺🇸 claude-opus-4-6-thinking | Anthropic | 1505 ±4 | 67203 | $5 / $25 | 1M |
| 3 | 🇺🇸 claude-opus-4-7-thinking | Anthropic | 1502 ±4 | 54781 | $5 / $25 | 1M |
| 4 | 🇺🇸 claude-opus-4-6 | Anthropic | 1497 ±4 | 70970 | $5 / $25 | 1M |
| 5 | 🇨🇳 qwen3.8-max | 阿里 | 1496 ±10 | 3327 | $2 / $6 | 1M |
| 6 | 🇺🇸 claude-opus-4-7 | Anthropic | 1492 ±4 | 55992 | $5 / $25 | 1M |
| 7 | 🇺🇸 claude-opus-5-high | Anthropic | 1492 ±6 | 10704 | $5 / $25 | 1M |
| 8 | 🇺🇸 claude-opus-5-max | Anthropic | 1490 ±9 | 5124 | $5 / $25 | 1M |
| 9 | 🇺🇸 muse-spark-1.1 | Meta | 1490 ±6 | 12086 | $1.25 / $4.25 | N/A |
| 10 | 🇺🇸 muse-spark | Meta | 1488 ±6 | 13486 | N/A | N/A |
| — 以下為 Top 10 外的國產模型 — | ||||||
| 13 | 🇨🇳 kimi-k3-max 預發布 | 月之暗面 | 1485 ±10 | 3556 | $3 / $15 | 1.05M |
| 22 | 🇨🇳 qwen3.7-max-preview 預發布 | 阿里 | 1475 ±10 | 3695 | $1.48 / $4.43 | 1M |
代碼榜
代碼榜方面,claude-fable-5 以 1553 分從第二名升至榜首,claude-opus-4-7-thinking 以 1552 分緊隨其後,兩款模型分差僅 1 分,在統計誤差範圍內並列。頭部前 8 名中,阿里 qwen3.8-max 以 1530 分位列第 10 名,月之暗面 kimi-k3-max 同樣以 1531 分排在第 8 名,國產模型首次有兩款同時殺入代碼榜 Top 10,進步顯著。
國產模型在代碼榜的具體排名如下:
月之暗面 kimi-k3-max 排名第 8,ELO 1531 分,本次新入榜,預發布狀態;
阿里 qwen3.8-max 排名第 10,ELO 1530 分,本次新入榜,預發布狀態;
阿里 qwen3.7-max-preview 排名第 17,ELO 1525 分,排名持平;
智譜 glm-5.1 排名第 28,ELO 1518 分,較上周下降 7 位;
小米 mimo-v2.5-pro 排名第 29,ELO 1518 分,排名下降 5 位。
| 排名 | 模型 | 廠商 | 分數 (±CI) | 票數 | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 claude-fable-5 | Anthropic | 1553 ±9 | 4823 | $10 / $50 | 1M |
| 2 | 🇺🇸 claude-opus-4-7-thinking | Anthropic | 1552 ±6 | 15649 | $5 / $25 | 1M |
| 3 | 🇺🇸 claude-opus-4-6-thinking | Anthropic | 1551 ±6 | 17433 | $5 / $25 | 1M |
| 4 | 🇺🇸 claude-opus-4-6 | Anthropic | 1548 ±6 | 19814 | $5 / $25 | 1M |
| 5 | 🇺🇸 claude-opus-4-7 | Anthropic | 1547 ±6 | 15915 | $5 / $25 | 1M |
| 6 | 🇺🇸 claude-opus-4-8-thinking | Anthropic | 1534 ±7 | 9830 | $5 / $25 | 1M |
| 7 | 🇺🇸 claude-opus-5-high | Anthropic | 1532 ±12 | 2918 | $5 / $25 | 1M |
| 8 | 🇨🇳 kimi-k3-max 預發布 | 月之暗面 | 1531 ±20 | 947 | $3 / $15 | 1.05M |
| 9 | 🇺🇸 claude-opus-4-5-20251101-thinking-32k | Anthropic | 1530 ±7 | 7606 | $5 / $25 | 200K |
| 10 | 🇨🇳 qwen3.8-max 預發布 | 阿里 | 1530 ±19 | 991 | $2 / $6 | 1M |
| — 以下為 Top 10 外的國產模型 — | ||||||
| 17 | 🇨🇳 qwen3.7-max-preview 預發布 | 阿里 | 1525 ±18 | 1113 | $1.48 / $4.43 | 1M |
| 28 | 🇨🇳 glm-5.1 | 智譜 | 1518 ±7 | 9822 | $1.4 / $4.4 | 202.8K |
| 29 | 🇨🇳 mimo-v2.5-pro | 小米 | 1518 ±7 | 12665 | $0.44 / $0.87 | 1.05M |
前端開發榜
前端開發榜中,claude-opus-5-max 以 1705 分守住榜首位置,月之暗面 kimi-k3-max 以 1676 分位列第二,阿里 qwen3.8-max 以 1668 分排名第四,國產模型共有三款進入 Top 8,佔據半壁江山。kimi-k3-max 僅落後榜首 29 分,在統計誤差範圍內與頭部海外模型非常接近。
國產模型整體處於中上游,具體排名如下:
月之暗面 kimi-k3-max 排名第 2,ELO 1676 分,預發布狀態;
阿里 qwen3.8-max 排名第 4,ELO 1668 分,預發布狀態;
智譜 glm-5.2-max 排名第 7,ELO 1586 分;
字節跳動 seed-2.1-pro-preview 排名第 19,ELO 1527 分,預發布狀態;
阿里 qwen3.7-max-20260517 排名第 23,ELO 1517 分。
| 排名 | 模型 | 廠商 | 分數 (±CI) | 票數 | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 claude-opus-5-max | Anthropic | 1705 ±15 | 2192 | $5 / $25 | 1M |
| 2 | 🇨🇳 kimi-k3-max 預發布 | 月之暗面 | 1676 ±12 | 4366 | $3 / $15 | 1.05M |
| 3 | 🇺🇸 claude-opus-5-high | Anthropic | 1669 ±11 | 3873 | $5 / $25 | 1M |
| 4 | 🇨🇳 qwen3.8-max 預發布 | 阿里 | 1668 ±18 | 1563 | $2 / $6 | 1M |
| 5 | 🇺🇸 claude-fable-5 | Anthropic | 1630 ±9 | 6310 | $10 / $50 | 1M |
| 6 | 🇺🇸 gpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1620 ±9 | 6000 | $5 / $30 | 1.05M |
| 7 | 🇨🇳 glm-5.2-max 預發布 | 智譜 | 1586 ±9 | 6361 | $1.4 / $4.4 | 1M |
| 8 | 🇨🇳 deepseek-v4-flash-high 預發布 | 深度求索 | 1577 ±18 | 1319 | $0.14 / $0.28 | 1.05M |
| 9 | 🇺🇸 claude-opus-4-8-thinking | Anthropic | 1566 ±8 | 8934 | $5 / $25 | 1M |
| 10 | 🇺🇸 claude-opus-4-7 | Anthropic | 1561 ±7 | 11755 | $5 / $25 | 1M |
| — 以下為 Top 10 外的國產模型 — | ||||||
| 19 | 🇨🇳 seed-2.1-pro-preview 預發布 | 字節跳動 | 1527 ±9 | 5513 | N/A | N/A |
| 23 | 🇨🇳 qwen3.7-max-20260517 | 阿里 | 1517 ±8 | 7840 | $1.48 / $4.43 | 1M |
| 24 | 🇨🇳 hy3 預發布 | 騰訊 | 1517 ±17 | 1491 | $0.13 / $0.53 | 262.1K |
| 25 | 🇨🇳 glm-5.1 預發布 | 智譜 | 1516 ±8 | 7377 | $1.4 / $4.4 | 202.8K |
| 26 | 🇨🇳 kimi-k2.6 預發布 | 月之暗面 | 1510 ±8 | 9256 | $0.95 / $4 | 262.1K |
| 30 | 🇨🇳 minimax-m3 預發布 | MiniMax | 1491 ±8 | 8155 | $0.6 / $2.4 | N/A |
智能體榜
智能體榜採用百分比信號評分體系,本周 Claude Fable 5 (High) 以 12.58% 的淨提升度穩居第一,Claude Opus 5 (Max) 和 Claude Opus 5 (High) 分列二三位,頭部格局基本穩定。Anthropic 旗下模型佔據前七名中的五席,在智能體任務領域仍保持明顯優勢。工具幻覺率最低的模型是騰訊 hy3 ,僅為 0.33% ,可控性最強的模型是 Nemotron 3 Ultra,達到 20.73% 。
國產模型在智能體榜的排名和淨提升度如下:
MiniMax minimax-m3 排名第 33 名,淨提升度 2.55% ,任務確認成功率 5.67%;
深度求索 DeepSeek V4 Flash 排名第 34 名,淨提升度 2.96% ,任務確認成功率 4.9%;
小米 Mimo V2.5 Pro 排名第 32 名,淨提升度 2.52% ,任務確認成功率 3.81%;
阿里 Qwen3.7 Max 排名第 25 名,淨提升度 0.53% ,任務確認成功率 1.95%;
月之暗面 Kimi K3 (Max) 排名第 5 名,淨提升度 9.91% ,任務確認成功率 14.23%,進入智能體榜 Top 5。
| 排名 | 模型 | 廠商 | 淨提升度 (±CI) | 任務確認成功率 | 好評 / 差評比 | 可控性 | 會話數 |
|---|---|---|---|---|---|---|---|
| 1 | 🇺🇸 Claude Fable 5 (High) | Anthropic | 12.58 ±2.19 | 10.26 | 24.42 | 12.93 | 23807 |
| 2 | 🇺🇸 Claude Opus 5 (Max) | Anthropic | 11.88 ±2.81 | 17.56 | 25.63 | 1.81 | 7253 |
| 3 | 🇺🇸 Claude Opus 5 (High) | Anthropic | 11.73 ±1.66 | 16.6 | 24.4 | 5.49 | 11114 |
| 4 | 🇺🇸 GPT 5.6 Sol (xHigh) | OpenAI | 10.02 ±1.63 | 8.61 | 21.9 | 8.96 | 16966 |
| 5 | 🇺🇸 Kimi K3 (Max) | 月之暗面 | 9.91 ±1.19 | 14.23 | 17.45 | 9.67 | 19586 |
| 6 | 🇺🇸 Claude Opus 4.8 (Thinking) | Anthropic | 9.43 ±1.64 | 8.75 | 21.05 | 9.77 | 34477 |
| 7 | 🇺🇸 Claude Sonnet 5 (High) | Anthropic | 8.57 ±2.0 | 7.95 | 16.12 | 6.74 | 24657 |
| 8 | 🇺🇸 GPT 5.5 (xHigh) | OpenAI | 8.49 ±0.95 | 5.82 | 12.91 | 8.24 | 43122 |
| 9 | 🇺🇸 Claude Opus 4.7 (Thinking) | Anthropic | 8.19 ±1.26 | 6.19 | 11.2 | 9.65 | 35471 |
| 10 | 🇺🇸 GPT 5.5 (High) | OpenAI | 7.89 ±0.88 | 5.63 | 11.31 | 9.18 | 68340 |
| — 以下為 Top 10 外的國產模型 — | |||||||
| 19 | 🇨🇳 Claude Opus 4.8 | Anthropic | 3.34 ±1.94 | 8.24 | 12.75 | 8.39 | 32551 |
| 20 | 🇨🇳 Claude Sonnet 4.6 | Anthropic | 3.18 ±1.2 | 0.07 | 0.88 | 2.39 | 35966 |
| 23 | 🇨🇳 Kimi K2.7 Code | 月之暗面 | 0.44 ±1.82 | 4.73 | 3.42 | 3.71 | 10359 |
| 25 | 🇨🇳 Qwen3.7 Max | 阿里 | 0.53 ±0.97 | 1.95 | 5.89 | 0.2 | 20914 |
| 26 | 🇨🇳 DeepSeek V4 Pro | 深度求索 | 0.78 ±0.94 | 3.61 | 5.37 | 0.39 | 21459 |
| 27 | 🇨🇳 hy3 | 騰訊 | 1.03 ±1.88 | 1.55 | 2.83 | 8.17 | 8506 |
| 29 | 🇨🇳 Kimi K2.6 | 月之暗面 | 1.09 ±1.95 | 3.1 | 1.58 | 4.9 | 10436 |
| 30 | 🇨🇳 gemini-3.6-flash | 谷歌 | 1.59 ±2.68 | 0.15 | 6.2 | 2.59 | 2532 |
| 31 | 🇨🇳 Qwen3.7 Plus | 阿里 | 1.65 ±1.29 | 1.72 | 7.98 | 4.63 | 14112 |
| 32 | 🇨🇳 Mimo V2.5 Pro | 小米 | 2.52 ±1.01 | 3.81 | 8.05 | 2.11 | 21399 |
| 33 | 🇨🇳 Minimax M3 | MiniMax | 2.55 ±0.93 | 5.67 | 9.01 | 4.56 | 20996 |
| 34 | 🇨🇳 DeepSeek V4 Flash | 深度求索 | 2.96 ±0.95 | 4.9 | 8.38 | 3.98 | 20775 |
| 41 | 🇨🇳 Minimax M2.7 | MiniMax | 11.59 ±1.17 | 14.67 | 15.74 | 14.94 | 21221 |
AI 生圖榜
AI 生圖榜本周最大亮點是字節跳動 seedream-5.0-pro 排名大幅上升 5 位,從第 11 名升至第 6 名,ELO 分數達到 1257 分,僅落後榜首 gpt-image-2 (medium) 124 分,成功殺入 Top 6,成為排名最高的國產 AI 生圖模型。另有多款國產模型進入前 30 名,hunyuan-image-3.0 排名第 25,seedream-4.5 排名第 28,整體表現穩定。
| 排名 | 模型 | 廠商 | 分數 (±CI) | 票數 | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 gpt-image-2 (medium) | OpenAI | 1381 ±5 | 66665 | N/A | N/A |
| 2 | 🇺🇸 reve-2.1 | Reve | 1300 ±8 | 6131 | N/A | N/A |
| 3 | 🇺🇸 muse-image | Meta | 1281 ±7 | 13261 | N/A | N/A |
| 4 | 🇺🇸 reve-2.0 | Reve | 1270 ±6 | 14563 | N/A | N/A |
| 5 | 🇺🇸 gemini-3.1-flash-image (nano-banana-2) [web-search] | 谷歌 | 1263 ±6 | 25351 | N/A | N/A |
| 6 | 🇨🇳 seedream-5.0-pro 預發布 | 字節跳動 | 1257 ±6 | 20977 | N/A | N/A |
| 7 | 🇺🇸 mai-image-2.5 | Microsoft AI | 1254 ±5 | 41589 | N/A | N/A |
| 8 | 🇺🇸 gemini-3.1-flash-lite-image (nano-banana-2-lite) | 谷歌 | 1251 ±6 | 16201 | N/A | N/A |
| 9 | 🇺🇸 gemini-3-pro-image-2k (nano-banana-pro) | 谷歌 | 1246 ±3 | 135981 | N/A | N/A |
| 10 | 🇺🇸 gpt-image-1.5-high-fidelity | OpenAI | 1239 ±3 | 139642 | N/A | N/A |
| — 以下為 Top 10 外的國產模型 — | ||||||
| 14 | 🇨🇳 qwen-image-2.0-pro-2026-06-22 預發布 | 阿里 | 1191 ±6 | 11952 | N/A | N/A |
| 25 | 🇨🇳 hunyuan-image-3.0 預發布 | 騰訊 | 1151 ±3 | 172741 | N/A | N/A |
| 28 | 🇨🇳 seedream-4.5 預發布 | 字節跳動 | 1147 ±3 | 229805 | N/A | N/A |
| 30 | 🇨🇳 seedream-4-2k 預發布 | 字節跳動 | 1140 ±7 | 12599 | N/A | N/A |
AI 視頻榜
AI 視頻榜頭部格局穩定,gemini-omni-flash 以 1513 分繼續排名第一,字節跳動 dreamina-seedance-2.0-720p 以 1479 分守住第二的位置,阿里 happyhorse-1.0 以 1428 分排名第四,兩款國產模型穩居前五,表現穩定。國產模型共有 7 款進入前 30,整體佔據中上游位置。
| 排名 | 模型 | 廠商 | 分數 (±CI) | 票數 | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | 🇺🇸 gemini-omni-flash | 谷歌 | 1513 ±12 | 14571 | N/A | N/A |
| 2 | 🇨🇳 dreamina-seedance-2.0-720p 預發布 | 字節跳動 | 1479 ±11 | 47067 | N/A | N/A |
| 3 | 🇺🇸 muse-video | Meta | 1458 ±15 | 2160 | N/A | N/A |
| 4 | 🇨🇳 happyhorse-1.0 預發布 | 阿里 | 1428 ±13 | 21979 | N/A | N/A |
| 5 | 🇺🇸 sora-2-pro | OpenAI | 1365 ±8 | 44543 | $0 / $0.3 | N/A |
| 6 | 🇺🇸 veo-3.1-audio | 谷歌 | 1364 ±14 | 13687 | $0 / $0.4 | N/A |
| 7 | 🇺🇸 veo-3.1-audio-1080p | 谷歌 | 1363 ±10 | 24846 | N/A | N/A |
| 8 | 🇺🇸 veo-3.1-fast-audio | 谷歌 | 1362 ±11 | 39301 | $0 / $0.15 | N/A |
| 9 | 🇺🇸 veo-3.1-fast-audio-1080p | 谷歌 | 1358 ±10 | 25637 | N/A | N/A |
| 10 | 🇺🇸 grok-imagine-video-720p | SpaceXAI | 1349 ±8 | 151774 | N/A | N/A |
| — 以下為 Top 10 外的國產模型 — | ||||||
| 12 | 🇨🇳 wan2.7-t2v 預發布 | 阿里 | 1347 ±9 | 15246 | N/A | N/A |
| 15 | 🇨🇳 wan2.6-t2v 預發布 | 阿里 | 1330 ±9 | 41706 | N/A | N/A |
| 16 | 🇨🇳 seedance-v1.5-pro 預發布 | 字節跳動 | 1256 ±7 | 75653 | N/A | N/A |
| 18 | 🇨🇳 wan2.5-t2v-preview 預發布 | 阿里 | 1252 ±10 | 25895 | N/A | N/A |
| 27 | 🇨🇳 hailuo-2.3 預發布 | MiniMax | 1202 ±7 | 72127 | N/A | N/A |
| 28 | 🇨🇳 hailuo-02-pro 預發布 | MiniMax | 1198 ±13 | 9365 | N/A | N/A |
| 29 | 🇨🇳 seedance-v1-pro 預發布 | 字節跳動 | 1190 ±11 | 12117 | N/A | N/A |
| 30 | 🇨🇳 hailuo-02-standard 預發布 | MiniMax | 1180 ±12 | 9333 | N/A | N/A |
總結來看,本周 Arena AI 大模型周榜迎來密集更新,大量新模型首次入榜,國產模型整體取得突破性進展:阿里 qwen3.8-max 首次亮相即殺入綜合榜 Top 5,代碼榜和前端開發榜也均有國產模型進入 Top 10;字節跳動 seedream-5.0-pro 大幅提升排名進入 AI 生圖榜 Top 6;AI 視頻榜始終有兩款國產模型穩居前五,月之暗面 kimi-k3-max 在智能體榜也進入 Top 5。國產大模型在多個維度持續縮小與海外頂級模型的差距,後續新品發布值得期待。