AI大模型周榜:國產GLM-5.3-Flash首秀殺進代碼榜前十,千問3.8-Max登頂前端榜

IT之家
09/02

IT之家 9 月 2 日消息,Arena(arena.ai)平台發布 2026 年第 35 周(8 月 24 日 ~8 月 30 日)AI 大模型盲測排行榜,本期有多款國產新模型亮相,且取得亮眼排名。

國產 GLM-5.3-Flash 首次進入代碼榜 Top 10,Qwen3.8-Max-0902 首次入榜即登頂前端開發榜榜首,Kimi-K3-Max 穩定守住綜合榜 Top 10 位置,整體來看國產模型在細分領域繼續保持競爭力。

IT之家注:本排行榜基於 Arena(arena.ai)平台匿名盲測投票,通過 ELO(智能體榜為百分比信號)計算排名,反映用戶主觀偏好而非絕對能力測試;不同分榜相互獨立,不宜跨榜比較,分差在誤差範圍內均視為並列,新模型也需積累一月供票量後纔會正式入榜。

綜合榜

本周綜合榜頭部格局穩定,Claude-Fable-5 以 1508 分蟬聯榜首,Anthropic 多款模型佔據前七位,排名變化均在 1 位以內,ELO 分差均在 30 分以內,屬於統計誤差範圍內的接近。

另外,本周有兩款新模型入榜,分別是谷歌 Gemini-3-Flash 和智譜 GLM-5.3-Flash,首秀分別排在第 27 位和第 30 位,ELO 分數分別為 1474 分和 1473 分。

國產模型整體處於中上游位置:

月之暗面 kimi-k3-max 排名最高,位列第 10 名,ELO 1489 分,排名持平;

智譜 glm-5.3-max 位列第 17 名,ELO 1482 分,較上周下降 4 位;

阿里 qwen3.8-max 位列第 20 名,ELO 1479 分,較上周下降 1 位;

阿里 qwen3.7-max-preview 位列第 28 名,ELO 1474 分,排名下降 1 位;

智譜 glm-5.3-flash 位列第 30 名,ELO 1473 分,為本周新入榜模型。

排名 較上周 模型 廠商 分數 (±CI) 票數 價格 ($/M)
輸入 / 輸出
上下文
1 - claude-fable-5 Anthropic 1508 ±5 27013 $10 / $50 1M
2 - claude-opus-4-6-high Anthropic 1505 ±4 72114 $5 / $25 1M
3 - claude-opus-4-7-high Anthropic 1502 ±4 60125 $5 / $25 1M
4 - muse-spark-1.2 (xHigh) Meta 1499 ±10 3245 $1.25 / $4.25 N/A
5 - claude-opus-4-6 Anthropic 1498 ±3 76040 $5 / $25 1M
6 - claude-opus-4-7 Anthropic 1494 ±4 61248 $5 / $25 1M
7 - claude-opus-5-high Anthropic 1492 ±5 34718 $5 / $25 1M
8 - muse-spark-1.1 Meta 1491 ±5 23814 $1.25 / $4.25 N/A
9 - gemini-3.7-flash-high Google 1491 ±8 5682 $0.75 / $3.57 1.05M
10 - kimi-k3-max Moonshot 1489 ±5 17908 N/A N/A
— 以下為 Top 10 外的國產模型 —
17 ↓ 4 glm-5.3-max Z.ai 1482 ±7 7454 $1.4 / $4.4 1.05M
20 ↓ 1 qwen3.8-max Alibaba 1479 ±6 13190 $2 / $6 1M
28 ↓ 1 qwen3.7-max-preview Alibaba 1474 ±10 3707 $1.48 / $4.43 1M
30 新上榜 glm-5.3-flash Z.ai 1473 ±9 4451 $0.15 / $0.5 1.05M

代碼榜

本周代碼榜頭部同樣由 Anthropic 壟斷,Claude-Opus-4-7-high 以 1552 分穩居第一,前三名 ELO 分差僅 1 分,在誤差範圍內視為並列。

最值得關注的是國產新模型 GLM-5.3-Flash 首次入榜即闖入 Top 10,排在第 7 名,ELO 分數達到 1535 分,超過絕大多數頭部海外模型。另外 OpenAI 新模型 GPT-5.6-Terra-Xhigh 也首次入榜,排在第 30 名,ELO 1519 分。

國產模型在代碼榜已有多款進入前列:

月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;

智譜 glm-5.3-flash 位列第 7 名,ELO 1535 分,本周新入榜;

智譜 glm-5.3-max 位列第 16 名,ELO 1528 分,較上周下降 6 位;

阿里 qwen3.7-max-preview 位列第 18 名,ELO 1525 分,下降 1 位;

小米 mimo-v2.5-pro 位列第 24 名,ELO 1521 分,上升 3 位;

阿里 qwen3.8-max 位列第 29 名,ELO 1519 分,下降 4 位。

排名 較上周 模型 廠商 分數 (±CI) 票數 價格 ($/M)
輸入 / 輸出
上下文
1 - claude-opus-4-7-high Anthropic 1552 ±6 17190 $5 / $25 1M
2 - claude-opus-4-6-high Anthropic 1552 ±6 18804 $5 / $25 1M
3 - claude-fable-5 Anthropic 1551 ±8 7247 $10 / $50 1M
4 - claude-opus-4-7 Anthropic 1547 ±6 17347 $5 / $25 1M
5 - claude-opus-4-6 Anthropic 1546 ±5 21209 $5 / $25 1M
6 - kimi-k3-max Moonshot 1542 ±9 4674 N/A N/A
7 新上榜 glm-5.3-flash Z.ai 1535 ±18 1213 $0.15 / $0.5 1.05M
8 - claude-opus-4-8-high Anthropic 1534 ±6 13386 $5 / $25 1M
9 - muse-spark-1.2 (xHigh) Meta 1534 ±20 936 $1.25 / $4.25 N/A
10 ↓ 3 claude-opus-5-high Anthropic 1533 ±7 9237 $5 / $25 1M
— 以下為 Top 10 外的國產模型 —
16 ↓ 6 glm-5.3-max Z.ai 1528 ±14 1961 $1.4 / $4.4 1.05M
18 ↓ 1 qwen3.7-max-preview Alibaba 1525 ±18 1119 $1.48 / $4.43 1M
24 ↑ 3 mimo-v2.5-pro Xiaomi 1521 ±6 15762 $0.44 / $0.87 1.05M
29 ↓ 4 qwen3.8-max Alibaba 1519 ±10 3828 $2 / $6 1M

前端開發榜

本周前端開發榜迎來重大變化,阿里新模型 Qwen3.8-max-0902 首次入榜即直接登頂,以 1691 分奪得榜首,將此前的 Claude-Opus-5-Max 擠到第二。

騰訊新模型 Hy4-Preview 首秀排在第 8 名,ELO 1627 分;阿里 Qwen3.8-flash-next 首秀第 9 名( 1622 分),智譜 GLM-5.3-Flash 首秀第 12 名( 1604 分),四款國產新模型集體闖入前 12,表現極為搶眼。

國產模型在前端開發榜佔據半壁江山,頭部位置穩定:

阿里 qwen3.8-max-0902 位列第 1 名,ELO 1691 分,本周新入榜;

月之暗面 kimi-k3-max 位列第 3 名,ELO 1674 分,下降 1 位;

阿里 qwen3.8-max 位列第 4 名,ELO 1669 分,下降 1 位;

騰訊 hy4-preview 位列第 8 名,ELO 1627 分,本周新入榜;

阿里 qwen3.8-flash-next 位列第 9 名,ELO 1622 分,本周新入榜;

智譜 glm-5.3-flash 位列第 12 名,ELO 1604 分,本周新入榜。

排名 較上周 模型 廠商 分數 (±CI) 票數 價格 ($/M)
輸入 / 輸出
上下文
1 新上榜 qwen3.8-max-0902 Alibaba 1691 ±19 1390 $2 / $6 1M
2 ↓ 1 claude-opus-5-max Anthropic 1687 ±8 10517 $5 / $25 1M
3 ↓ 1 kimi-k3-max Moonshot 1674 ±11 4544 $3 / $15 1.05M
4 ↓ 1 qwen3.8-max Alibaba 1669 ±12 3220 $2 / $6 1M
5 ↓ 1 claude-opus-5-high Anthropic 1661 ±8 10462 $5 / $25 1M
6 ↓ 1 grok-4.6-high SpaceXAI 1629 ±17 1534 $2 / $6 500K
7 ↓ 1 claude-fable-5 Anthropic 1628 ±8 9131 $10 / $50 1M
8 新上榜 hy4-preview Tencent 1627 ±17 1438 $0.83 / $2.5 1.05M
9 新上榜 qwen3.8-flash-next Alibaba 1622 ±15 1939 $0.16 / $0.47 1M
10 ↓ 3 gpt-5.6-sol-xhigh
(codex-harness)
OpenAI 1616 ±7 10766 $4 / $20 1.05M
— 以下為 Top 10 外的國產模型 —
11 ↓ 3 glm-5.3-max Z.ai 1609 ±13 2712 $1.4 / $4.4 1.05M
12 新上榜 glm-5.3-flash Z.ai 1604 ±16 1749 $0.15 / $0.5 1.05M
13 ↓ 4 qwen3.8-27b Alibaba 1598 ±11 3312 $0.4 / $3 N/A
15 ↓ 4 glm-5.2-max Z.ai 1585 ±7 9636 $1.4 / $4.4 1M
16 ↓ 4 deepseek-v4-pro-high-20260813 DeepSeek 1583 ±11 3349 $1.32 / $3.96 N/A
17 ↓ 4 deepseek-v4-flash-high DeepSeek 1580 ±10 3998 $0.44 / $1.32 1.05M
29 ↓ 3 seed-2.1-pro-preview Bytedance 1522 ±8 8452 N/A N/A

智能體榜

本周智能體榜頭部格局基本穩定,Anthropic 模型依然佔據前三,Claude Opus 5 (High) 以 13.74% 的淨提升度蟬聯第一,工具幻覺率僅 0.8%,為頭部模型中最低。值得關注的是智譜 GLM 5.2 (Max) 排名大幅提升 7 位,來到第 10 名,淨提升度 6.23%,任務確認成功率達到 8.65%,表現亮眼。

本周共有四款新模型入榜,分別是 SpaceXAI Grok-4.6 (xHigh)、智譜 GLM 5.3 Flash、智譜 GLM 5.3 (Max)、阿里 Qwen3.8 Flash Next 和阿里 Qwen 3.8 27B,其中 Grok-4.6 (xHigh) 首秀排在第 15 名,淨提升度 5.33%。

國產模型在智能體榜已有多款進入前 20,具體排名:

月之暗面 Kimi K3 (Max) 排名第 6 名,淨提升度 8.71%,任務確認成功率 16.90%,較上周下降 2 位;

深度求索 DeepSeek V4 Pro (High) (0813) 排名第 14 名,淨提升度 5.91%,任務確認成功率 13.14%;

阿里 Qwen3.8 Max 排名第 16 名,淨提升度 5.24%,工具幻覺率僅 0.11%;

智譜 GLM 5.2 (Max) 排名第 10 名,淨提升度 6.23%,較上周上升 7 位;

智譜 GLM 5.3 Flash 排名第 19 名,淨提升度 4.03%,本周新入榜;

智譜 GLM 5.3 (Max) 排名第 20 名,淨提升度 3.74%,本周新入榜。

排名 較上周 模型 廠商 淨提升度 (±CI) 任務確認成功率 好評 / 差評比 可控性
1 - Claude Opus 5 (High) Anthropic 13.74% ±1.8% 14.96% ±3.73% 21.82% ±6.81% 16% ±3.26%
2 - Claude Opus 5 (Max) Anthropic 11.69% ±2.01% 15.49% ±4.03% 18.35% ±7.36% 8.3% ±3.98%
3 - Claude Fable 5 (High) Anthropic 10.61% ±1.53% 6.81% ±3.3% 20.25% ±5.49% 13.23% ±2.77%
4 ↑ 1 GPT 5.6 Sol (xHigh) OpenAI 9.49% ±1.51% 7.57% ±3.2% 21.62% ±5.62% 8.73% ±2.88%
5 ↑ 1 Claude Opus 4.8 (High) Anthropic 9.22% ±1.53% 5.38% ±3.11% 18.87% ±5.3% 12.06% ±2.83%
6 ↓ 2 Kimi K3 (Max) Moonshot 8.71% ±0.66% 16.9% ±1.35% 15.85% ±2.31% 2.13% ±1.29%
7 - GPT 5.5 (xHigh) OpenAI 7.53% ±1.08% 2.45% ±2.36% 12.23% ±3.75% 8.55% ±1.99%
8 ↑ 3 Claude Sonnet 5 (High) Anthropic 7.51% ±2.11% 1.07% ±4.44% 12.46% ±7.28% 12.29% ±4.43%
9 ↓ 1 Claude Opus 4.7 (High) Anthropic 6.49% ±1.42% 3.98% ±3% 10.47% ±4.7% 6.18% ±2.62%
10 ↑ 7 GLM 5.2 (Max) Z.ai 6.23% ±0.77% 8.65% ±1.66% 11.26% ±2.71% 5.41% ±1.41%
— 以下為 Top 10 外的國產模型 —
14 - DeepSeek V4 Pro (High) (0813) DeepSeek 5.91% ±1.04% 13.14% ±2.13% 5.47% ±3.51% 1.06% ±2.31%
16 ↓ 1 Qwen3.8 Max Alibaba 5.24% ±1.13% 8.38% ±2.5% 6.47% ±3.89% 4.56% ±2.26%
19 新上榜 GLM 5.3 Flash Z.ai 4.03% ±1.23% 14.56% ±2.63% 4.64% ±4.09% 1.19% ±2.7%
20 新上榜 GLM 5.3 (Max) Z.ai 3.74% ±0.77% 12.36% ±1.71% 4.27% ±2.53% 0.83% ±1.55%
23 ↓ 3 Deepseek V4 Flash (High)
(20260731)
DeepSeek 2.85% ±0.81% 6.97% ±1.82% 3.38% ±2.73% 0.16% ±1.65%
24 新上榜 Qwen3.8 Flash Next Alibaba 2.51% ±1.57% 11.86% ±3.26% 1.54% ±5.29% 0.31% ±3.72%
27 - Kimi K2.7 Code Moonshot 1.24% ±2.52% 1.92% ±5.57% 1.16% ±8.58% 5.13% ±5.51%
28 新上榜 Qwen 3.8 27B Alibaba 1.19% ±1.11% 7.08% ±2.54% 0.84% ±3.67% 0.27% ±2.28%

AI 生圖榜

本周 AI 生圖榜頭部格局穩定,gpt-image-2 (medium) 以 1382 分繼續領跑,國產 seedream-5.0-pro 穩居第 8 名,qwen-image-3.0-pro 排在第 9 名,兩款國產模型均守住 Top 10 位置。谷歌 gemini-2.5-flash-image-preview 本周新入榜,排在第 30 名,ELO 1150 分。

排名 較上周 模型 廠商 分數 (±CI) 票數 價格 ($/M)
輸入 / 輸出
上下文
1 - gpt-image-2 (medium) OpenAI 1382 ±4 75014 $8 / $30 N/A
2 - mai-image-2.6-preview Microsoft AI 1331 ±8 6418 N/A N/A
3 - grok-imagine-image-2.0 (low) SpaceXAI 1316 ±12 2675 N/A N/A
4 - reve-2.1 Reve 1302 ±8 7580 N/A N/A
5 - muse-image Meta 1281 ±6 22691 N/A N/A
6 - reve-2.0 Reve 1270 ±6 14631 N/A N/A
7 - gemini-3.1-flash-image
(nano-banana-2) [web-search]
Google 1263 ±5 36392 $0.5 / $3 131.1K
8 - seedream-5.0-pro Bytedance 1258 ±5 48174 N/A N/A
9 - qwen-image-3.0-pro Alibaba 1255 ±7 10927 N/A N/A
10 - mai-image-2.5 Microsoft AI 1254 ±4 56737 N/A N/A
— 以下為 Top 10 外的國產模型 —
16 - qwen-image-2.0-pro-2026-06-22 Alibaba 1191 ±6 12013 N/A N/A
29 - hunyuan-image-3.0 Tencent 1151 ±3 173101 N/A N/A

AI 視頻榜

本周 AI 視頻榜迎來新榜首,谷歌 gemini-omni-1.1-flash 首次入榜即奪得第一,ELO 1515 分,超過此前的 gemini-omni-flash。

國產模型方面,dreamina-seedance-2.0-720p 排在第 4 名,dreamina-seedance-2.5-720p 排在第 5 名,minimax-h3 上升至第 6 名,MiniMax 新模型 hailuo-2.3 首次入榜排在第 30 名,ELO 1205 分。

排名 較上周 模型 廠商 分數 (±CI) 票數 價格 ($/M)
輸入 / 輸出
上下文
1 新上榜 gemini-omni-1.1-flash Google 1515 ±16 1762 $1.5 / $9 131.1K
2 ↓ 1 gemini-omni-flash Google 1512 ±10 19830 N/A N/A
3 ↓ 1 flux-3-video Black Forest Labs 1495 ±17 1287 N/A N/A
4 ↓ 1 dreamina-seedance-2.0-720p Bytedance 1479 ±9 51266 N/A N/A
5 ↓ 1 dreamina-seedance-2.5-720p Bytedance 1476 ±14 2121 N/A N/A
6 - minimax-h3 MiniMax 1460 ±10 5813 N/A N/A
7 ↓ 2 muse-video Meta 1457 ±15 2178 N/A N/A
8 ↓ 1 happyhorse-1.0 Alibaba-ATH 1428 ±13 22112 N/A N/A
9 ↓ 1 sora-2-pro OpenAI 1365 ±7 48782 $0 / $0.3 N/A
10 ↓ 1 veo-3.1-audio Google 1364 ±14 13705 $0 / $0.4 N/A
— 以下為 Top 10 外的國產模型 —
15 - wan2.7-t2v Alibaba 1344 ±8 20882 N/A N/A
19 ↓ 1 wan2.6-t2v Alibaba 1329 ±8 47267 N/A N/A
20 ↓ 1 seedance-v1.5-pro Bytedance 1256 ±7 75890 N/A N/A
23 ↓ 2 wan2.5-t2v-preview Alibaba 1247 ±9 30497 N/A N/A
30 新上榜 hailuo-2.3 MiniMax 1205 ±6 79981 N/A N/A

總結來看,本周 Arena 周榜最大看點是多款國產新模型集中亮相併取得優異排名,glm-5.3-flash 在代碼榜闖入 Top 10,qwen3.8-max-0902 更是直接登頂前端開發榜,顯示國產模型在代碼開發領域持續進步。頭部依然是 Anthropic 模型壟斷綜合和代碼榜,但國產模型在細分領域已經能衝擊榜首位置,後續更多國產新模型的表現值得繼續關注。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10