智谱发布GLM-5.3模型、“为编程而生”,性能比肩Fable 5

华尔街见闻
Yesterday

智谱最新旗舰模型GLM-5.3正式亮相,在编程能力和网络安全漏洞发现方面取得重大突破,向Anthropic、OpenAI等AI头部企业发起新一轮挑战。

据智谱官方声明,GLM-5.3基于与前代GLM-5.2相同的7000亿参数基础模型构建,所有性能提升均来自后训练阶段的持续扩展。在自研评测基准智谱 Code Bench上,GLM-5.3的编程能力较GLM-5.2提升50%;在开源编程基准Terminal-Bench 3.0上,得分从4.6跃升至28.3。

智谱介绍模型时表示:GLM-5.3专为编程而生,随时迎接网络防御挑战。GLM-5.3在网络安全漏洞挖掘能力上亦出现超预期的"涌现"式跃进,在现实代码库中累计识别出2436个安全漏洞。

智谱表示,模型权重将在发布两周后公开,届时将完成安全评估与加固工作。此次发布恰逢DeepSeek昨日上调旗下V4模型定价,进一步加强其在国内AI市场的竞争地位。

编程能力大幅跃升,超越Claude Opus 4.8

GLM-5.3的核心突破集中于复杂编程与长链路任务。智谱官方数据显示,在智谱 Code Bench的最高难度设置下,GLM-5.3以约7.5万个输出token完成了34.5%的任务,而GLM-5.2在消耗更多token(9.6万)的情况下,完成率仅为23.4%。在高难度设置下,GLM-5.3以约5万个token达到31.4%的完成率,超越了Anthropic的Claude Opus 4.8(29.5%,耗用12万token)。不过,GLM-5.3目前仍落后于Claude Fable 5——后者在最高难度设置下完成率为39.5%。

在公开基准测试上,GLM-5.3同样表现亮眼:DeepSWE v1.1得分从46.2升至66.9,Agents' Last Exam得分从23.8升至28.5。

为实现上述进展,智谱在后训练阶段大幅扩展了训练环境的规模与多样性,引入更贴近真实工程场景的任务——部分任务的工作量相当于一名经验丰富的工程师数天的工作量。智谱还构建了自动化流水线,用于端到端合成训练环境及强化学习奖励信号。

网络安全能力“涌现”,已披露逾两千个漏洞

在网络安全领域,GLM-5.3展现出超出预期的能力跃升。在智谱引入漏洞发现数据和训练环境后,模型不仅能够识别单一缺陷,更开始跨多个漏洞利用阶段进行综合推理,形成完整的利用链路规划。

在CyberGym基准测试中,GLM-5.3以84.5%的得分超越Anthropic的Mythos 5(83.8%)和OpenAI的GPT-5.6 Sol(83.6%),位居榜首。在要求更深层漏洞推理的ExploitBench上,GLM-5.3得分从GLM-5.2的24.4%跃升至54.4%,涨幅超过一倍;但与Mythos 5(78.0%)和GPT-5.6 Sol(76.5%)相比,仍有明显差距。在ExploitGym测试中,GLM-5.3在两小时内完成105项利用任务、六小时内完成130项,而GLM-5.2的对应数字仅为29项和39项;Mythos 5则以181项和247项保持领先。

智谱表示,这些能力已延伸至真实世界的实际应用。自GLM-5.2以来,智谱与中国多个安全团队合作,针对现实代码库运行模型测试,经专家审核、筛查与去重后,在269个项目中识别出2436个漏洞,其中中高危漏洞1097个,涵盖系统内核、操作系统、浏览器引擎、开源基础设施、Web应用及网络协议等领域,部分漏洞在代码库中已存留数十年,最早可追溯至约40年前。智谱已为此建立"智谱安全披露账本",持续公开披露进展。

开源策略叠加竞争格局变化,市场空间打开

在商业层面,GLM-5.3的发布时机颇具战略意义。DeepSeek于本周四宣布将旗下V4 Flash和Pro模型价格上调最高四倍,尽管V4 Pro的综合定价仍低于GLM-5.2,但此举客观上为智谱争取用户和开发者提供了窗口。Artificial Analysis给予DeepSeek顶级模型与GLM-5.2相同的智能评分53分,两者均落后于Kimi K3以及Claude Fable 5、GPT 5.6等模型。

智谱计划以宽松许可证开放GLM-5.3的模型权重,以吸引更广泛的开发者群体。这一策略与GLM-5.2的路径一脉相承——后者发布后,智谱市值一度冲至1370亿美元,超越拼多多和网易(NetEase)等互联网巨头,此后虽回落至约800亿美元,但较今年1月在香港上市时仍增逾十倍。

据彭博此前报道,智谱已完成一座数据中心的建设,部署了至少1万枚国产芯片,用于GLM系列模型的研发与推理。其年度经常性收入(ARR)于今年7月达到10亿美元。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10