Harness决定AI Agent表现关键!华尔街实测千问办公和Workbuddy

华尔街见闻
Aug 18
华尔街投行杰富瑞的分析师,最近给市面上八个主流中美AI Agent做了一场实测,看谁真正能把活干好。

结果有点出乎意料:拿了第一名的,是阿里的千问办公,尽管它背后的模型智能分只排到第四;模型能力第一的Claude Opus 5,它的Agent产品Claude Cowork拿了第二;另一个反直觉的结果是,最近大火的Workbuddy,这轮测试中隐含的Harness分在中国Agent里反而垫底。

杰富瑞的核心结论,用一句话概括:决定一个AI Agent好不好用,往往不是背后那个模型,Harness做得好是可以弥补模型智能差距的。

Harness是什么:Agent里除了模型,剩下的都是它

一个AI Agent干活的流程,可以拆成两半:一半是模型,负责"想";另一半是harness,负责"管"。

杰富瑞把harness拆成了六层,每一层管的都是模型自己管不了的事:

  • 指令:告诉Agent这个活是什么,红线在哪

  • 上下文:Agent干活时能看到的背景信息

  • 工具:Agent能用什么去完成这个任务

  • 边界:Agent能行动的范围划在哪

  • 反馈:告诉Agent哪里做错了,让它自己纠正、重新规划

  • 治理:让组织能管住一整批Agent

这六层,正好对应了雇一个员工之后,公司要做的那些事——交代任务、给信息、给工具、划权限、给反馈、做管理。模型就是那个新来的聪明人,harness就是这套管理机制。聪明人再厉害,扔进一个没有管理的公司,也干不好活。

来看一组控制变量的证据——模型不动,只换harness,看Agent表现怎么变。

结果:同一个Claude Opus 4.6,套上不同的harness,在Terminal-Bench 2.0这个基准上,得分从58.0%一路到76.4%,最高最低差了18.4个百分点。Gemini 3 Pro同样只换harness,得分从56.0%到69.4%,差13.4个百分点。

实测八个中美Agent

这次实测,杰富瑞挑了八个中美Agent。美国三个:Anthropic的Claude Cowork、OpenAI的Codex、谷歌的Gemini Spark。中国五个:腾讯的Workbuddy、阿里的千问办公、字节的豆包、月之暗面的Kimi Work、MiniMax的Code。

考卷是五项任务,每一项对应企业里真实存在的一类活。

第一项,多文件检索。丢给Agent一堆文件,让它写一份金蝶软件2025年报的一页摘要,覆盖营收、增长、毛利率、净利润、2026年指引、AI进展。要求很严:每条事实必须标明来自哪个文件;不同文件数字打架,必须指出冲突、说明哪个更可信;不许悄悄把矛盾数字抹平。

第二项,自主联网研究。让它上网比较微软Meta谷歌三家最近季度的营收增速,以及2026年的资本开支指引。必须用一手来源,产出一张表,还要明确区分哪些是官方报的数字,哪些是自己估算的。

第三项,控制浏览器。让它用真实的桌面浏览器,从OpenAI官网一路点到新闻页,找出最新一篇文章,读完全文,生成一个Word文件,含标题、日期、分类、链接、150到200字摘要和三条要点。不许用API或爬虫抄近路,必须真的用浏览器点进去。

第四项,做PPT。给它一份文件,做5页英文PPT,要有故事线,第一页要用文件数据画图,不许编造数据。

第五项,生成营销海报。给它一张鞋的照片做参考,为虚构篮球鞋品牌做原创海报,去掉所有Nike、Jordan的logo,不抄商标口号,3:4竖版,适合发小红书。

这五项,从读文件、查资料、操作软件、做PPT到作图,几乎覆盖了企业里最常见的几类工作。

打分方式也讲究。每项任务拆成5个维度,维度跟着任务走,不是通用模板,每个维度0到20分,一项满分100,五项平均得出总分。

结果:模型最弱的,拿了第一

前三名分别是:千问办公95分,Claude Cowork 94分,Codex 92分。接下来依次是Kimi Work 86分,豆包77分、MiniMax Code 71分,Workbuddy和谷歌的Gemini Spark并列垫底,都是66分。值得一提的是千问办公的“逆袭”。它背后的模型Qwen 3.8 Max,智能分只有56。而Claude Cowork背后是Claude Opus 5,61分;Codex背后是GPT-5.6 Sol,59分。模型差着五六分,Agent总分反而高出一两分。

这也说明,Harness优势,足以抵消模型智能的差距。

为了验证这一点,杰富瑞做了一个拆解:把Agent能力分成模型和Harness两块,给模型60%权重、Harness 40%权重,用Agent总分反推出每个产品的"隐含Harness分"。结果千问办公的Harness分最高,超过了美国的Claude Cowork和Codex。

实测还发现了一些中美Agent的能力差异。

第五项营销海报,是美国Agent的滑铁卢。Claude Cowork和Gemini Spark都在这里翻车,而千问办公和豆包这类中国Agent做得更好。

第二项控制浏览器,是中国Agent的弱点。Workbuddy和MiniMax Code在这里栽了跟头,美国三家的表现更稳。

速度上也有差异。美国那边,Gemini Spark最快,Codex次之,Claude Cowork最慢。中国这边,Workbuddy最快,豆包和MiniMax相当,Kimi Work和千问办公偏慢。另外,Claude Cowork的"品味"最好,PPT排版和配色最讲究,但这个归功于模型能力,跟Harness无关。

价格是另一重碾压。千问办公背后的Qwen 3.8 Max,API价格每百万token约1.1美元;GPT-5.6 Sol是4.4美元,Opus 5是3.9美元。

Workbuddy的错位

报告里另一个值得细看的对象,是腾讯的Workbuddy。

它的数据很漂亮:6月月访问量约2100万,中国同类Agent里排第一。但在这份实测里,Workbuddy的隐含Harness分,在中国Agent里垫底。

访问量第一,Harness垫底,这个错位怎么解释?

杰富瑞给了三个原因。

第一,Workbuddy深度嵌在腾讯自家的生态里,腾讯文档、IMA、企业微信,入口都在手上。

第二,它走的是模型无关的路线,用户可以在harness里随意切换Kimi K3、DeepSeek V4、GLM 5.2这些开源模型,用别人的强模型补自己的短板。

第三,腾讯的营销投入很猛。

这三条,跟Harness工程做得好不好,没有直接关系。

报告的判断是:短期看,Workbuddy赢在入口和分发;长期看,2100万的用户基础会沉淀出海量真实使用数据,这些数据反过来能帮腾讯改进Harness,甚至训练自己的模型。

在中国市场这个阶段,分发能力暂时跑在了Harness工程前面。但决定一个Agent最终能走多远的,还是Harness。

中国在Harness上有优势,也有绕不开的短板

报告把中国和美国的Harness打法做了个对比:中国在几个结构性的地方领先,但也有几块短板压着。

先说优势,四个。

超级App集成。 美国Agent接工具,一般靠connector去连。中国不一样,很多Agent直接嵌在企微、飞书、钉钉这些平台里,数据、分发、变现一条线全打通。这是中国厂商独有的地基。

模型无关的Harness。 腾讯Workbuddy、字节Trae走的都是这条路——harness自己不带模型,用户按任务的难度、延迟、成本随便切换Kimi K3、DeepSeek V4、GLM 5.2这些第三方模型。用别人的强模型,补自己的短板。

低token价格。 出口管制逼着中国实验室走高效的MoE架构和推理优化,加上国内竞争卷得厉害,中国模型的token价格平均比美国低70%到80%。token便宜,那些消耗大量推理的agent工作流才跑得起,这也加快了企业采纳。

迭代速度快。 Hrness的质量,是靠在真实场景里一次次失败试出来的。中国厂商用户量大、碰到的失败案例多,迭代反而更快。

再说短板,也有四个。

模型差距还在。 Harness-Bench的数据显示,强模型的平均分更高、跨Harness的方差更小;弱模型更依赖Harness。中国模型整体还落后美国,得靠更出色的Harness才能把Agent能力顶上去。

产品定价低。 中国企业软件市场一向变现难,中小企业对价格敏感,大型央国企又偏爱定制项目、不太认订阅制。这拖累的不只是利润,还有持续投入Harness工程的动力。

出海难。 Workbuddy、Qoder在国内用户涨得快,但要把这套成功复制到海外很难——中国Agent是为本地生态和用户习惯优化的,而美国的Harness受益于全球标准化的软件栈。

算力瓶颈。 Agent工作流对推理算力的消耗,比普通对话高得多。中国厂商高端算力短缺,可能导致服务不稳定,也反过来限制变现能力。

Harness为什么越来越重要

最后再提一嘴Harness的价值,主要是三个方面:

粘性。 模型能力越来越趋同,但harness不一样。客户的工作习惯、对话历史、记忆、连接器、技能、自动化,全都沉淀在harness里。用得越久,换走的成本越高。模型可以随时换,harness是换不掉的。

数据飞轮。 每一次Agent运行,都会产生一条trace——调了什么工具、什么失败了、人怎么纠正的。这些数据能喂给下一代的强化学习,也能用来改进harness本身。用户越多,数据越多,Agent越好,用户更多。这是一个正循环。

付费意愿。 报告点破了一件事:企业和消费者买的不是"智能",他们自己没有开发应用的能力。他们买的是"harness + 模型"打包好的完整Agent产品。这也是为什么Claude Code、Claude Cowork、Workbuddy这类产品用户增长快——客户为harness付钱,模型只是顺带。

而对于一家公司来说,AI落地的关键在工程层,不在模型层。真正的机会在"把harness做好"这件事上——管好指令、上下文、工具、边界、反馈、治理这六件事,比追最强的模型更可能做出落地的东西。

本文来自微信公众号AI原生Lab,持续拆解真实AI落地案例,分享企业AI实践与方法论。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10