結果有點出乎意料:拿了第一名的,是阿里的千問辦公,儘管它背後的模型智能分只排到第四;模型能力第一的Claude Opus 5,它的Agent產品Claude Cowork拿了第二;另一個反直覺的結果是,最近大火的Workbuddy,這輪測試中隱含的Harness分在中國Agent裏反而墊底。
傑富瑞的核心結論,用一句話概括:決定一個AI Agent好不好用,往往不是背後那個模型,Harness做得好是可以彌補模型智能差距的。
Harness是什麼:Agent裏除了模型,剩下的都是它
一個AI Agent幹活的流程,可以拆成兩半:一半是模型,負責"想";另一半是harness,負責"管"。
傑富瑞把harness拆成了六層,每一層管的都是模型自己管不了的事:
-
指令:告訴Agent這個活是什麼,紅線在哪
-
上下文:Agent幹活時能看到的背景信息
-
工具:Agent能用什麼去完成這個任務
-
邊界:Agent能行動的範圍劃在哪
-
反饋:告訴Agent哪裏做錯了,讓它自己糾正、重新規劃
-
治理:讓組織能管住一整批Agent
這六層,正好對應了僱一個員工之後,公司要做的那些事——交代任務、給信息、給工具、劃權限、給反饋、做管理。模型就是那個新來的聰明人,harness就是這套管理機制。聰明人再厲害,扔進一個沒有管理的公司,也幹不好活。

來看一組控制變量的證據——模型不動,只換harness,看Agent表現怎麼變。
結果:同一個Claude Opus 4.6,套上不同的harness,在Terminal-Bench 2.0這個基準上,得分從58.0%一路到76.4%,最高最低差了18.4個百分點。Gemini 3 Pro同樣只換harness,得分從56.0%到69.4%,差13.4個百分點。
實測八個中美Agent
這次實測,傑富瑞挑了八個中美Agent。美國三個:Anthropic的Claude Cowork、OpenAI的Codex、谷歌的Gemini Spark。中國五個:騰訊的Workbuddy、阿里的千問辦公、字節的豆包、月之暗面的Kimi Work、MiniMax的Code。
考卷是五項任務,每一項對應企業裏真實存在的一類活。
第一項,多文件檢索。丟給Agent一堆文件,讓它寫一份金蝶軟件2025年報的一頁摘要,覆蓋營收、增長、毛利率、淨利潤、2026年指引、AI進展。要求很嚴:每條事實必須標明來自哪個文件;不同文件數字打架,必須指出衝突、說明哪個更可信;不許悄悄把矛盾數字抹平。
第二項,自主聯網研究。讓它上網比較微軟、Meta、谷歌三家最近季度的營收增速,以及2026年的資本開支指引。必須用一手來源,產出一張表,還要明確區分哪些是官方報的數字,哪些是自己估算的。
第三項,控制瀏覽器。讓它用真實的桌面瀏覽器,從OpenAI官網一路點到新聞頁,找出最新一篇文章,讀完全文,生成一個Word文件,含標題、日期、分類、鏈接、150到200字摘要和三條要點。不許用API或爬蟲抄近路,必須真的用瀏覽器點進去。
第四項,做PPT。給它一份文件,做5頁英文PPT,要有故事線,第一頁要用文件數據畫圖,不許編造數據。
第五項,生成營銷海報。給它一張鞋的照片做參考,為虛構籃球鞋品牌做原創海報,去掉所有Nike、Jordan的logo,不抄商標口號,3:4豎版,適合發小紅書。
這五項,從讀文件、查資料、操作軟件、做PPT到作圖,幾乎覆蓋了企業裏最常見的幾類工作。
打分方式也講究。每項任務拆成5個維度,維度跟着任務走,不是通用模板,每個維度0到20分,一項滿分100,五項平均得出總分。

結果:模型最弱的,拿了第一
前三名分別是:千問辦公95分,Claude Cowork 94分,Codex 92分。接下來依次是Kimi Work 86分,豆包77分、MiniMax Code 71分,Workbuddy和谷歌的Gemini Spark並列墊底,都是66分。
值得一提的是千問辦公的「逆襲」。它背後的模型Qwen 3.8 Max,智能分只有56。而Claude Cowork背後是Claude Opus 5,61分;Codex背後是GPT-5.6 Sol,59分。模型差着五六分,Agent總分反而高出一兩分。
這也說明,Harness優勢,足以抵消模型智能的差距。
為了驗證這一點,傑富瑞做了一個拆解:把Agent能力分成模型和Harness兩塊,給模型60%權重、Harness 40%權重,用Agent總分反推出每個產品的"隱含Harness分"。結果千問辦公的Harness分最高,超過了美國的Claude Cowork和Codex。

實測還發現了一些中美Agent的能力差異。
第五項營銷海報,是美國Agent的滑鐵盧。Claude Cowork和Gemini Spark都在這裏翻車,而千問辦公和豆包這類中國Agent做得更好。
第二項控制瀏覽器,是中國Agent的弱點。Workbuddy和MiniMax Code在這裏栽了跟頭,美國三家的表現更穩。
速度上也有差異。美國那邊,Gemini Spark最快,Codex次之,Claude Cowork最慢。中國這邊,Workbuddy最快,豆包和MiniMax相當,Kimi Work和千問辦公偏慢。另外,Claude Cowork的"品味"最好,PPT排版和配色最講究,但這個歸功於模型能力,跟Harness無關。
價格是另一重碾壓。千問辦公背後的Qwen 3.8 Max,API價格每百萬token約1.1美元;GPT-5.6 Sol是4.4美元,Opus 5是3.9美元。
Workbuddy的錯位
報告裏另一個值得細看的對象,是騰訊的Workbuddy。
它的數據很漂亮:6月月訪問量約2100萬,中國同類Agent裏排第一。但在這份實測裏,Workbuddy的隱含Harness分,在中國Agent裏墊底。
訪問量第一,Harness墊底,這個錯位怎麼解釋?
傑富瑞給了三個原因。
第一,Workbuddy深度嵌在騰訊自家的生態裏,騰訊文檔、IMA、企業微信,入口都在手上。
第二,它走的是模型無關的路線,用戶可以在harness裏隨意切換Kimi K3、DeepSeek V4、GLM 5.2這些開源模型,用別人的強模型補自己的短板。
第三,騰訊的營銷投入很猛。
這三條,跟Harness工程做得好不好,沒有直接關係。
報告的判斷是:短期看,Workbuddy贏在入口和分發;長期看,2100萬的用戶基礎會沉澱出海量真實使用數據,這些數據反過來能幫騰訊改進Harness,甚至訓練自己的模型。
在中國市場這個階段,分發能力暫時跑在了Harness工程前面。但決定一個Agent最終能走多遠的,還是Harness。
中國在Harness上有優勢,也有繞不開的短板
報告把中國和美國的Harness打法做了個對比:中國在幾個結構性的地方領先,但也有幾塊短板壓着。
先說優勢,四個。
超級App集成。 美國Agent接工具,一般靠connector去連。中國不一樣,很多Agent直接嵌在企微、飛書、釘釘這些平台裏,數據、分發、變現一條線全打通。這是中國廠商獨有的地基。
模型無關的Harness。 騰訊Workbuddy、字節Trae走的都是這條路——harness自己不帶模型,用戶按任務的難度、延遲、成本隨便切換Kimi K3、DeepSeek V4、GLM 5.2這些第三方模型。用別人的強模型,補自己的短板。
低token價格。 出口管制逼着中國實驗室走高效的MoE架構和推理優化,加上國內競爭卷得厲害,中國模型的token價格平均比美國低70%到80%。token便宜,那些消耗大量推理的agent工作流才跑得起,這也加快了企業採納。
迭代速度快。 Hrness的質量,是靠在真實場景裏一次次失敗試出來的。中國廠商用戶量大、碰到的失敗案例多,迭代反而更快。
再說短板,也有四個。
模型差距還在。 Harness-Bench的數據顯示,強模型的平均分更高、跨Harness的方差更小;弱模型更依賴Harness。中國模型整體還落後美國,得靠更出色的Harness才能把Agent能力頂上去。
產品定價低。 中國企業軟件市場一向變現難,中小企業對價格敏感,大型央國企又偏愛定製項目、不太認訂閱制。這拖累的不只是利潤,還有持續投入Harness工程的動力。
出海難。 Workbuddy、Qoder在國內用戶漲得快,但要把這套成功複製到海外很難——中國Agent是為本地生態和用戶習慣優化的,而美國的Harness受益於全球標準化的軟件棧。
算力瓶頸。 Agent工作流對推理算力的消耗,比普通對話高得多。中國廠商高端算力短缺,可能導致服務不穩定,也反過來限制變現能力。
Harness為什麼越來越重要
最後再提一嘴Harness的價值,主要是三個方面:
粘性。 模型能力越來越趨同,但harness不一樣。客戶的工作習慣、對話歷史、記憶、連接器、技能、自動化,全都沉澱在harness裏。用得越久,換走的成本越高。模型可以隨時換,harness是換不掉的。
數據飛輪。 每一次Agent運行,都會產生一條trace——調了什麼工具、什麼失敗了、人怎麼糾正的。這些數據能餵給下一代的強化學習,也能用來改進harness本身。用戶越多,數據越多,Agent越好,用戶更多。這是一個正循環。
付費意願。 報告點破了一件事:企業和消費者買的不是"智能",他們自己沒有開發應用的能力。他們買的是"harness + 模型"打包好的完整Agent產品。這也是為什麼Claude Code、Claude Cowork、Workbuddy這類產品用戶增長快——客戶為harness付錢,模型只是順帶。
而對於一家公司來說,AI落地的關鍵在工程層,不在模型層。真正的機會在"把harness做好"這件事上——管好指令、上下文、工具、邊界、反饋、治理這六件事,比追最強的模型更可能做出落地的東西。
本文來自微信公衆號「AI原生Lab」,持續拆解真實AI落地案例,分享企業AI實踐與方法論。
