Harness決定AI Agent表現關鍵!華爾街實測千問辦公和Workbuddy

華爾街見聞
08/18
華爾街投行傑富瑞的分析師,最近給市面上八個主流中美AI Agent做了一場實測,看誰真正能把活幹好。

結果有點出乎意料:拿了第一名的,是阿里的千問辦公,儘管它背後的模型智能分只排到第四;模型能力第一的Claude Opus 5,它的Agent產品Claude Cowork拿了第二;另一個反直覺的結果是,最近大火的Workbuddy,這輪測試中隱含的Harness分在中國Agent裏反而墊底。

傑富瑞的核心結論,用一句話概括:決定一個AI Agent好不好用,往往不是背後那個模型,Harness做得好是可以彌補模型智能差距的。

Harness是什麼:Agent裏除了模型,剩下的都是它

一個AI Agent幹活的流程,可以拆成兩半:一半是模型,負責"想";另一半是harness,負責"管"。

傑富瑞把harness拆成了六層,每一層管的都是模型自己管不了的事:

  • 指令:告訴Agent這個活是什麼,紅線在哪

  • 上下文:Agent幹活時能看到的背景信息

  • 工具:Agent能用什麼去完成這個任務

  • 邊界:Agent能行動的範圍劃在哪

  • 反饋:告訴Agent哪裏做錯了,讓它自己糾正、重新規劃

  • 治理:讓組織能管住一整批Agent

這六層,正好對應了僱一個員工之後,公司要做的那些事——交代任務、給信息、給工具、劃權限、給反饋、做管理。模型就是那個新來的聰明人,harness就是這套管理機制。聰明人再厲害,扔進一個沒有管理的公司,也幹不好活。

來看一組控制變量的證據——模型不動,只換harness,看Agent表現怎麼變。

結果:同一個Claude Opus 4.6,套上不同的harness,在Terminal-Bench 2.0這個基準上,得分從58.0%一路到76.4%,最高最低差了18.4個百分點。Gemini 3 Pro同樣只換harness,得分從56.0%到69.4%,差13.4個百分點。

實測八個中美Agent

這次實測,傑富瑞挑了八個中美Agent。美國三個:Anthropic的Claude Cowork、OpenAI的Codex、谷歌的Gemini Spark。中國五個:騰訊的Workbuddy、阿里的千問辦公、字節的豆包、月之暗面的Kimi Work、MiniMax的Code。

考卷是五項任務,每一項對應企業裏真實存在的一類活。

第一項,多文件檢索。丟給Agent一堆文件,讓它寫一份金蝶軟件2025年報的一頁摘要,覆蓋營收、增長、毛利率、淨利潤、2026年指引、AI進展。要求很嚴:每條事實必須標明來自哪個文件;不同文件數字打架,必須指出衝突、說明哪個更可信;不許悄悄把矛盾數字抹平。

第二項,自主聯網研究。讓它上網比較微軟Meta谷歌三家最近季度的營收增速,以及2026年的資本開支指引。必須用一手來源,產出一張表,還要明確區分哪些是官方報的數字,哪些是自己估算的。

第三項,控制瀏覽器。讓它用真實的桌面瀏覽器,從OpenAI官網一路點到新聞頁,找出最新一篇文章,讀完全文,生成一個Word文件,含標題、日期、分類、鏈接、150到200字摘要和三條要點。不許用API或爬蟲抄近路,必須真的用瀏覽器點進去。

第四項,做PPT。給它一份文件,做5頁英文PPT,要有故事線,第一頁要用文件數據畫圖,不許編造數據。

第五項,生成營銷海報。給它一張鞋的照片做參考,為虛構籃球鞋品牌做原創海報,去掉所有Nike、Jordan的logo,不抄商標口號,3:4豎版,適合發小紅書。

這五項,從讀文件、查資料、操作軟件、做PPT到作圖,幾乎覆蓋了企業裏最常見的幾類工作。

打分方式也講究。每項任務拆成5個維度,維度跟着任務走,不是通用模板,每個維度0到20分,一項滿分100,五項平均得出總分。

結果:模型最弱的,拿了第一

前三名分別是:千問辦公95分,Claude Cowork 94分,Codex 92分。接下來依次是Kimi Work 86分,豆包77分、MiniMax Code 71分,Workbuddy和谷歌的Gemini Spark並列墊底,都是66分。值得一提的是千問辦公的「逆襲」。它背後的模型Qwen 3.8 Max,智能分只有56。而Claude Cowork背後是Claude Opus 5,61分;Codex背後是GPT-5.6 Sol,59分。模型差着五六分,Agent總分反而高出一兩分。

這也說明,Harness優勢,足以抵消模型智能的差距。

為了驗證這一點,傑富瑞做了一個拆解:把Agent能力分成模型和Harness兩塊,給模型60%權重、Harness 40%權重,用Agent總分反推出每個產品的"隱含Harness分"。結果千問辦公的Harness分最高,超過了美國的Claude Cowork和Codex。

實測還發現了一些中美Agent的能力差異。

第五項營銷海報,是美國Agent的滑鐵盧。Claude Cowork和Gemini Spark都在這裏翻車,而千問辦公和豆包這類中國Agent做得更好。

第二項控制瀏覽器,是中國Agent的弱點。Workbuddy和MiniMax Code在這裏栽了跟頭,美國三家的表現更穩。

速度上也有差異。美國那邊,Gemini Spark最快,Codex次之,Claude Cowork最慢。中國這邊,Workbuddy最快,豆包和MiniMax相當,Kimi Work和千問辦公偏慢。另外,Claude Cowork的"品味"最好,PPT排版和配色最講究,但這個歸功於模型能力,跟Harness無關。

價格是另一重碾壓。千問辦公背後的Qwen 3.8 Max,API價格每百萬token約1.1美元;GPT-5.6 Sol是4.4美元,Opus 5是3.9美元。

Workbuddy的錯位

報告裏另一個值得細看的對象,是騰訊的Workbuddy。

它的數據很漂亮:6月月訪問量約2100萬,中國同類Agent裏排第一。但在這份實測裏,Workbuddy的隱含Harness分,在中國Agent裏墊底。

訪問量第一,Harness墊底,這個錯位怎麼解釋?

傑富瑞給了三個原因。

第一,Workbuddy深度嵌在騰訊自家的生態裏,騰訊文檔、IMA、企業微信,入口都在手上。

第二,它走的是模型無關的路線,用戶可以在harness裏隨意切換Kimi K3、DeepSeek V4、GLM 5.2這些開源模型,用別人的強模型補自己的短板。

第三,騰訊的營銷投入很猛。

這三條,跟Harness工程做得好不好,沒有直接關係。

報告的判斷是:短期看,Workbuddy贏在入口和分發;長期看,2100萬的用戶基礎會沉澱出海量真實使用數據,這些數據反過來能幫騰訊改進Harness,甚至訓練自己的模型。

在中國市場這個階段,分發能力暫時跑在了Harness工程前面。但決定一個Agent最終能走多遠的,還是Harness。

中國在Harness上有優勢,也有繞不開的短板

報告把中國和美國的Harness打法做了個對比:中國在幾個結構性的地方領先,但也有幾塊短板壓着。

先說優勢,四個。

超級App集成。 美國Agent接工具,一般靠connector去連。中國不一樣,很多Agent直接嵌在企微、飛書、釘釘這些平台裏,數據、分發、變現一條線全打通。這是中國廠商獨有的地基。

模型無關的Harness。 騰訊Workbuddy、字節Trae走的都是這條路——harness自己不帶模型,用戶按任務的難度、延遲、成本隨便切換Kimi K3、DeepSeek V4、GLM 5.2這些第三方模型。用別人的強模型,補自己的短板。

低token價格。 出口管制逼着中國實驗室走高效的MoE架構和推理優化,加上國內競爭卷得厲害,中國模型的token價格平均比美國低70%到80%。token便宜,那些消耗大量推理的agent工作流才跑得起,這也加快了企業採納。

迭代速度快。 Hrness的質量,是靠在真實場景裏一次次失敗試出來的。中國廠商用戶量大、碰到的失敗案例多,迭代反而更快。

再說短板,也有四個。

模型差距還在。 Harness-Bench的數據顯示,強模型的平均分更高、跨Harness的方差更小;弱模型更依賴Harness。中國模型整體還落後美國,得靠更出色的Harness才能把Agent能力頂上去。

產品定價低。 中國企業軟件市場一向變現難,中小企業對價格敏感,大型央國企又偏愛定製項目、不太認訂閱制。這拖累的不只是利潤,還有持續投入Harness工程的動力。

出海難。 Workbuddy、Qoder在國內用戶漲得快,但要把這套成功複製到海外很難——中國Agent是為本地生態和用戶習慣優化的,而美國的Harness受益於全球標準化的軟件棧。

算力瓶頸。 Agent工作流對推理算力的消耗,比普通對話高得多。中國廠商高端算力短缺,可能導致服務不穩定,也反過來限制變現能力。

Harness為什麼越來越重要

最後再提一嘴Harness的價值,主要是三個方面:

粘性。 模型能力越來越趨同,但harness不一樣。客戶的工作習慣、對話歷史、記憶、連接器、技能、自動化,全都沉澱在harness裏。用得越久,換走的成本越高。模型可以隨時換,harness是換不掉的。

數據飛輪。 每一次Agent運行,都會產生一條trace——調了什麼工具、什麼失敗了、人怎麼糾正的。這些數據能餵給下一代的強化學習,也能用來改進harness本身。用戶越多,數據越多,Agent越好,用戶更多。這是一個正循環。

付費意願。 報告點破了一件事:企業和消費者買的不是"智能",他們自己沒有開發應用的能力。他們買的是"harness + 模型"打包好的完整Agent產品。這也是為什麼Claude Code、Claude Cowork、Workbuddy這類產品用戶增長快——客戶為harness付錢,模型只是順帶。

而對於一家公司來說,AI落地的關鍵在工程層,不在模型層。真正的機會在"把harness做好"這件事上——管好指令、上下文、工具、邊界、反饋、治理這六件事,比追最強的模型更可能做出落地的東西。

本文來自微信公衆號AI原生Lab,持續拆解真實AI落地案例,分享企業AI實踐與方法論。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10