IT之家 10 月 9 日消息,當地時間 8 日,AI 模型評測平台 Arena 競技場宣佈完成 2 億美元(IT之家注:現匯率約合 13.43 億元人民幣) B 輪孖展,估值達到 31 億美元(現匯率約合 208.17 億元人民幣)。Arena 最初是加州大學伯克利分校 2023 年的一項研究項目,通過公衆投票對 AI 模型進行排名。
Arena 此前披露,今年 6 月的年化營收達到 1 億美元(現匯率約合 6.72 億元人民幣)。
本輪孖展由光速創投和 Khosla Ventures 共同領投,Salesforce Ventures、01 Advisors、戴爾科技資本、Endeavor Catalyst、a16z、Felicis 等機構參與投資。
今年 1 月,Arena 曾完成 1.5 億美元(現匯率約合 10.07 億元人民幣) A 輪孖展,投後估值 17 億美元(現匯率約合 114.16 億元人民幣),當時的年化營收為 3,000 萬美元(現匯率約合 2.01 億元人民幣)。短短約 10 個月,Arena 的估值接近翻倍。

Arena 的評測平台對個人用戶免費開放。用戶可以輸入提示詞,或讓 AI 按照自己的要求編寫程序、開發項目,再比較不同模型的完成效果並評分。Arena 稱,平台每月吸引數千萬名訪客。
去年 9 月,Arena 推出面向 AI 模型研發機構和企業的商業服務 AI Evaluations,利用社區用戶的反饋數據,提供詳細的模型性能分析。
今年,AI 研發機構發現,旗下模型能夠通過迎合基準測試的規則獲得高分,卻未必具備相應的實際能力。企業也不再滿足於標準化測試成績,希望了解哪款模型更適合自己的業務需求。
Arena 在孖展公告中指出:「AI 的發展速度已經超過了我們的評估能力。模型一旦發現自己在接受測試,固定的基準測試就會失效。世界需要一箇中立的第三方,檢驗 AI 在實際使用中是否安全、行為是否符合人類的預期。Arena 開始承擔這一角色。」
為此,Arena 在排行榜中新增了對齊能力評測,重點考察模型是否會擅自執行用戶沒有要求的操作,是否會張冠李戴,將言論或事實歸於錯誤的來源,以及是否會謊稱完成了任務。Arena 將最後一種行為稱為「欺騙性完成」。
在初步公布的對齊能力排行榜上,OpenAI 多款模型名列前茅,Claude Opus 5.5 排名第六,Claude Fable 排名第九。