追求「跑分」但「實測」平平,谷歌「新旗艦」Gemini 4被內部員工質疑

華爾街見聞
10/01

Gemini 4發布遭內部質疑,基準測分亮眼,實際編碼表現參差不齊。

華爾街見聞提及,周三谷歌正式向外部發布Gemini 4 Argon,將其定位為公司長期研發的旗艦人工智能模型。

然而據彭博報道,儘管該模型在多項基準測試中斬獲領先分數,部分有權限直接使用該模型的谷歌內部人員卻對其實際表現持保留態度,尤其是在編碼能力方面。

谷歌方面明確否認上述質疑,表示有關Gemini 4在編碼等領域表現不佳的說法"不準確",並援引Google DeepMind負責人Koray Kavukcuoglu的表態為佐證。Kavukcuoglu上周在The Information主辦的一場會議上表示:

我對團隊有充分的信心,在我看來,我們始終處於前沿是板上釘釘的事。

面對OpenAI和Anthropic在模型與產品雙線推進的競爭壓力,Gemini 4能否在真實場景中兌現承諾,對谷歌的搜索、廣告及雲業務均具有直接影響。消息傳出後,Alphabet盤後漲幅明顯收窄。

內部分歧:基準佳績難掩實際短板

據彭博援引知情人士,Gemini 4在業界通用基準測試中表現良好,但在員工實際使用中效果明顯打折,尤其在編碼任務上暴露出明顯短板。

報道援引其中一名知情人士指出,該模型在前端設計領域能力欠缺,而前端設計直接決定應用程序和網站的視覺呈現與交互體驗。

部分員工認為,Anthropic的Fable和OpenAI的Astra在能力迭代速度上已超過Gemini,Gemini 4即便發揮最佳也將在若干領域落後。

另一部分員工則認為,新模型已經追平業內頂尖水準。一名熟悉模型開發的谷歌員工對彭博表示,公司內部存在"廣泛共識",認為Gemini 4屬於前沿級別,並否認其在真實編碼任務中存在困難。

此外,據報道援引知情人士透露,Gemini 4體量龐大。大體量模型通常意味着較高的推理成本,這將在谷歌持續加碼資本支出的背景下,對公司利潤率形成額外壓力。

「過度優化」還是真實能力?

業內人士將上述現象歸結為一種被稱為「過度優化」(Benchmaxxing)的行業痼疾——即工程師更專注於在標準化測試中取得高分,而非打造真正好用的產品。

據彭博,兩名熟悉Gemini 4的知情人士表示,該模型似乎受到這一問題的影響。AI初創公司Surge AI創始人Edwin Chen對此直言不諱:

打個比方,就好比說'我孩子SAT考了很高分'——但SAT成績並不能轉化為真實世界的表現。這是一個極其有害的問題。

AI實驗室普遍面臨這一困境,因為客戶往往以基準分數作為評估模型優劣的主要依據,這在客觀上推動了實驗室將精力向"刷榜"傾斜。

值得注意的是,Gemini 4並非沒有優勢。據一名知情人士介紹,該模型在多模態任務上表現突出,例如從視頻中提取元數據,在安全性和網絡安全領域也具備競爭力。

谷歌稱其在一項衡量安全技能的基準測試中超越了OpenAI的Astra模型。此外,該模型單次可生成最多100萬個token,約合75萬英文單詞。

代價高昂的彎路:3.5 Pro折戟與人才流失

Gemini 4的發布背後,是一段代價不菲的研發彎路。

谷歌原計劃於今年5月I/O大會後的6月推出Gemini 3.5 Pro,但該版本最終因未能達到內部目標而被放棄。

彭博資訊分析師Mandeep Singh估計,訓練一個前沿模型的單次運算成本最高可達4億美元,若疊加高薪AI研究人員的人力成本,實際支出將更為可觀。

與此同時,谷歌在人才端也承受持續失血之痛。多名明星AI研究員相繼離職,包括傳奇工程師Jeff Dean、諾貝爾獎得主John Jumper,以及對當下AI浪潮奠基技術有重要貢獻的Noam Shazeer。

今年8月,長期執掌谷歌AI研究的Demis Hassabis轉任董事長,將DeepMind日常運營交棒給Kavukcuoglu。

去年11月,谷歌發布Gemini 3,廣受好評,被普遍視為公司AI競爭力的一次重要轉折。此後一系列進展的停滯與反覆,令外界對其執行力產生質疑。

競爭窗口收窄:對手步步緊逼

Gemini 4面臨的外部壓力同樣不容小覷。

谷歌最直接的風險在於:Gemini系列模型是搜索、地圖、Gmail、Chrome等核心產品的技術底座,每款產品的用戶規模均超過10億。

一旦模型競爭力落後,競爭對手將獲得更多時間,說服開發者、企業和消費者選擇其平台作為未來搜索與軟件的運行基礎。

與此同時,OpenAI和Anthropic正加速從模型提供商向產品公司轉型,包括推進AI編碼代理等應用。據報道,Meta本月早些時候發布了其AI代理平台Muse,發布後迅速登頂應用下載榜。

谷歌方面表示,儘管其上一個Pro版本於今年2月發布,公司旗下AI產品仍實現增長,企業版Gemini、消費者聊天機器人應用及谷歌搜索AI模式的用戶均在擴張,後兩者用戶總數已突破10億。

谷歌強調,龐大的用戶分發體系是公司相較部分競爭對手的顯著優勢。

然而,優勢能否轉化為AI時代的持續領先,仍取決於Gemini系列能否在真實應用場景中令用戶信服。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10