全球首個IMO滿分AI,正在研究怎麼幫你搞裝修、辦婚禮

字母榜
08/14

今天凌晨,小紅書終於是把IMO滿分奪金模型的同系列版本開源了,這個模型就是dots3-note preview。

和GPT-5.6、Claude Fable 5這樣的大參數模型不同,dots3-note preview是一個非常小非常輕量的模型。

2026年7月的時候,它的同系列模型,曾以42/42拿下IMO國際數學奧林匹克競賽官方認證的滿分金牌。是IMO官方評閱史上第一個滿分 AI,同年金牌線是29分,全球所有人類選手中,僅有7人獲得滿分。

和常規的benchmark不一樣,IMO的賽題都是保密的,無法提前針對性訓練,能拿滿分就是真有實力。

有意思的地方是,它沒有把IMO當賣點,反而把重點放在了「生活裏沒有標準答案,但有真實任務」上。

01

小模型辦大事,靠譜嗎?

dots3-note preview是dots3系列裏最輕的一個,總參280B,激活只有16B,512K上下文。

在dots3-note preview之前,輕量模型跟Agent之間有一道鴻溝。無論是技術社區,還是大衆媒體,都普遍認為Agent只屬於萬億參數的巨無霸模型。

因為參數量本身就代表了模型的知識儲備,這是無可厚非的。不過參數量多少,並不等於完成任務的效果。

結果就是dots3-note preview甚至只用了那些超大模型成本的零頭,就完成了相同的任務。

能做到這些,主要在於dots3-note preview「解題」的思路很有意思。它是輕量模型,所以不可能和別的模型比肌肉、硬碰硬。於是dots3-note preview走了一個很「不AI的方法」,整體的運行邏輯更像是我們小時候刷考試題。

把試卷的每道題都單獨拎出來,一道題一道題地看,遇到不會的題就翻開書看一眼,看明白了再做下一道題。這樣下來,一個完整、複雜的任務,就被分解成了一道又一道熟悉的題,整個任務便迎刃而解。

從多項主流benchmark數據來看,在多項推理及智能體任務上,dots3-note preview的得分甚至超過了參數規模數倍於自身的大尺寸模型,視覺能力在同尺寸區間表現突出。

dots3-note preview最大的優勢體現在「個人智能體、複雜推理與從環境中學習解決長程問題」上,相關訓練方法創新已在技術博客中對應展開。

還有一點,在解決「日常生活」中的難題時,往往追求的並不是誰性能上限更高,而是誰用起來更方便。就像雨傘一樣,大模型就像是超大的庭院傘,覆蓋面積又大,防曬防雨效果又好,可是相較於日常出行,隨手能揣在包裏的摺疊傘才更實用。

這一年有一個很明顯的變化,大模型能力的敘事主線不再是「答對一道題」了,反而是比誰更便宜地「完成一件事」。

數學、代碼、科學和工程之所以是現階段最熱門的話題,主要是因為它們評分標準比較清晰,模型效果如何,可以被verifier判斷,訓練系統也因此拿到清晰的獎勵信號(reward signal)。

靠着強化學習、test-time scaling和更長的rollout,模型逐漸學會規劃、執行、檢查、修正。

但問題在於,生活並沒有那麼理性,假如AI想要走進人們的現實生活,它需要一套完全不同的評判標準。

現實生活裏碰到的問題,很難像數學題那樣明確地區分出對與錯。比如結婚、旅行這樣的經歷,就沒辦法給出直接明瞭的判斷。

所以諸如此類的long-horizon RL任務,它的核心瓶頸,從來不是把rollout過程拉長,而是在獎勵模糊、評價主觀。需要一套標準,在外部狀態持續變化的任務裏,建立可擴展的自我評價和學習信號。

小紅書dots實驗室這次開源的dots3-note preview,本質上就是在做這件事。

這版模型的訓練非常強調self-critiquing(自我評價),並提出了TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。

自我評價解決的,是「信號來得太晚」的問題。

在訓練階段,自我批評能為長時間rollout的中間狀態,提供更可擴展的value和獎勵信號,讓模型不再完全依賴可能幾十小時後纔到來的終局反饋。

到了推理和執行階段,這套能力又變成一個類似於Harness的持續循環。它會先讓模型觀察環境,然後評價當前的進展。根據評價結果重新規劃,最後採取行動,完成整個循環後「自我評價」將再次啓動評估。

模型會主動獲取信息、理解環境變化、評估任務進度、調整計劃,再用工具或代碼跟環境交互。

就像考試一樣,以前是你做完所有的題目,把試卷交上去,老師判完卷子給你發下來,你才知道你哪裏做錯了。但是有了「自我評價」之後,你每做一道題,都能立刻知道是錯了還是對了。

但是光有「自我評價」不夠,就像我們拍蚊子,明明眼睛能看到蚊子的飛行軌跡,可是到手拍的時候,卻發現自己很難精準拍上。

於是小紅書dots實驗室又提出了TEMPO,它想解決的,正是「評價跟不上行動」這個問題。

TEMPO的全稱是Test-time-scaled Value Estimation with Macro-step Policy Optimization(測試時擴展的價值估計 + 宏步策略優化)。

它的核心邏輯是通過剛纔提到的「自我評價」來進行超長程任務的強化學習。

具體來講,TEMPO把一條可能持續幾十小時的軌跡,切成若干個macro-step,每個macro-step裏模型和環境進行多輪交互。

階段結束時,同一個模型從actor切換成critic,通過推理、工具調用和test-time scaling,估算當前狀態的預期剩餘回報,為還沒走完的軌跡構造訓練信號。

actor和critic共享完全相同的參數,所以無論是上場做事,還是停下來評價對錯,都是同一個模型自己完成的,就像運動員跑步的時候自己給自己掐秒錶一樣。

所以訓練不只是教它怎麼行動,也在教它怎麼把自己評準:評得越準,訓練信號越可靠,那就會讓學習的過程越來越穩。

相比之下,依賴終局獎勵的傳統範式,一條rollout幾十小時,信號來得晚,還很難做信用分配。

TEMPO訓練的模型,不僅在測試時評估指標上更好,而且因為它能優化到很靠後的探索步驟,agent不會像基線方法那樣,在高輪數狀態下分數不再提升。

目前,這套機制已經初見成效。7月的IMO 2026上,基於dots3-note preview分支版本的模型,在推理階段同時負責生成proof,並通過工具調用對自己生成的proof做迭代式自我評估,最終拿下IMO 2026官方認證的滿分金牌。

當然,如果你感興趣,還可以自己去體驗一把。

官方技術博客: https://studio.dots.ai/dots/dots3-zh.html

Huggingface: https://huggingface.co/dots-studio/dots3-note-prev

Github:  https://github.com/studio-dots-ai/dots3-note-prev

02

從《殺戮尖塔2》再到「斬殺線」

現實生活中常見的問題,往往都是持續變化的,尤其像是天氣、堵車這些臨時變更,不可能會有人提前打跟模型好招呼,這就使得,AI的隨機應變、臨場發揮能力,要遠比背了多少本書更重要。

dots3-note preview在這類能力上最直觀的展示,是《殺戮尖塔2》。此前,模型從未訓練過該遊戲,連類似環境都沒見過。但視頻裏能看到,它靠持續探索從環境裏學習,比如遊戲的這張卡有什麼作用,那張卡又能打多少傷害。

一開始沒有規則,也不會告訴模型如何才能通關,dots3-note preview只能一點一點摸索,先假設、再嘗試、再驗證,把假設寫進自己的memory,等到下次做決策的時候再拿出來用。

視頻中顯示,通過自己的摸索,模型也是一口氣玩到了33關。在一個完全陌生的環境裏,它證明了「自主學習」這件事本身能成立,而不是只會背題。

完全通過上下文去學習,也是ARC-AGI 3這個benchmark想測的東西。

ARC-AGI 3是ARC Prize在2026年推出的測試,重點從以前benchmark常見的靜態推理,變成了看AI能不能像人一樣在陌生環境裏自學,先假設通關條件,嘗試通關,驗證假設,假設不準就自我批評、修正。

舉個簡單例子,我們在瀏覽網頁的時候,偶爾會有小彈窗遮擋視線。我們通常的做法是第一時間找到這個彈窗上的X按鈕,來關掉彈窗。

ARC-AGI 3裏面也有類似的試題,關卡會出現網格內的遮擋色塊(類似彈窗擋住可交互區域),必須先點擊對應位置消除這塊遮擋,才能繼續完成關卡。

簡單來說,ARC-AGI 3就是一個專門為「折騰」模型而生的排行榜,上面每一道題,全都是現實生活中真實經歷過的。

dots3-note preview在公開評測上已經和opus4.8、gpt-5.5等閉源接近。

然而正如前文所提到的,現在已經不流行比上限了,現在比的是在完成任務的前提下,單位智能的成本。

最近有個詞很火,叫做「DeepSeek斬殺線」。指的正是此事。

dots3-note preview在ARC-AGI 3上也有,那就是在500美元的成本預算內,dots3-note preview是表現最好的那一個。

圖源:dots實驗室官方技術博客

而且這次開源的,不只是模型本身。為了讓社區能復現、能衡量這類能力,dots團隊還同步開源了兩個面向真實生活的benchmark,分別為VibeSearchBench和VibeLifeBench。

為什麼要把這兩個 benchmark 單獨拿出來說?因為在「真實生活的長程任務」這件事上,過去沒有人給過一把統一的尺子。dots 團隊只能先自己搭一套複雜場景模擬:覆蓋出行、就醫、採購、履約、社交這些真實服務,每個場景都帶後端狀態機、模擬時間線和一堆可調用工具。為了讓社區也能復現、也能衡量,他們乾脆把這套評測標準本身開源了出來。

VibeSearchBench考的是「意圖逐步披露條件下的多輪搜索」,共20個領域、200項任務。每項任務由一個模糊的初始請求和一個persona驅動的用戶模擬器構成。

用戶一開始根本不說清楚自己要什麼,在多輪對話裏會把約束、條件、需求一點點放出來。Agent可以用search、visit、code 三種動作,去搜索、訪問頁面、寫代碼。最後把模型預測出的知識圖譜和標準答案做節點與三聯體匹配,就是本次搜索的最終得分,核心指標是Triplet F1。

VibeLifeBench考的是「非靜態環境下的跨階段任務執行」,10個領域、20項任務,每項橫跨20到30個階段,帶模擬時間線,覆蓋大量真實服務環境。但是這個benchmark不是靜態的,用戶消息、業務通知、後端狀態的變化,都是按階段發生的,並且不一定會全同時發生。

03

小紅書dots實驗室的願景

聊到最後,其實dots實驗室想講的,是下一代的Agent,要走進現實生活的。

比起更會答題,dots實驗室希望下一代的Agent,應該是一個真正長期服務每個人的AI。

它能靠多模態能力感知真實世界,又能通過模型能力和Agent能力做複雜推理,最後調用工具解決問題。更重要的是,它需要具備主動性和持續學習能力,會隨着世界的變化、對用戶理解的加深,不斷進化。

dots實驗室在官網(studio.dots.ai)這樣寫道,創前沿智能,解生活之問。讓前沿智能服務於日常生活。從預訓練、多模態到後訓練、AI Infra,落腳點始終是「生活」本身。

那為什麼偏偏從「真實生活長程任務」切入呢?

因為小紅書本身就是圍繞真實的生活內容分享建立的。這裏面也有參數,比如審美、預算、忌口、甚至還有帶不帶娃等等。

這些事說不清對錯,又多模態、動態、主觀。

而dots實驗室想解決的,恰恰正是這些生活任務。

小紅書自己就長在這些場景裏,旅行、婚禮、開店、選房、養娃……每天有無數用戶在這裏分享真實偏好和真實經歷。所以這不是繞開誰的主戰場,而是從自己最熟悉、也最複雜的地方出發,做一件別人還沒做明白的事。

dots3-note preview是堅實的一步,方向立住了,剩下的是耐心。

它把方法、評測和思考,一起攤開在技術社區面前。至於最後AI能不能走進現實生活,接下來,不只小紅書一家的事。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10