
今天凌晨,小紅書終於是把IMO滿分奪金模型的同系列版本開源了,這個模型就是dots3-note preview。
和GPT-5.6、Claude Fable 5這樣的大參數模型不同,dots3-note preview是一個非常小非常輕量的模型。
2026年7月的時候,它的同系列模型,曾以42/42拿下IMO國際數學奧林匹克競賽官方認證的滿分金牌。是IMO官方評閱史上第一個滿分 AI,同年金牌線是29分,全球所有人類選手中,僅有7人獲得滿分。
和常規的benchmark不一樣,IMO的賽題都是保密的,無法提前針對性訓練,能拿滿分就是真有實力。
有意思的地方是,它沒有把IMO當賣點,反而把重點放在了「生活裏沒有標準答案,但有真實任務」上。
01
小模型辦大事,靠譜嗎?
dots3-note preview是dots3系列裏最輕的一個,總參280B,激活只有16B,512K上下文。
在dots3-note preview之前,輕量模型跟Agent之間有一道鴻溝。無論是技術社區,還是大衆媒體,都普遍認為Agent只屬於萬億參數的巨無霸模型。
因為參數量本身就代表了模型的知識儲備,這是無可厚非的。不過參數量多少,並不等於完成任務的效果。
結果就是dots3-note preview甚至只用了那些超大模型成本的零頭,就完成了相同的任務。
能做到這些,主要在於dots3-note preview「解題」的思路很有意思。它是輕量模型,所以不可能和別的模型比肌肉、硬碰硬。於是dots3-note preview走了一個很「不AI的方法」,整體的運行邏輯更像是我們小時候刷考試題。
把試卷的每道題都單獨拎出來,一道題一道題地看,遇到不會的題就翻開書看一眼,看明白了再做下一道題。這樣下來,一個完整、複雜的任務,就被分解成了一道又一道熟悉的題,整個任務便迎刃而解。
從多項主流benchmark數據來看,在多項推理及智能體任務上,dots3-note preview的得分甚至超過了參數規模數倍於自身的大尺寸模型,視覺能力在同尺寸區間表現突出。


dots3-note preview最大的優勢體現在「個人智能體、複雜推理與從環境中學習解決長程問題」上,相關訓練方法創新已在技術博客中對應展開。
還有一點,在解決「日常生活」中的難題時,往往追求的並不是誰性能上限更高,而是誰用起來更方便。就像雨傘一樣,大模型就像是超大的庭院傘,覆蓋面積又大,防曬防雨效果又好,可是相較於日常出行,隨手能揣在包裏的摺疊傘才更實用。
這一年有一個很明顯的變化,大模型能力的敘事主線不再是「答對一道題」了,反而是比誰更便宜地「完成一件事」。
數學、代碼、科學和工程之所以是現階段最熱門的話題,主要是因為它們評分標準比較清晰,模型效果如何,可以被verifier判斷,訓練系統也因此拿到清晰的獎勵信號(reward signal)。
靠着強化學習、test-time scaling和更長的rollout,模型逐漸學會規劃、執行、檢查、修正。
但問題在於,生活並沒有那麼理性,假如AI想要走進人們的現實生活,它需要一套完全不同的評判標準。
現實生活裏碰到的問題,很難像數學題那樣明確地區分出對與錯。比如結婚、旅行這樣的經歷,就沒辦法給出直接明瞭的判斷。
所以諸如此類的long-horizon RL任務,它的核心瓶頸,從來不是把rollout過程拉長,而是在獎勵模糊、評價主觀。需要一套標準,在外部狀態持續變化的任務裏,建立可擴展的自我評價和學習信號。
小紅書dots實驗室這次開源的dots3-note preview,本質上就是在做這件事。
這版模型的訓練非常強調self-critiquing(自我評價),並提出了TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。
自我評價解決的,是「信號來得太晚」的問題。
在訓練階段,自我批評能為長時間rollout的中間狀態,提供更可擴展的value和獎勵信號,讓模型不再完全依賴可能幾十小時後纔到來的終局反饋。
到了推理和執行階段,這套能力又變成一個類似於Harness的持續循環。它會先讓模型觀察環境,然後評價當前的進展。根據評價結果重新規劃,最後採取行動,完成整個循環後「自我評價」將再次啓動評估。
模型會主動獲取信息、理解環境變化、評估任務進度、調整計劃,再用工具或代碼跟環境交互。
就像考試一樣,以前是你做完所有的題目,把試卷交上去,老師判完卷子給你發下來,你才知道你哪裏做錯了。但是有了「自我評價」之後,你每做一道題,都能立刻知道是錯了還是對了。
但是光有「自我評價」不夠,就像我們拍蚊子,明明眼睛能看到蚊子的飛行軌跡,可是到手拍的時候,卻發現自己很難精準拍上。
於是小紅書dots實驗室又提出了TEMPO,它想解決的,正是「評價跟不上行動」這個問題。
TEMPO的全稱是Test-time-scaled Value Estimation with Macro-step Policy Optimization(測試時擴展的價值估計 + 宏步策略優化)。
它的核心邏輯是通過剛纔提到的「自我評價」來進行超長程任務的強化學習。
具體來講,TEMPO把一條可能持續幾十小時的軌跡,切成若干個macro-step,每個macro-step裏模型和環境進行多輪交互。
階段結束時,同一個模型從actor切換成critic,通過推理、工具調用和test-time scaling,估算當前狀態的預期剩餘回報,為還沒走完的軌跡構造訓練信號。
actor和critic共享完全相同的參數,所以無論是上場做事,還是停下來評價對錯,都是同一個模型自己完成的,就像運動員跑步的時候自己給自己掐秒錶一樣。
所以訓練不只是教它怎麼行動,也在教它怎麼把自己評準:評得越準,訓練信號越可靠,那就會讓學習的過程越來越穩。
相比之下,依賴終局獎勵的傳統範式,一條rollout幾十小時,信號來得晚,還很難做信用分配。
TEMPO訓練的模型,不僅在測試時評估指標上更好,而且因為它能優化到很靠後的探索步驟,agent不會像基線方法那樣,在高輪數狀態下分數不再提升。
目前,這套機制已經初見成效。7月的IMO 2026上,基於dots3-note preview分支版本的模型,在推理階段同時負責生成proof,並通過工具調用對自己生成的proof做迭代式自我評估,最終拿下IMO 2026官方認證的滿分金牌。
當然,如果你感興趣,還可以自己去體驗一把。
官方技術博客: https://studio.dots.ai/dots/dots3-zh.html
Huggingface: https://huggingface.co/dots-studio/dots3-note-prev
Github: https://github.com/studio-dots-ai/dots3-note-prev
02
從《殺戮尖塔2》再到「斬殺線」
現實生活中常見的問題,往往都是持續變化的,尤其像是天氣、堵車這些臨時變更,不可能會有人提前打跟模型好招呼,這就使得,AI的隨機應變、臨場發揮能力,要遠比背了多少本書更重要。
dots3-note preview在這類能力上最直觀的展示,是《殺戮尖塔2》。此前,模型從未訓練過該遊戲,連類似環境都沒見過。但視頻裏能看到,它靠持續探索從環境裏學習,比如遊戲的這張卡有什麼作用,那張卡又能打多少傷害。
一開始沒有規則,也不會告訴模型如何才能通關,dots3-note preview只能一點一點摸索,先假設、再嘗試、再驗證,把假設寫進自己的memory,等到下次做決策的時候再拿出來用。
視頻中顯示,通過自己的摸索,模型也是一口氣玩到了33關。在一個完全陌生的環境裏,它證明了「自主學習」這件事本身能成立,而不是只會背題。
完全通過上下文去學習,也是ARC-AGI 3這個benchmark想測的東西。
ARC-AGI 3是ARC Prize在2026年推出的測試,重點從以前benchmark常見的靜態推理,變成了看AI能不能像人一樣在陌生環境裏自學,先假設通關條件,嘗試通關,驗證假設,假設不準就自我批評、修正。
舉個簡單例子,我們在瀏覽網頁的時候,偶爾會有小彈窗遮擋視線。我們通常的做法是第一時間找到這個彈窗上的X按鈕,來關掉彈窗。
ARC-AGI 3裏面也有類似的試題,關卡會出現網格內的遮擋色塊(類似彈窗擋住可交互區域),必須先點擊對應位置消除這塊遮擋,才能繼續完成關卡。
簡單來說,ARC-AGI 3就是一個專門為「折騰」模型而生的排行榜,上面每一道題,全都是現實生活中真實經歷過的。
dots3-note preview在公開評測上已經和opus4.8、gpt-5.5等閉源接近。
然而正如前文所提到的,現在已經不流行比上限了,現在比的是在完成任務的前提下,單位智能的成本。
最近有個詞很火,叫做「DeepSeek斬殺線」。指的正是此事。
dots3-note preview在ARC-AGI 3上也有,那就是在500美元的成本預算內,dots3-note preview是表現最好的那一個。

圖源:dots實驗室官方技術博客
而且這次開源的,不只是模型本身。為了讓社區能復現、能衡量這類能力,dots團隊還同步開源了兩個面向真實生活的benchmark,分別為VibeSearchBench和VibeLifeBench。
為什麼要把這兩個 benchmark 單獨拿出來說?因為在「真實生活的長程任務」這件事上,過去沒有人給過一把統一的尺子。dots 團隊只能先自己搭一套複雜場景模擬:覆蓋出行、就醫、採購、履約、社交這些真實服務,每個場景都帶後端狀態機、模擬時間線和一堆可調用工具。為了讓社區也能復現、也能衡量,他們乾脆把這套評測標準本身開源了出來。
VibeSearchBench考的是「意圖逐步披露條件下的多輪搜索」,共20個領域、200項任務。每項任務由一個模糊的初始請求和一個persona驅動的用戶模擬器構成。
用戶一開始根本不說清楚自己要什麼,在多輪對話裏會把約束、條件、需求一點點放出來。Agent可以用search、visit、code 三種動作,去搜索、訪問頁面、寫代碼。最後把模型預測出的知識圖譜和標準答案做節點與三聯體匹配,就是本次搜索的最終得分,核心指標是Triplet F1。
VibeLifeBench考的是「非靜態環境下的跨階段任務執行」,10個領域、20項任務,每項橫跨20到30個階段,帶模擬時間線,覆蓋大量真實服務環境。但是這個benchmark不是靜態的,用戶消息、業務通知、後端狀態的變化,都是按階段發生的,並且不一定會全同時發生。
03
小紅書dots實驗室的願景
聊到最後,其實dots實驗室想講的,是下一代的Agent,要走進現實生活的。
比起更會答題,dots實驗室希望下一代的Agent,應該是一個真正長期服務每個人的AI。
它能靠多模態能力感知真實世界,又能通過模型能力和Agent能力做複雜推理,最後調用工具解決問題。更重要的是,它需要具備主動性和持續學習能力,會隨着世界的變化、對用戶理解的加深,不斷進化。
dots實驗室在官網(studio.dots.ai)這樣寫道,創前沿智能,解生活之問。讓前沿智能服務於日常生活。從預訓練、多模態到後訓練、AI Infra,落腳點始終是「生活」本身。
那為什麼偏偏從「真實生活長程任務」切入呢?
因為小紅書本身就是圍繞真實的生活內容分享建立的。這裏面也有參數,比如審美、預算、忌口、甚至還有帶不帶娃等等。
這些事說不清對錯,又多模態、動態、主觀。
而dots實驗室想解決的,恰恰正是這些生活任務。
小紅書自己就長在這些場景裏,旅行、婚禮、開店、選房、養娃……每天有無數用戶在這裏分享真實偏好和真實經歷。所以這不是繞開誰的主戰場,而是從自己最熟悉、也最複雜的地方出發,做一件別人還沒做明白的事。
dots3-note preview是堅實的一步,方向立住了,剩下的是耐心。
它把方法、評測和思考,一起攤開在技術社區面前。至於最後AI能不能走進現實生活,接下來,不只小紅書一家的事。