全球首个IMO满分AI,正在研究怎么帮你搞装修、办婚礼

字母榜
Aug 14

今天凌晨,小红书终于是把IMO满分夺金模型的同系列版本开源了,这个模型就是dots3-note preview。

和GPT-5.6、Claude Fable 5这样的大参数模型不同,dots3-note preview是一个非常小非常轻量的模型。

2026年7月的时候,它的同系列模型,曾以42/42拿下IMO国际数学奥林匹克竞赛官方认证的满分金牌。是IMO官方评阅史上第一个满分 AI,同年金牌线是29分,全球所有人类选手中,仅有7人获得满分。

和常规的benchmark不一样,IMO的赛题都是保密的,无法提前针对性训练,能拿满分就是真有实力。

有意思的地方是,它没有把IMO当卖点,反而把重点放在了“生活里没有标准答案,但有真实任务”上。

01

小模型办大事,靠谱吗?

dots3-note preview是dots3系列里最轻的一个,总参280B,激活只有16B,512K上下文。

在dots3-note preview之前,轻量模型跟Agent之间有一道鸿沟。无论是技术社区,还是大众媒体,都普遍认为Agent只属于万亿参数的巨无霸模型。

因为参数量本身就代表了模型的知识储备,这是无可厚非的。不过参数量多少,并不等于完成任务的效果。

结果就是dots3-note preview甚至只用了那些超大模型成本的零头,就完成了相同的任务。

能做到这些,主要在于dots3-note preview“解题”的思路很有意思。它是轻量模型,所以不可能和别的模型比肌肉、硬碰硬。于是dots3-note preview走了一个很“不AI的方法”,整体的运行逻辑更像是我们小时候刷考试题。

把试卷的每道题都单独拎出来,一道题一道题地看,遇到不会的题就翻开书看一眼,看明白了再做下一道题。这样下来,一个完整、复杂的任务,就被分解成了一道又一道熟悉的题,整个任务便迎刃而解。

从多项主流benchmark数据来看,在多项推理及智能体任务上,dots3-note preview的得分甚至超过了参数规模数倍于自身的大尺寸模型,视觉能力在同尺寸区间表现突出。

dots3-note preview最大的优势体现在“个人智能体、复杂推理与从环境中学习解决长程问题”上,相关训练方法创新已在技术博客中对应展开。

还有一点,在解决“日常生活”中的难题时,往往追求的并不是谁性能上限更高,而是谁用起来更方便。就像雨伞一样,大模型就像是超大的庭院伞,覆盖面积又大,防晒防雨效果又好,可是相较于日常出行,随手能揣在包里的折叠伞才更实用。

这一年有一个很明显的变化,大模型能力的叙事主线不再是“答对一道题”了,反而是比谁更便宜地“完成一件事”。

数学、代码、科学和工程之所以是现阶段最热门的话题,主要是因为它们评分标准比较清晰,模型效果如何,可以被verifier判断,训练系统也因此拿到清晰的奖励信号(reward signal)。

靠着强化学习、test-time scaling和更长的rollout,模型逐渐学会规划、执行、检查、修正。

但问题在于,生活并没有那么理性,假如AI想要走进人们的现实生活,它需要一套完全不同的评判标准。

现实生活里碰到的问题,很难像数学题那样明确地区分出对与错。比如结婚、旅行这样的经历,就没办法给出直接明了的判断。

所以诸如此类的long-horizon RL任务,它的核心瓶颈,从来不是把rollout过程拉长,而是在奖励模糊、评价主观。需要一套标准,在外部状态持续变化的任务里,建立可扩展的自我评价和学习信号。

小红书dots实验室这次开源的dots3-note preview,本质上就是在做这件事。

这版模型的训练非常强调self-critiquing(自我评价),并提出了TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。

自我评价解决的,是“信号来得太晚”的问题。

在训练阶段,自我批评能为长时间rollout的中间状态,提供更可扩展的value和奖励信号,让模型不再完全依赖可能几十小时后才到来的终局反馈。

到了推理和执行阶段,这套能力又变成一个类似于Harness的持续循环。它会先让模型观察环境,然后评价当前的进展。根据评价结果重新规划,最后采取行动,完成整个循环后“自我评价”将再次启动评估。

模型会主动获取信息、理解环境变化、评估任务进度、调整计划,再用工具或代码跟环境交互。

就像考试一样,以前是你做完所有的题目,把试卷交上去,老师判完卷子给你发下来,你才知道你哪里做错了。但是有了“自我评价”之后,你每做一道题,都能立刻知道是错了还是对了。

但是光有“自我评价”不够,就像我们拍蚊子,明明眼睛能看到蚊子的飞行轨迹,可是到手拍的时候,却发现自己很难精准拍上。

于是小红书dots实验室又提出了TEMPO,它想解决的,正是“评价跟不上行动”这个问题。

TEMPO的全称是Test-time-scaled Value Estimation with Macro-step Policy Optimization(测试时扩展的价值估计 + 宏步策略优化)。

它的核心逻辑是通过刚才提到的“自我评价”来进行超长程任务的强化学习。

具体来讲,TEMPO把一条可能持续几十小时的轨迹,切成若干个macro-step,每个macro-step里模型和环境进行多轮交互。

阶段结束时,同一个模型从actor切换成critic,通过推理、工具调用和test-time scaling,估算当前状态的预期剩余回报,为还没走完的轨迹构造训练信号。

actor和critic共享完全相同的参数,所以无论是上场做事,还是停下来评价对错,都是同一个模型自己完成的,就像运动员跑步的时候自己给自己掐秒表一样。

所以训练不只是教它怎么行动,也在教它怎么把自己评准:评得越准,训练信号越可靠,那就会让学习的过程越来越稳。

相比之下,依赖终局奖励的传统范式,一条rollout几十小时,信号来得晚,还很难做信用分配。

TEMPO训练的模型,不仅在测试时评估指标上更好,而且因为它能优化到很靠后的探索步骤,agent不会像基线方法那样,在高轮数状态下分数不再提升。

目前,这套机制已经初见成效。7月的IMO 2026上,基于dots3-note preview分支版本的模型,在推理阶段同时负责生成proof,并通过工具调用对自己生成的proof做迭代式自我评估,最终拿下IMO 2026官方认证的满分金牌。

当然,如果你感兴趣,还可以自己去体验一把。

官方技术博客: https://studio.dots.ai/dots/dots3-zh.html

Huggingface: https://huggingface.co/dots-studio/dots3-note-prev

Github:  https://github.com/studio-dots-ai/dots3-note-prev

02

从《杀戮尖塔2》再到“斩杀线”

现实生活中常见的问题,往往都是持续变化的,尤其像是天气、堵车这些临时变更,不可能会有人提前打跟模型好招呼,这就使得,AI的随机应变、临场发挥能力,要远比背了多少本书更重要。

dots3-note preview在这类能力上最直观的展示,是《杀戮尖塔2》。此前,模型从未训练过该游戏,连类似环境都没见过。但视频里能看到,它靠持续探索从环境里学习,比如游戏的这张卡有什么作用,那张卡又能打多少伤害。

一开始没有规则,也不会告诉模型如何才能通关,dots3-note preview只能一点一点摸索,先假设、再尝试、再验证,把假设写进自己的memory,等到下次做决策的时候再拿出来用。

视频中显示,通过自己的摸索,模型也是一口气玩到了33关。在一个完全陌生的环境里,它证明了“自主学习”这件事本身能成立,而不是只会背题。

完全通过上下文去学习,也是ARC-AGI 3这个benchmark想测的东西。

ARC-AGI 3是ARC Prize在2026年推出的测试,重点从以前benchmark常见的静态推理,变成了看AI能不能像人一样在陌生环境里自学,先假设通关条件,尝试通关,验证假设,假设不准就自我批评、修正。

举个简单例子,我们在浏览网页的时候,偶尔会有小弹窗遮挡视线。我们通常的做法是第一时间找到这个弹窗上的X按钮,来关掉弹窗。

ARC-AGI 3里面也有类似的试题,关卡会出现网格内的遮挡色块(类似弹窗挡住可交互区域),必须先点击对应位置消除这块遮挡,才能继续完成关卡。

简单来说,ARC-AGI 3就是一个专门为“折腾”模型而生的榜单,上面每一道题,全都是现实生活中真实经历过的。

dots3-note preview在公开评测上已经和opus4.8、gpt-5.5等闭源接近。

然而正如前文所提到的,现在已经不流行比上限了,现在比的是在完成任务的前提下,单位智能的成本。

最近有个词很火,叫做“DeepSeek斩杀线”。指的正是此事。

dots3-note preview在ARC-AGI 3上也有,那就是在500美元的成本预算内,dots3-note preview是表现最好的那一个。

图源:dots实验室官方技术博客

而且这次开源的,不只是模型本身。为了让社区能复现、能衡量这类能力,dots团队还同步开源了两个面向真实生活的benchmark,分别为VibeSearchBench和VibeLifeBench。

为什么要把这两个 benchmark 单独拿出来说?因为在“真实生活的长程任务”这件事上,过去没有人给过一把统一的尺子。dots 团队只能先自己搭一套复杂场景模拟:覆盖出行、就医、采购、履约、社交这些真实服务,每个场景都带后端状态机、模拟时间线和一堆可调用工具。为了让社区也能复现、也能衡量,他们干脆把这套评测标准本身开源了出来。

VibeSearchBench考的是“意图逐步披露条件下的多轮搜索”,共20个领域、200项任务。每项任务由一个模糊的初始请求和一个persona驱动的用户模拟器构成。

用户一开始根本不说清楚自己要什么,在多轮对话里会把约束、条件、需求一点点放出来。Agent可以用search、visit、code 三种动作,去搜索、访问页面、写代码。最后把模型预测出的知识图谱和标准答案做节点与三联体匹配,就是本次搜索的最终得分,核心指标是Triplet F1。

VibeLifeBench考的是“非静态环境下的跨阶段任务执行”,10个领域、20项任务,每项横跨20到30个阶段,带模拟时间线,覆盖大量真实服务环境。但是这个benchmark不是静态的,用户消息、业务通知、后端状态的变化,都是按阶段发生的,并且不一定会全同时发生。

03

小红书dots实验室的愿景

聊到最后,其实dots实验室想讲的,是下一代的Agent,要走进现实生活的。

比起更会答题,dots实验室希望下一代的Agent,应该是一个真正长期服务每个人的AI。

它能靠多模态能力感知真实世界,又能通过模型能力和Agent能力做复杂推理,最后调用工具解决问题。更重要的是,它需要具备主动性和持续学习能力,会随着世界的变化、对用户理解的加深,不断进化。

dots实验室在官网(studio.dots.ai)这样写道,创前沿智能,解生活之问。让前沿智能服务于日常生活。从预训练、多模态到后训练、AI Infra,落脚点始终是“生活”本身。

那为什么偏偏从“真实生活长程任务”切入呢?

因为小红书本身就是围绕真实的生活内容分享建立的。这里面也有参数,比如审美、预算、忌口、甚至还有带不带娃等等。

这些事说不清对错,又多模态、动态、主观。

而dots实验室想解决的,恰恰正是这些生活任务。

小红书自己就长在这些场景里,旅行、婚礼、开店、选房、养娃……每天有无数用户在这里分享真实偏好和真实经历。所以这不是绕开谁的主战场,而是从自己最熟悉、也最复杂的地方出发,做一件别人还没做明白的事。

dots3-note preview是坚实的一步,方向立住了,剩下的是耐心。

它把方法、评测和思考,一起摊开在技术社区面前。至于最后AI能不能走进现实生活,接下来,不只小红书一家的事。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10