中概AI算力股拉升,小米开源首个为推理而生的大模型

老虎资讯综合
Yesterday

周三,中概AI算力股拉升,金山云一度涨超12%,万国数据涨超6%,世纪互联涨超5%。今天,小米开源首个为推理而生的大模型「Xiaomi MiMo」。

今天,小米开源首个为推理(Reasoning)而生的大模型「Xiaomi MiMo」,联动预训练到后训练,全面提升推理能力。

在数学推理(AIME 24-25)和 代码竞赛(LiveCodeBench v5)公开测评集上,MiMo 仅用 7B 的参数规模,超越了 OpenAI 的闭源推理模型 o1-mini 和阿里 Qwen 更大规模的开源推理模型 QwQ-32B-Preview。

  强化学习潜力超越经典开源32B模型

随着DeepSeek-R1引发业界强化学习(RL)共创潮,DeepSeek-R1-Distill-7B和Qwen2.5-32B已成为广泛使用的强化学习起步模型。

在相同RL训练数据情况下,MiMo-7B 的数学&代码领域的强化学习潜力显著领先。

  预训练+后训练,联动提升推理能力

MiMo推理能力的提升,由预训练和后训练阶段中数据和算法等多层面的创新联合驱动,包括:

  • 预训练:核心是让模型见过更多推理模式

    • 数据:着重挖掘富推理语料,并合成约200B tokens推理数据。

    • 训练:进行了三阶段训练,逐步提升训练难度,总训练25T tokens。

  • 后训练:核心是高效稳定的强化学习算法和框架

    • 算法:提出 Test Difficulty Driven Reward 来缓解困难算法问题中的奖励稀疏问题,并引入 Easy Data Re-Sampling 策略,以稳定 RL 训练

    • 框架:设计了Seamless Rollout系统,使得RL训练加速2.29倍,验证加速1.96倍。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10