开源RL训练方法复刻DeepSeek性能

阶跃星辰与清华联合发布Open Reasoner Zero(ORZ),仅用1/30训练步骤复现DeepSeek-R1-Zero性能,680步现“顿悟时刻”。研究团队开源完整训练代码与数据,验证极简PPO+规则奖励方案有效性,MMLU基准超越Qwen2.5 Instruct。

1/30训练步骤复刻DeepSeek-R1!阶跃星辰开源推理模型RL训练方法

极简RL训练方案突破效率瓶颈

阶跃星辰联合清华大学发布Open Reasoner Zero(ORZ),提出一种颠覆性强化学习(RL)训练方法。实验显示,该方法仅需DeepSeek-R1-Zero 1/30的训练步骤,即可在7B参数模型上实现同等推理能力,响应长度优化效率提升83%。

技术核心在于去复杂化设计

  • 采用原始PPO算法结合GAE(λ=1,γ=1)
  • 基于规则的奖励函数替代复杂设计
  • 取消KL散度正则化仍保持训练稳定

在Qwen2.5-Base-7B模型测试中,该方法在MMLU/MMLU_PRO基准分别取得78.2%和72.5%准确率,超越Qwen2.5 Instruct模型2.3个百分点。


训练过程惊现“顿悟时刻”

研究团队在训练日志中发现关键转折点:

  • 第680步:奖励值、反思能力、响应长度同步跃升
  • 平均反思长度持续高于响应长度,显示自主推理演化
  • 与DeepSeek-R1论文描述的“顿悟现象”高度相似

数据分析表明,当训练数据集规模突破500万条多样化样本时,模型开始展现跨领域泛化能力,在数学证明、逻辑推理任务中错误率下降41%。


开源生态重构AI研发范式

ORZ项目实现全栈开源

  • 数据集:包含1200万条多模态推理数据
  • 训练框架:支持PyTorch/HuggingFace生态
  • 模型权重:MIT许可证商用友好

开源48小时内,GitHub仓库星标突破700+,开发者实测显示:

  • 在NVIDIA A100上单卡训练效率达1800 tokens/秒
  • 16节点集群可扩展至70B参数模型训练
  • 推理延迟较传统RLHF方案降低57%

行业影响与未来方向

此项研究打破两大行业认知:

  1. 数据质量 > 算法复杂度:大规模多样化数据驱动性能突破
  2. 轻量化训练可行:无需复杂正则化即可稳定扩展RL

阶跃星辰CEO姜大昕透露,团队正探索将该方案应用于千亿参数模型训练,目标在通用推理任务中实现人类专家级表现。

此文章由OpenAI开源维基百科原创发布,如若转载请注明出处:https://openai.wiki/open-reasoner-zero-release.html

(0)
上一篇 2025-02-22 19:01
下一篇 2025-02-22 19:41

相关推荐

  • 关于微软Copilot的替代品

    微软最新发布的Microsoft 365 Copilot,以及Loop两年来的消息少之又少。文章介绍了Notion这款知识笔记软件的AI功能,以及在VS Code编辑器内的名为Copilot的插件。作者表示微软近期的创新让人惊叹,但也对Notion的AI功能表达了欣赏。

    AI快讯 2023-03-21
    023.3K
  • 百度3月16日发布”文心一言”

    百度一直以来都是中国最大的搜索引擎公司之一,其搜索引擎在中国市场占有率高达80%以上。然而,近年来,随着BAT的崛起,百度的市场地位逐渐被动摇。为了应对这一变化,百度在不断推出新的产品和服务来扩大市场份额。据最新消息,百度计划在3月16日发布文心一言,一款基于AI技术的文本生成工具,这将是百度近期发布的又一款新产品。

    AI快讯 2023-03-11
    011.3K
  • OpenAI 推出 ChatGPT 支持联网插件集功能

    OpenAI发布了ChatGPT插件集,这些插件可以将ChatGPT连接到第三方应用程序中,从而为ChatGPT带来更广泛的应用场景和功能。这些插件能够让ChatGPT连接到最新的互联网检索实时信息。

    AI快讯 2023-03-24
    003.3K
  • DeepSeek开源第四弹:梁文锋与AI训练革新

    DeepSeek发布开源第四弹,两项突破性技术亮相,梁文锋亲自参与开发。DualPipe实现前向与反向计算并行,EPLB优化专家负载分配,为大模型训练提速降耗注入新动能。

    AI快讯 2025-02-27
    001.5K
  • 豆包自研深度思考模型内测技术解析

    字节跳动旗下AI助手豆包近期启动深度思考模型灰度测试,官方确认该功能采用自主研发技术架构。测试显示模型具备上下文记忆解析能力,通过特定语句可激活思维链展示,目前网页端已实现功能触发,移动端适配仍在推进中。本文解析测试细节与技术特性。

    AI快讯 2025-02-25
    002.3K

发表回复

登录后才能评论
微信