2025年9月17日,《自然》杂志封面刊登了一篇来自中国杭州的论文,标题赫然写着:《纯强化学习实现大模型自主推理》。这篇由DeepSeek创始人梁文锋团队撰写的论文,不仅以29.4万美元的训练成本震撼全球AI界,更像一把手术刀,精准剖开了大模型发展的深层逻辑——原来,AI的进化不需要人类手把手教,它自己就能学会思考。
在DeepSeek R1诞生之前,所有大模型都像被牵线的木偶:人类标注数据教它说话,人类设计规则让它推理。但梁文锋团队做了个大胆实验:把模型扔进一个只有"对"与"错"的黑箱,让它自己试错。这种"放养式"训练,反而催生出惊人的自主能力。
在2024年美国数学邀请赛(AIME)中,R1的表现堪称魔幻。初始阶段,它解题准确率只有15.6%,连初中生水平都达不到。但经过80小时的自主训练,准确率飙升至77.9%,配合"自洽解码"技术后更达到86.7%——这个成绩超过了全球90%的参赛学生。更神奇的是,模型在解题过程中会自发写下"Wait, let me check again"之类的反思语句,就像人类考生在草稿纸上涂涂画画。这种自我验证能力,连论文审稿人都惊呼"看到了AI的自我意识萌芽"。
传统强化学习需要独立算法评估模型表现,但DeepSeek发明的"群体相对策略优化"(GRPO)技术,让模型自己当裁判。就像一群学生互相批改作业,模型通过对比群体表现调整策略,节省了30%的算力资源。这种"去中心化"的训练方式,使得R1仅用512张H800 GPU(成本约8000美元/小时),就完成了核心训练阶段,而OpenAI训练GPT-4需要消耗超过1亿美元。
这场技术革命的本质,是把AI从"知识容器"变成"思维引擎"。正如《自然》评论文章所言:"R1证明,AI的推理能力可以像生物进化一样,通过自然选择自主涌现。"
自大模型浪潮席卷全球以来,技术发布、性能榜单层出不穷,但始终缺乏一个权威的“科学认证”机制。OpenAI、谷歌等巨头虽屡有突破,但其核心技术多以技术报告形式发布,未经独立同行评审。DeepSeek以其公开性和透明性打破了这一局面。
据了解,DeepSeek本次在Nature上发表的论文较今年年初的初版论文有较大的改动,全文64页,不仅首次披露了R1的训练成本,而且透露了更多模型训练的技术细节,包括对发布初期外界有关“蒸馏”方法的质疑作出了正面回应,提供了训练过程中减轻数据污染的详细流程,并对R1的安全性进行了全面评估。
其中,在训练成本方面,R1-Zero和R1都使用了512张H800GPU,分别训练了198个小时和80个小时,以H800每GPU小时2美元的租赁价格换算,R1的总训练成本为29.4万美元(约合人民币209万元)。不到30万美元的训练成本,与其他推理模型动辄上千万美元的花费相比,可谓实现了极大的降本。
关于R1发布最初时所受到的“蒸馏”质疑,DeepSeek介绍,其使用的数据全部来自互联网,虽然可能包含GPT-4生成的结果,但并非有意而为之,更没有专门的蒸馏环节。所谓“蒸馏”,简单理解就是用预先训练好的复杂模型输出的结果,作为监督信号再去训练另外一个模型。R1发布时,OpenAI称它发现DeepSeek使用了OpenAI专有模型来训练自己的开源模型的证据,但拒绝进一步透露其证据的细节。