当前位置：首页 > article >正文

DeepSeek-R1：通过强化学习激励大型语言模型的推理能力

article 2025/2/21 22:51:24

摘要

我们介绍了第一代推理模型DeepSeek-R1-Zero和DeepSeek-R1。DeepSeek-R1-Zero是一个通过大规模强化学习（RL）训练而成的模型，无需监督微调（SFT）作为初步步骤，展示了卓越的推理能力。通过RL，DeepSeek-R1-Zero自然涌现出许多强大而有趣的推理行为。然而，它也面临诸如可读性差和语言混合等挑战。为了解决这些问题并进一步提升推理性能，我们引入了DeepSeek-R1，它在RL之前加入了多阶段训练和冷启动数据。DeepSeek-R1在推理任务上的表现与OpenAI-o1-1217相当。为了支持研究社区，我们开源了DeepSeek-R1-Zero、DeepSeek-R1以及基于Qwen和Llama从DeepSeek-R1蒸馏出的六个密集模型（1.5B、7B、8B、14B、32B、70B）。
在这里插入图片描述 # 1. 引言
近年来，大型语言模型（LLMs）正在经历快速的迭代和演进（Anthropic, 2024; Google, 2024; OpenAI, 2024a），逐步缩小与人工通用智能（AGI）的差距。
最近，后训练（post-train