Loading...
← 技术进步文献

人工智能与计算 · 2025-01

DeepSeek-R1: Incentivizing Reasoning Capability via RLPDF Download

DeepSeek

DeepSeek-R1 探索用强化学习改善语言模型推理,讨论不先做监督微调的路线,以及更完整的多阶段训练流程。

两条路线的对照,比单个分数更有信息。读的时候,留意推理能力、可读性、语言混用和训练样本处理之间的取舍。

4.8 MB · SHA-256: b191b0a365a64b4ab2791d117069ed17a2933d03554a662ced58b37df52018f4