人工智能与计算 · 2025-01
DeepSeek-R1: Incentivizing Reasoning Capability via RLPDF Download
DeepSeek
DeepSeek-R1 探索用强化学习改善语言模型推理,讨论不先做监督微调的路线,以及更完整的多阶段训练流程。
两条路线的对照,比单个分数更有信息。读的时候,留意推理能力、可读性、语言混用和训练样本处理之间的取舍。
4.8 MB · SHA-256: b191b0a365a64b4ab2791d117069ed17a2933d03554a662ced58b37df52018f4