Loading...
← 技术进步文献

人工智能与计算 · 2025-01

DeepSeek-R1: Incentivizing Reasoning Capability via RLPDF Download

DeepSeek

DeepSeek-R1 探索用強化學習改善語言模型推理,討論不先做監督微調的路線,以及更完整的多階段訓練流程。

兩條路線的對照,比單個分數更有信息。讀的時候,留意推理能力、可讀性、語言混用和訓練樣本處理之間的取捨。

4.8 MB · SHA-256: b191b0a365a64b4ab2791d117069ed17a2933d03554a662ced58b37df52018f4