人工智能与计算 · 2025-01
DeepSeek-R1: Incentivizing Reasoning Capability via RLPDF Download
DeepSeek
DeepSeek-R1 探索用強化學習改善語言模型推理,討論不先做監督微調的路線,以及更完整的多階段訓練流程。
兩條路線的對照,比單個分數更有信息。讀的時候,留意推理能力、可讀性、語言混用和訓練樣本處理之間的取捨。
4.8 MB · SHA-256: b191b0a365a64b4ab2791d117069ed17a2933d03554a662ced58b37df52018f4