人工智能与计算 · 2022-03
Training Compute-Optimal Large Language Models (Chinchilla)PDF Download
Hoffmann et al. (DeepMind)
Chinchilla 在固定計算預算下重新考察參數量與訓練數據的配比,認爲不少大模型使用的訓練詞元太少。
和《Scaling Laws》一起讀,能看見一個有影響力的配方如何被重新修正。判斷模型時,除了參數量,也該問計算預算具體花在了哪裏。
5.7 MB · SHA-256: 3fd3632a8ef48171bd25282990221d49535d75356192f068b3b2ebe08f2aedd4