Loading...
← 技术进步文献

人工智能与计算 · 2022-03

Training Compute-Optimal Large Language Models (Chinchilla)PDF Download

Hoffmann et al. (DeepMind)

Chinchilla 在固定計算預算下重新考察參數量與訓練數據的配比,認爲不少大模型使用的訓練詞元太少。

和《Scaling Laws》一起讀,能看見一個有影響力的配方如何被重新修正。判斷模型時,除了參數量,也該問計算預算具體花在了哪裏。

5.7 MB · SHA-256: 3fd3632a8ef48171bd25282990221d49535d75356192f068b3b2ebe08f2aedd4