人工智能与计算 · 2022-03
Training Compute-Optimal Large Language Models (Chinchilla)PDF Download
Hoffmann et al. (DeepMind)
Chinchilla 在固定计算预算下重新考察参数量与训练数据的配比,认为不少大模型使用的训练词元太少。
和《Scaling Laws》一起读,能看见一个有影响力的配方如何被重新修正。判断模型时,除了参数量,也该问计算预算具体花在了哪里。
5.7 MB · SHA-256: 3fd3632a8ef48171bd25282990221d49535d75356192f068b3b2ebe08f2aedd4