Paper2020
Scaling Laws for Neural Language Models
Kaplan et al.
Shows language model loss follows smooth power laws in model size, dataset size, and compute across seven orders of magnitude, and that within a fixed compute budget it is better to train large models on comparatively modest data and stop before convergence.
30 pageslink checked 17 Sept 2026FreeAdvanced