Grokking: When a Model Suddenly Learns Long After It Appears Done
A small neural network trained on modular addition memorized answers early, then—after many more training steps—abruptly acquired a general, human-like method. That late emergence, called grokking, exposes how training curves can hide deep internal change and raises practical questions for model development.



