@konwookim
for data-constrained pre-training, synth data isnโt just benchmaxxing, it lowers loss on the real data distribution as we generate more tokens for even better scaling, treat synth gens as forming one long ๐บ๐ฒ๐ด๐ฎ๐ฑ๐ผ๐ฐ: 1.8x data efficiency with larger gains under more compute https://t.co/d2BuB2vT4K