📢 Excited to finally be releasing my NeurIPS 2024 submission! Is Chinchilla universal? No! We find that: 1. language model scaling laws depend on data complexity 2. gzip effectively predicts scaling properties from training data As compressibility 📉, data preference 📈. 🧵⬇️
Post
Post
Rohan Pandey on X: "📢 Excited to finally be releasing my NeurIPS 2024 submission! Is Chinchilla universal? No! We find that: 1. language model scaling laws depend on data complexity 2. gzip effectively predicts scaling properties from training data As compressibility 📉, data preference 📈. 🧵⬇️"
Chinchilla claims their 1-to-1 parameter-data scaling law is agnostic to the type of textual training data used 🤨 But
@ArmenAgha@AIatMetafind code-gen scaling prefers parameters 😳
@deepseek_aiteam further noticed that scaling with cleaner data also prefers parameters 🤔
All the code to generate PCFG datasets, measure gzip-compressibility, and run the training jobs is available in our GitHub repo! Would appreciate if you drop a ⭐️ too 🫡 github.com/KhoomeiK/compl… And of course here's our Arxiv link: arxiv.org/abs/2405.16684

