LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure
Modern language models are trained on heterogeneous web-scale text corpora. Consequently, studying knowledge and skill acquisition is difficult, as prior exposure to related content is hard to characterize. To address this challenge, we introduce LITTLECURRICULUM, a curated 88B-token pretraining corpus tailored to U.S. elementary school material, explicitly excluding concepts, facts, and vocabulary taught above Grade 5. Training a 5B-parameter LLM from scratch on LITTLECURRICULUM yields LITTLELEARNER, a model with sufficient language competence for open-ended evaluation, yet with clear knowled
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- LinkedLinked via arxiv author · 85%Fanfei Li →
“LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure”
- LinkedLinked via arxiv author · 85%Jana Zeller →
“LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure”
- LinkedLinked via arxiv author · 85%Manuel Prada-Corral →
“LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure”
- LinkedLinked via arxiv author · 85%Thaddäus Wiedemer →
“LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure”
- LinkedLinked via arxiv author · 85%Prasanna Mayilvahanan →
“LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure”
- LinkedLinked via arxiv author · 85%Ryan Cotterell →
“LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure”
- LinkedLinked via arxiv author · 85%Wieland Brendel →
“LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure”
- PossiblePossibly related (embedding) · 48%Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions - Apple Machine Learning Research →
