Slide 25c — FineWeb-Edu & le message de Karpathy
Durée : 2 min
Contenu :
- FineWeb-Edu : Llama-3-70B note 500 000 pages (0–5, valeur éducative) → petit classifieur → appliqué aux 15T tokens (~6 000 h de H100)
- Seuil ≥ 3 → 1 300 Mds de tokens « très éducatifs » → meilleurs scores MMLU / ARC / OpenBookQA
- La technique (secrète) de Llama 3 et Phi-3 : une IA filtre les données de la suivante
- Karpathy : un LLM = une compression avec perte d'Internet → la qualité du dataset EST le plafond du modèle
Visuel : boucle stylisée « IA → filtre → données → IA suivante » ; en bas, citation en grand : « garbage in, garbage out — à l'échelle du web ».
Notes orateur : Faire le pont avec le quotidien des participants : leurs futurs projets RAG/fine-tuning obéissent à la même loi. Si le temps le permet : mentionner la hausse du texte généré par IA dans les crawls récents (proxy : fréquence de « delve », « rich tapestry » —
auto-contamination du web, sujet ouvert). Sources : Karpathy, Deep Dive into LLMs like ChatGPT (2025) ; Penedo et al., FineWeb (NeurIPS 2024).