Pretraining Data Pipelines

Web-scale corpus construction, filtering, deduplication, decontamination and data mixtures.

20concepts
140flashcards
152minutes of reading