OSCAR (Open Super-large Crawled ALMAnaCH coRpus)
OSCAR (Open Super-large Crawled ALMAnaCH coRpus) is a multilingual corpus derived from a web crawl, used primarily for natural language processing and machine learning research. It provides large-scale textual data across multiple languages, aiming to support language model training and linguistic studies.