What problem does it solve? Preparing high-quality training data from massive web scrapes like Common Crawl requires deduplication, quality filtering, and PII removal that is prohibitively slow on CPUs. This Skill uses NVIDIA NeMo Curator to run these pipelines on GPUs, cutting fuzzy deduplication of 8TB datasets from 120 hours to 7.5 hours. ## Core Features & Use Cases - Deduplication at Scale: Exact, fuzzy (MinHash + LSH), and semantic deduplication running up to 16× faster on GPUs via RAPIDS and Dask. - Quality & Safety Filtering: 30+ heuristic filters plus classifier-based quality scoring, NSFW detection, language identification, and PII redaction. - Multimodal Curation: Text, image (aesthetic/NSFW/CLIP), video (scene detection, embeddings), and audio (ASR, WER filtering) pipelines. - Use Case: Curate a Common Crawl dump by chaining word-count filters, language detection, fuzzy deduplication, and PII redaction across an 8-GPU cluster, then export clean Parquet files for LLM pretraining. ## Quick Start Use the nemo-curator skill to deduplicate and quality-filter my Common Crawl parquet dataset across multiple GPUs.