nemo-curator

Curate and deduplicate multimodal training corpora with NVIDIA NeMo Curator on GPU clusters.

Updated Apr 9, 2026
One-click install
npx skills add https://github.com/MarbleSodas/Mavis --skill nemo-curator-marblesodas
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/MarbleSodas/Mavis/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/MarbleSodas/Mavis --skill nemo-curator-marblesodas

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

NeMo Curator helps you prepare high-quality LLM training datasets by removing low-quality, duplicate, unsafe, and sensitive content before model training.

Core Features & Use Cases

  • GPU-accelerated curation pipeline: quality filtering, deduplication, PII redaction, and NSFW detection across large corpora.
  • Fuzzy and semantic deduplication: near-duplicate removal using MinHash/LSH and embedding-based similarity to improve dataset diversity.
  • Multimodal support: handle text, images, video, and audio with modality-specific filters and classifiers (including ASR + WER filtering for audio).
  • Use case: curate 10B-scale web-crawl or scraped datasets (e.g., Common Crawl) into cleaner, deduplicated Parquet shards ready for training.

Quick Start

Ask NeMo Curator to run a GPU pipeline that filters low-quality docs, applies fuzzy and semantic deduplication, and outputs a cleaned Parquet dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate Common Crawl data for LLM training?▼

Deduplicating Common Crawl data for LLM training involves running a GPU-accelerated curation pipeline that applies quality heuristics, fuzzy MinHash/LSH matching, and semantic embedding similarity to output cleaned Parquet shards.

Can I use GPU acceleration for PII redaction on web-scale datasets?▼

Yes, you can use GPU acceleration for PII redaction on web-scale datasets via distributed multi-GPU execution with RAPIDS components, which processes sensitive content removal efficiently before model training.

What is fuzzy and semantic deduplication in multimodal data curation?▼

Fuzzy and semantic deduplication in multimodal data curation is the process of removing near-duplicate documents using MinHash/LSH algorithms and embedding-based similarity to improve dataset diversity across text, image, video, and audio modalities.

Does multimodal data curation support audio and video filtering?▼

Multimodal data curation supports audio and video filtering through modality-specific filters and classifiers, including ASR and WER filtering for audio, to ensure high-quality training corpora across all media types.

Do I need NVIDIA RAPIDS components to run distributed multi-GPU deduplication?▼

Yes, you need NVIDIA RAPIDS components to run distributed multi-GPU deduplication, as the curation pipeline requires GPU-capable RAPIDS libraries to execute fuzzy and semantic deduplication at web scale.

What are the limitations of NSFW detection in large corpus cleaning?▼

The metadata does not specify exact limitations of NSFW detection in large corpus cleaning, but it confirms the pipeline removes NSFW content alongside low-quality, duplicate, and PII data during web-scale dataset preparation.