nemo-curator

Filter, deduplicate, and redact PII from large multimodal datasets.

Updated Apr 12, 2026
One-click install
npx skills add https://github.com/DaddyElonMusk69/motis-agent --skill nemo-curator-daddyelonmusk69
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/DaddyElonMusk69/motis-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/DaddyElonMusk69/motis-agent --skill nemo-curator-daddyelonmusk69

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

Large-scale training data is noisy, duplicated, and costly to curate, slowing model development. Nemo Curator provides GPU-accelerated data curation to accelerate quality filtering, deduplication, and multimodal data preparation.

Core Features & Use Cases

  • Quality filtering: 30+ heuristics and classifiers to improve data quality.
  • Deduplication: exact, fuzzy, and semantic deduplication across multimodal data.
  • PII redaction & privacy: automated redaction of sensitive information.
  • Use Case: Prepare RedPajama-like training corpora or curated common crawl datasets for safer model training.

Quick Start

Run Nemo Curator on your dataset to produce a clean, deduplicated, and redacted training corpus.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large multimodal datasets for LLM training?▼

Deduplicate large multimodal datasets for LLM training using GPU-accelerated exact, fuzzy, and semantic matching. This eliminates duplicate records across text, image, video, and audio pipelines to produce a clean training corpus.

What is GPU-accelerated data curation and how does it work for LLM training?▼

GPU-accelerated data curation is the process of using parallel processing to filter noisy, low-quality data. It applies stage-based quality heuristics and classifiers to accelerate reliable multimodal model training at scale.

Can I automate PII redaction on training corpora before model training?▼

Automate PII redaction on training corpora to remove sensitive information before model training. This privacy feature safely processes large text datasets, including RedPajama-like corpora, ensuring compliant data preparation.

Does GPU-accelerated data curation require RAPIDS and Dask to process large datasets?▼

GPU-accelerated data curation requires RAPIDS, cuDF, and Dask to process large datasets. These dependencies enable distributed GPU processing, ensuring cross-modal compatibility and scalable data preparation.

What is the best way to filter low-quality text from common crawl datasets?▼

Filter low-quality text from common crawl datasets by applying over 30 quality heuristics and classifiers. This stage-based quality filtering eliminates noisy data, accelerating reliable model training and reproducible curation.

Why is data curation necessary for multimodal LLM pipelines?▼

Data curation is necessary for multimodal LLM pipelines because large-scale training data is noisy, duplicated, and costly. Curation eliminates low-quality data across text, image, video, and audio formats to accelerate model development.