nemo-curator

Clean and curate multi-modal LLM training data with GPU-accelerated filtering and deduplication.

Updated Aug 23, 2026
One-click install
npx skills add https://github.com/t2ance/dr-claw-plugin --skill nemo-curator-t2ance
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/t2ance/dr-claw-plugin/tree/main/plugins/ml-training-stack/skills/data-processing/nemo-curator
Command: npx skills add https://github.com/t2ance/dr-claw-plugin --skill nemo-curator-t2ance

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Curating high-quality training data for LLMs is resource-intensive and error-prone; Nemo Curator provides GPU-accelerated tools to filter, deduplicate, redact PII, and manage multi-modal datasets at scale.

Core Features & Use Cases

  • Quality filtering with 30+ heuristics to remove low-quality data
  • Exact, fuzzy, and semantic deduplication across large corpora
  • PII redaction and NSFW detection to protect privacy and safety
  • Multimodal support for text, image, video, and audio data
  • Use cases include preparing RedPajama-like datasets, cleaning Common Crawl, and building high-signal training corpora

Quick Start

Install Nemo Curator and run a complete curation workflow on your dataset path to generate a clean, deduplicated dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I clean and deduplicate large-scale text corpora for LLM training?▼

You can clean and deduplicate large-scale text corpora for LLM training by applying GPU-accelerated quality filtering, exact and fuzzy deduplication, and PII redaction to remove low-quality and duplicate content.

What is semantic deduplication and how does it work for multimodal datasets?▼

Semantic deduplication removes contextually similar data points across multimodal datasets. It works alongside exact and fuzzy matching to filter text, image, video, and audio corpora for high-signal LLM training.

Do I need CUDA-enabled GPUs to run GPU-accelerated data curation?▼

Yes, GPU-accelerated data curation requires CUDA-enabled GPUs. The processing leverages RAPIDS to perform high-speed quality filtering and deduplication on large multimodal datasets.

Can I use Parquet and JSONL input formats for quality filtering?▼

Yes, you can use Parquet and JSONL input formats for quality filtering. The system applies over 30 heuristics to redact PII, detect NSFW content, and remove low-quality data from these formats.

What is the best way to remove PII and NSFW content from Common Crawl data?▼

The best way to remove PII and NSFW content from Common Crawl data is to apply automated quality filtering and redaction heuristics. This ensures privacy and safety while building high-signal training corpora.