nemo-curator

Curate multimodal training corpora with deduplication, filtering, and PII redaction.

Updated Aug 27, 2026
One-click install
npx skills add https://github.com/big4council-prog/b4c-agent --skill nemo-curator-big4council-prog
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/big4council-prog/b4c-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/big4council-prog/b4c-agent --skill nemo-curator-big4council-prog

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Curating noisy, duplicate, and unsafe web-scale data into high-quality multimodal training datasets is slow and error-prone, which can degrade LLM performance.

Core Features & Use Cases

  • GPU-Accelerated Multimodal Curation: Clean and filter text plus images, video, and audio using NVIDIA/NeMo Curator-style pipelines.
  • Fuzzy & Semantic Deduplication: Remove exact, near-duplicate, and semantically similar samples using GPU-accelerated approaches (fuzzy MinHash/LSH and embedding-based methods).
  • Safety and Quality Controls: Apply PII redaction and NSFW detection alongside 30+ heuristic quality filters to reduce harmful or identifying content.
  • Use Case: Clean and deduplicate a Common Crawl-derived dataset before fine-tuning or pretraining, producing a curated Parquet/JSONL corpus ready for training.

Quick Start

Use nemo-curator to curate your input Parquet/JSONL dataset by running quality filtering, deduplicating, and then exporting the cleaned corpus to Parquet for LLM training.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate and clean a Common Crawl dataset for LLM training?▼

To clean a Common Crawl dataset for LLM training, you apply GPU-accelerated fuzzy MinHash/LSH and semantic deduplication alongside heuristic quality filters. This removes near-duplicates and low-quality text, outputting a curated Parquet/JSONL corpus ready for fine-tuning.

What is GPU-accelerated dataset curation and when do I need it for multimodal data?▼

GPU-accelerated dataset curation uses RAPIDS, cuDF, and Dask to process large multimodal corpora at scale. You need it when cleaning web-scale text, images, video, or audio data where CPU-based processing becomes a bottleneck for deduplication and filtering.

Do I need RAPIDS and cuDF support to run fuzzy and semantic deduplication pipelines?▼

Yes, GPU acceleration with RAPIDS, cuDF, and Dask support is required to run the fuzzy and semantic deduplication pipelines. These frameworks provide the necessary parallel processing power to handle exact, near-duplicate, and embedding-based deduplication at scale.

How do I redact PII and filter NSFW content from web-scraped training corpora?▼

You redact PII and filter NSFW content by applying built-in safety controls during the curation pipeline. The system automatically detects and redacts sensitive identifying information while removing disallowed NSFW data using 30+ heuristic quality filters.

Can I use this approach to curate image and video datasets alongside text?▼

Yes, you can curate multimodal datasets containing images, video, and audio alongside text. The pipeline applies the same GPU-accelerated deduplication, quality filtering, and safety controls to clean assets and produce a unified training corpus.

What's the best way to remove semantically similar samples from large pretraining datasets?▼

The best way to remove semantically similar samples is using GPU-accelerated embedding-based deduplication methods. This approach identifies and filters semantic duplicates alongside exact and fuzzy matches, ensuring high-quality and diverse data for pretraining.