nemo-curator

Deduplicate and filter large-scale LLM training data with GPU-optimized pipelines.

1|Updated May 12, 2026
One-click install
npx skills add https://github.com/projectedanx/hermes-agent --skill nemo-curator-projectedanx
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/projectedanx/hermes-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/projectedanx/hermes-agent --skill nemo-curator-projectedanx

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

This skill addresses the bottleneck of preparing massive, high-quality datasets for LLM training by leveraging GPU acceleration to perform deduplication, filtering, and cleaning tasks significantly faster than traditional CPU-based methods.

Core Features & Use Cases

  • High-Speed Deduplication: Perform exact, fuzzy, and semantic deduplication on multi-terabyte datasets with up to 16x speed improvements.
  • Advanced Quality Filtering: Apply over 30 heuristic filters, including PII redaction, NSFW detection, and language identification, to ensure training data integrity.
  • Use Case: Use this skill to process raw web scrapes like Common Crawl, removing low-quality content and duplicates to prepare a clean, high-performance dataset for training a large language model.

Quick Start

Use the nemo-curator skill to perform fuzzy deduplication on the dataset located in the input directory using the default MinHash parameters.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate deduplication and data curation for LLM training on large datasets?▼

GPU-accelerated data curation for LLM training uses RAPIDS and Dask to perform high-speed deduplication and quality filtering, achieving up to 16x speed improvements on multi-terabyte datasets compared to traditional CPU-based methods.

What is the best way to clean raw web scrapes like Common Crawl for language model training?▼

Cleaning raw web scrapes for language model training involves applying heuristic filters for PII redaction and NSFW detection, alongside exact, fuzzy, and semantic deduplication to remove low-quality content and prepare high-performance datasets.

Does GPU-accelerated data processing support multimodal datasets across distributed clusters?▼

GPU-accelerated data processing supports multimodal datasets across distributed GPU clusters, enabling high-throughput cleaning and semantic similarity analysis for text, image, video, and audio data formats.

Can I use Dask and RAPIDS for fuzzy deduplication on multi-terabyte text datasets?▼

You can use Dask and RAPIDS to perform fuzzy deduplication on multi-terabyte text datasets using default MinHash parameters, leveraging distributed GPU clusters to satisfy high-throughput data cleaning requirements.

What types of quality filtering are available for preparing LLM training data?▼

Quality filtering for preparing LLM training data includes over 30 heuristic filters, such as PII redaction, NSFW detection, and language identification, to ensure training data integrity and remove low-quality content.

When should I use GPU acceleration instead of CPU-based methods for data deduplication?▼

GPU acceleration should be used instead of CPU-based methods for data deduplication when processing massive datasets for LLM training, as it provides significantly faster high-throughput data preparation and semantic similarity analysis.