nemo-curator

Curate LLM training data with GPU-accelerated deduplication and quality filtering.

150|25|Updated Apr 20, 2026
One-click install
npx skills add https://github.com/Devsoul2026/Hermes-One-Click --skill nemo-curator-devsoul2026
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/Devsoul2026/Hermes-One-Click/tree/main/hermes-agent/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/Devsoul2026/Hermes-One-Click --skill nemo-curator-devsoul2026

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes references (resource) components.

What problem does it solve?

This Skill accelerates the creation of high-quality training data for large language models by providing GPU-accelerated data curation workflows that combine deduplication, quality filtering, and multi-modal support.

Core Features & Use Cases

  • GPU-accelerated deduplication: exact, fuzzy, and semantic deduplication across large corpora.
  • Quality filtering: 30+ heuristics to improve data quality and usefulness for model training.
  • PII redaction & NSFW detection: automatic privacy preservation and content safety checks.
  • Multi-modal curation: support for text, images, video, and audio data.
  • Scalable pipelines: end-to-end workflows designed to run efficiently on multi-GPU clusters.

Quick Start

Install Nemo Curator, configure a CUDA-enabled GPU cluster, and run the data-curation pipeline on your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large web-scraped corpora for LLM training?▼

GPU-accelerated data curation workflows support exact, fuzzy, and semantic deduplication across large web-scraped corpora, running efficiently on multi-GPU clusters to remove redundant text for LLM training.

What is GPU-accelerated data curation and when do I need it?▼

GPU-accelerated data curation uses CUDA-enabled GPUs to process large-scale LLM training data. You need it when curating massive web-scraped or multi-modal datasets requiring deduplication, quality filtering, and PII redaction at scale.

Do I need CUDA-enabled GPUs to run multimodal data curation pipelines?▼

Yes, CUDA-enabled GPUs are required to run these GPU-accelerated data curation pipelines. The workflow depends on RAPIDS, cuDF, and Dask to scale deduplication and quality filtering across multi-modal datasets like text, images, video, and audio.

Can I automatically redact PII and detect NSFW content in training datasets?▼

Yes, you can automatically redact PII and detect NSFW content in training datasets. The curation workflow includes built-in privacy preservation and content safety checks alongside its 30+ quality filtering heuristics.

What's the best way to filter low-quality text from scraped datasets?▼

The best way to filter low-quality text from scraped datasets is using GPU-accelerated curation pipelines with 30+ quality heuristics. This improves data usefulness for model training while running efficiently on multi-GPU clusters.

Does Nemo Curator work with Dask and RAPIDS for distributed data processing?▼

Yes, Nemo Curator works with Dask and RAPIDS for distributed data processing. It leverages these dependencies alongside cuDF to enable scalable, GPU-accelerated curation workflows across multi-GPU clusters for large corpora.