nemo-curator

Automate GPU-accelerated data curation for LLM training with RAPIDS.

1|1|Updated May 9, 2026
One-click install
npx skills add https://github.com/ldzhhxx/Hermes_offline_v2 --skill nemo-curator-ldzhhxx
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/ldzhhxx/Hermes_offline_v2/tree/main/hermes-agent/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/ldzhhxx/Hermes_offline_v2 --skill nemo-curator-ldzhhxx

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires nemo-curator, cudf, dask, rapids, and includes scripts (resource) and references (resource) and assets (resource) components.

What problem does it solve?

This Skill automates the process of preparing high-quality training datasets for LLMs by providing advanced data curation tools for text, image, video, and audio data, ensuring faster and higher-quality dataset preparation.

Core Features & Use Cases

  • Multi-modal Data Curation: Supports text, images, video, and audio, allowing users to clean and prepare complex datasets.
  • Fuzzy Deduplication: Removes near-duplicate content up to 16 times faster than CPU-based methods.
  • Quality Filtering: Applies more than 30 heuristic filters to remove low-quality content.
  • Semantic Deduplication: Uses embeddings to find semantically similar documents and remove them.
  • PII Redaction: Identifies and redacts personally identifiable information to ensure privacy.
  • NSFW Detection: Filters out non-safe-for-work content to maintain standards.
  • Use Cases: Suitable for web scraping, cleaning datasets, deduplicating large corpora, and preparing datasets for LLM training.

Quick Start

Install nemo-curator and run the command 'nemo-curator text-curate "input-data.csv" -o "output-data.csv" --min-words 50 --max-words 50000' to filter and deduplicate text data.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate fuzzy deduplication for large text datasets?▼

GPU-accelerated fuzzy deduplication removes near-duplicate content up to 16 times faster than CPU-based methods by utilizing RAPIDS and CUDA compatible libraries.

What is the best way to redact PII and filter NSFW content during LLM data curation?▼

Data curation for LLM training includes built-in PII redaction to ensure privacy and NSFW detection to filter out non-safe-for-work content automatically.

How do I perform semantic deduplication on a training corpus?▼

Semantic deduplication finds semantically similar documents using embeddings and removes them, ensuring higher-quality dataset preparation for LLMs.

Does GPU-accelerated data curation work with multi-modal data like images and video?▼

Multi-modal data curation supports text, images, video, and audio, allowing users to clean and prepare complex datasets across GPU clusters.

Do I need CUDA and RAPIDS installed to run data curation scripts?▼

Yes, scaling data curation across GPU clusters requires CUDA and compatible libraries like RAPIDS, cudf, and dask to execute the acceleration.

How do I apply quality filtering to remove low-quality content from web scraping data?▼

Quality filtering applies more than 30 heuristic filters to remove low-quality content from web scraping data or large corpora efficiently.