nemo-curator

Automate GPU-accelerated data curation for LLM training corpora.

Updated May 2, 2026
One-click install
npx skills add https://github.com/AlvaroBiano/hermes-agent --skill nemo-curator-alvarobiano
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/AlvaroBiano/hermes-agent/tree/main/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/AlvaroBiano/hermes-agent --skill nemo-curator-alvarobiano

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for high-quality training datasets, enabling fast, scalable deduplication, quality filtering, and redaction across multi-modal data.

Core Features & Use Cases

  • GPU-accelerated data curation for LLM training with multi-modal support.
  • Deduplication (exact, fuzzy, semantic), quality filtering (30+ heuristics), PII redaction, and NSFW detection.
  • Use cases include cleaning web-scraped data and assembling robust training datasets for large language models.

Quick Start

Process your dataset by applying quality filters, deduplication, and redaction to produce a clean training set.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I deduplicate large web-scraped datasets for LLM training?▼

GPU-accelerated data curation automates dataset preparation for LLM training by applying deduplication, PII redaction, and NSFW filtering across multi-modal corpora like text, images, video, and audio.

How do I redact PII and filter NSFW content from training corpora?▼

To redact PII and filter NSFW content from training corpora, apply automated quality filters and redaction capabilities that detect and remove sensitive or explicit material across multi-modal data.

Do I need NVIDIA RAPIDS-enabled GPU infrastructure for multi-modal data curation?▼

Yes, multi-modal data curation with this method requires NVIDIA RAPIDS-enabled GPU infrastructure to scale across multiple GPUs and execute GPU-accelerated deduplication and filtering tasks.

What is the best way to apply quality filtering to text and image datasets?▼

The best way to apply quality filtering to text and image datasets is using GPU-accelerated curation pipelines that run 30+ heuristic quality filters to clean and refine multi-modal training data.

Can I scale semantic deduplication across multiple GPUs?▼

Yes, you can scale semantic deduplication across multiple GPUs using multi-GPU scaling support built into the NVIDIA RAPIDS-enabled infrastructure to process large training corpora efficiently.