nemo-curator

Accelerate LLM training data curation on GPU clusters with NeMo Curator.

Updated Aug 23, 2026
One-click install
npx skills add https://github.com/AlexKoncept/omnia-hub --skill nemo-curator-alexkoncept
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/AlexKoncept/omnia-hub/tree/main/HERMES/optional-skills/mlops/nemo-curator
Command: npx skills add https://github.com/AlexKoncept/omnia-hub --skill nemo-curator-alexkoncept

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for large multimodal datasets used in LLM training, enabling scalable, high-quality data preparation on GPU clusters.

Core Features & Use Cases

  • Fuzzy deduplication: up to 16× faster on GPU for near-duplicate removal across huge datasets.
  • Quality filtering: 30+ heuristics to clean, filter, and improve data quality for model training.
  • Semantic deduplication and PII redaction: reduce redundancy while protecting sensitive information.
  • NSFW detection and multi-modal support: handles text, image, video, and audio data at scale.
  • Use Cases: prepare training data from web scrapes, clean product datasets, and deduplicate large document collections.

Quick Start

Install NeMo Curator, configure a dataset, and run the data-curation pipeline to begin cleaning and deduplicating.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate data deduplication for large LLM training datasets?▼

Data curation on GPU clusters accelerates preparing high-quality LLM training data by applying 30+ quality filters and exact, fuzzy, and semantic deduplication, enabling scalable cleaning across text, image, video, and audio formats.

Does GPU-accelerated data cleaning support PII redaction and NSFW detection?▼

Yes, GPU-accelerated data cleaning supports PII redaction and NSFW detection to remove sensitive information and explicit content, ensuring multimodal training datasets remain secure and high-quality at scale.

Can I use multimodal data curation for text, image, video, and audio datasets?▼

Multimodal data curation handles text, image, video, and audio datasets by applying quality filtering and deduplication across GPU clusters, allowing you to prepare large-scale diverse training data for LLMs.

What is the best way to clean web scrape data for LLM training?▼

GPU-accelerated data curation is the best way to clean web scrape data for LLM training, applying 30+ quality heuristics and fuzzy deduplication at scale to filter and remove near-duplicates efficiently.

Do I need a GPU cluster to run multimodal data curation pipelines?▼

A GPU cluster is required to fully leverage RAPIDS-powered GPU acceleration for multimodal data curation, which enables high-speed fuzzy deduplication, quality filtering, and PII redaction across large-scale datasets.