nemo-curator

Automate GPU-accelerated deduplication, quality filtering, and PII redaction for large training corpora.

Updated Apr 19, 2026
One-click install
npx skills add https://github.com/gqf2008/hermez-ai --skill nemo-curator-gqf2008
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: nemo-curator
Source: https://github.com/gqf2008/hermez-ai/tree/main/skills/mlops/nemo-curator
Command: npx skills add https://github.com/gqf2008/hermez-ai --skill nemo-curator-gqf2008

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

GPU-accelerated data curation for large multimodal training corpora, enabling fast, scalable cleaning, deduplication, redaction, and quality filtering for high-quality datasets.

Core Features & Use Cases

  • GPU-accelerated deduplication and quality filtering across text, image, video, and audio data
  • PII redaction and content quality controls to meet data governance needs
  • Scales across GPU clusters to prepare training data from web scrapes, open datasets, or large corpora for LLM training

Quick Start

Run a basic Nemo Curator pipeline to clean, deduplicate, and redact PII from your dataset.

Frequently Asked Questions about nemo-curator

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I accelerate data curation and deduplication for large multimodal LLM training corpora?▼

GPU-accelerated data curation automates the cleaning, deduplication, and quality filtering of large multimodal training corpora using RAPIDS for multi-GPU scaling. It enables fast, scalable preparation of web-scraped text, image, video, and audio data for high-quality LLM training.

Can I use GPU acceleration for PII redaction and quality filtering on web-scraped datasets?▼

Yes, GPU acceleration supports PII redaction and content quality controls across web-scraped datasets. The pipeline applies 30+ quality filters to meet data governance needs while scaling across GPU clusters to prepare large-scale training data efficiently.

What is the best way to perform semantic and fuzzy deduplication for LLM training data?▼

The best way to perform semantic and fuzzy deduplication for LLM training data is using a GPU-accelerated pipeline that supports exact, fuzzy, and semantic matching. This approach scales across multi-GPU clusters to efficiently remove duplicates from large corpora.

Does this data curation pipeline support stage-based workflows for multimodal collections?▼

Yes, the data curation pipeline supports stage-based workflows for multimodal collections including text, image, video, and audio data. It integrates 30+ quality filters, multi-level deduplication, and PII redaction within scalable, multi-GPU stage-based processing.

Why use GPU-accelerated RAPIDS for large-scale training data pipelines?▼

GPU-accelerated RAPIDS is used for large-scale training data pipelines to achieve fast, scalable data cleaning, deduplication, and quality filtering. It leverages multi-GPU clusters to process massive web-scraped datasets and multimodal collections efficiently for LLM training.

What are the limitations of CPU-based data curation for multimodal training corpora?▼

CPU-based data curation for multimodal training corpora faces significant scaling limitations compared to GPU-acceleration. Processing large-scale web scrapes with 30+ quality filters, semantic deduplication, and PII redaction requires multi-GPU scaling to maintain throughput and efficiency.