sop-rca

Diagnose SOP monitoring pipeline failures and produce evidence-driven root cause analysis reports.

49|14|Updated Aug 27, 2025
One-click install
npx skills add https://github.com/NVIDIA/sop-monitoring-blueprints --skill sop-rca
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: sop-rca
Source: https://github.com/NVIDIA/sop-monitoring-blueprints/tree/main/agentic/sop-agentic-ft/plugins/sop-rca-plugin/skills/sop-rca
Command: npx skills add https://github.com/NVIDIA/sop-monitoring-blueprints --skill sop-rca

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

This Skill diagnoses failures across SOP monitoring evaluation, temporal segmentation, vision-language inference, training data, and fine-tuning configurations, replacing ad hoc debugging with an evidence-driven root cause analysis.

Core Features & Use Cases

  • End-to-End Failure Analysis: Correlates evaluation metrics, per-video errors, raw VLM outputs, DDM boundaries, and by-action confusion results.
  • Training Pipeline Diagnostics: Examines augmentation coverage, data distributions, learning rates, convergence, LoRA capacity, and DDM training settings to distinguish capability gaps from coverage gaps.
  • Actionable Recommendations: Evaluates evaluation-parameter tuning, augmentation changes, training-config changes, DDM improvements, and code or manual interventions, then produces a structured RCA report and machine-readable handoff.
  • Use Case: When an SOP monitoring run has low sequence accuracy, use this Skill to determine whether missed actions originate from DDM under-segmentation, VLM confusion, model collapse, insufficient training coverage, or evaluation mismatches.

Quick Start

Provide the required evaluation logs, actions definition, augmentation and fine-tuning configurations, and training logs, then ask the SOP RCA skill to generate an evidence-driven root cause analysis report.

Frequently Asked Questions about sop-rca

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I diagnose root causes for low sequence accuracy in SOP monitoring pipelines?▼

Root cause analysis for SOP monitoring pipelines correlates evaluation metrics, per-video errors, DDM boundaries, and VLM outputs to identify whether failures stem from under-segmentation, model confusion, or training gaps, producing a structured RCA report with prioritized fixes.

Why does my vision-language model confuse actions during SOP evaluation?▼

Vision-language model action confusion during SOP evaluation is diagnosed by analyzing by-action confusion results and raw VLM outputs alongside training data distributions, distinguishing capability gaps from insufficient augmentation coverage or fine-tuning configuration errors.

How do I investigate DDM temporal segmentation failures in my SOP pipeline?▼

DDM temporal segmentation failures are investigated by examining DDM training settings, boundary outputs, and evaluation artifacts to determine if missed actions originate from under-segmentation, evaluation-parameter mismatches, or model convergence issues.

Can I use SOP root cause analysis to check if my fine-tuning configuration caused evaluation failures?▼

Yes, SOP root cause analysis examines fine-tuning configurations, learning rates, LoRA capacity, and training logs to distinguish capability gaps from coverage gaps, determining if evaluation failures require training-config changes or data augmentation adjustments.

What evaluation artifacts do I need to perform SOP pipeline failure analysis?▼

SOP pipeline failure analysis requires evaluation logs, actions.json definitions, augmentation and fine-tuning configurations, training logs or reports, and helper-script analysis outputs to classify root causes and generate evidence-driven corrective recommendations.

What's the best way to fix SOP monitoring failures without ad hoc debugging?▼

Fixing SOP monitoring failures without ad hoc debugging requires evidence-driven root cause analysis that correlates evaluation metrics, DDM boundaries, VLM outputs, and training data, then recommends prioritized corrective actions including parameter tuning, augmentation changes, or code interventions.