ag-benchmark-qualidade

Orchestrate PDCA-based QAT benchmarks comparing AI outputs against baselines with dual-run and triple-scorer metrics.

19|4|Updated Mar 7, 2026
One-click install
npx skills add https://github.com/andregusman-raiz/a-gusman-claude --skill ag-benchmark-qualidade
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: ag-benchmark-qualidade
Source: https://github.com/andregusman-raiz/a-gusman-claude/tree/main/skills/ag-benchmark-qualidade
Command: npx skills add https://github.com/andregusman-raiz/a-gusman-claude --skill ag-benchmark-qualidade

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Automates end-to-end QA benchmarking for AI outputs by coordinating dual-run comparisons, multi-score aggregation, and PDCA-based improvement cycles.

Core Features & Use Cases

  • Dual-run comparison (app vs baseline) with triple scoring including L1/L2 rules and L3 judge jury.
  • Parity-focused metrics across 8 dimensions to quantify relative quality.
  • PDCA-based workflow to continuously update baselines, patterns, and learnings for ongoing improvement.

Quick Start

Provide a URL and optional scenario set to execute a full PDCA-based QAT benchmark against your AI app.

Frequently Asked Questions about ag-benchmark-qualidade

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I run an AI quality benchmark against my baseline outputs?▼

Run an AI quality benchmark by providing your app URL and optional scenario set to execute a dual-run comparison against baselines, aggregating scores and parity metrics for reporting.

What is dual-run comparison in AI quality testing?▼

Dual-run comparison in AI quality testing evaluates app outputs against baseline outputs using triple scoring with L1/L2 rules and an L3 judge jury to quantify relative quality.

How does the PDCA workflow apply to AI quality evaluation?▼

The PDCA workflow applies to AI quality evaluation by running continuous benchmark cycles, updating baselines and patterns, and surfacing actionable learnings for ongoing improvement.

Can I measure parity across multiple dimensions for my AI outputs?▼

Yes, you can measure parity-focused metrics across 8 dimensions to quantify the relative quality of your AI outputs against established baselines during benchmarking.

Do I need any external dependencies to execute a QAT benchmark?▼

No external dependencies are required to execute a QAT benchmark; you simply provide a URL and optional scenario set to initiate the end-to-end AI quality evaluation.

What is the best way to aggregate scores for AI quality benchmarks?▼

The best way to aggregate scores for AI quality benchmarks is using a triple-scorer approach with L1/L2 rules and an L3 judge jury to evaluate dual-run output parity.