eval-harness

Evaluate Claude Code sessions with capability and regression evals.

Updated Mar 31, 2026
One-click install
npx skills add https://github.com/BuildSmarterAI/claude-skills --skill eval-harness-buildsmarterai
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: eval-harness
Source: https://github.com/BuildSmarterAI/claude-skills/tree/main/eval-harness
Command: npx skills add https://github.com/BuildSmarterAI/claude-skills --skill eval-harness-buildsmarterai

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Formal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles.

Core Features & Use Cases

  • Evals: capability and regression definitions to capture expected behavior and regression checks.
  • Graders: code-based, model-based, and human graders for diverse evaluation tasks.
  • Metrics: pass@k and pass^k tracking to quantify reliability and regressions.
  • Artifacts: store eval definitions, baselines, and run histories for traceability.

Quick Start

Run the evaluation workflow to establish defect-detection metrics and generate a reproducible report.

Frequently Asked Questions about eval-harness

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
What is eval-driven development for Claude Code sessions?▼

Eval-driven development systematically evaluates Claude Code sessions by defining capability and regression checks, applying graders, and tracking metrics like pass@k to quantify reliability and detect regressions.

How do I set up regression evals for Claude Code?▼

Set up regression evals by defining expected behavior checks, configuring code-based or model-based graders, and storing eval definitions and baselines as artifacts to capture run histories for traceability.

Can I use model-based graders with pass@k scoring for session evaluations?▼

Yes, the framework supports code-based, model-based, and human graders alongside pass@k and pass^k metrics to quantify both the reliability of capability evaluations and the presence of regressions.

What's the best way to track Claude Code session regressions over time?▼

Track regressions by storing eval definitions, baselines, and run histories as artifacts, using pass^k metrics to monitor reliability across capability and regression eval runs for reproducible reporting.

Do I need external dependencies to run Claude Code capability evaluations?▼

No external dependencies are required to run capability evaluations; the framework specifies requirements for eval definitions, graders, metrics, and artifacts directly within Claude Code sessions.

When should I not use a formal evaluation framework for Claude Code?▼

A formal evaluation framework is unnecessary for simple, one-off Claude Code tasks where systematic defect-detection, regression tracking, and reproducible reporting are not required.