eval-harness

Define, execute, and track evals for Claude Code sessions.

Updated Aug 27, 2026
One-click install
npx skills add https://github.com/dennisccy/finovae_strategy_platform --skill eval-harness-dennisccy
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: eval-harness
Source: https://github.com/dennisccy/finovae_strategy_platform/tree/main/.claude/skills/eval-harness
Command: npx skills add https://github.com/dennisccy/finovae_strategy_platform --skill eval-harness-dennisccy

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Formal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles.

Core Features & Use Cases

  • Eval-driven development: define pass/fail criteria before coding and continuously validate agent behavior.
  • Regression and capability evals: support for pass@k metrics, baselines, regression tests, and standardized evaluation workflows.
  • Workflow tooling: storage and organization of eval definitions, runs, baselines, and reports under .claude/evals for reproducibility.

Quick Start

Define eval criteria, implement changes, then run eval checks to generate a report.

Frequently Asked Questions about eval-harness

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I set up regression evals for Claude Code sessions?▼

Regression evals for Claude Code sessions are configured by defining pass/fail criteria and storing definitions in .claude/evals. This framework continuously validates agent behavior and generates reproducible baseline reports.

What is eval-driven development for AI coding agents?▼

Eval-driven development defines pass/fail criteria before coding to continuously validate AI agent behavior. It ensures reliability across model versions by supporting capability evals, regression tests, and pass@k metrics.

Can I use model-based graders to evaluate Claude Code tasks?▼

Yes, evaluating Claude Code tasks supports multiple grader types including model-based, code-based, and human evaluation. These graders integrate into a standardized workflow to verify task success metrics.

How do I track pass@k metrics for prompt engineering workflows?▼

Pass@k metrics are tracked by running standardized evaluation workflows stored under .claude/evals. The framework computes these metrics against baselines to measure prompt engineering improvements and regression.

Does this evaluation framework support automated grading for model development?▼

Yes, the framework supports automated grading for model development through code-based and model-based graders. It applies standardized evaluation workflows to ensure reliability across different features and model versions.

When do I need a formal evaluation framework for Claude Code?▼

A formal evaluation framework is needed when ensuring reliability across model versions, prompt engineering changes, or regression testing. It provides standardized workflows for defining, executing, and tracking capability and regression evals.