eval-harness

Define and run eval-driven development tests for Claude Code sessions.

3|Updated Sep 20, 2021
One-click install
npx skills add https://github.com/jinyuanlu/dotfiles --skill eval-harness-jinyuanlu
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: eval-harness
Source: https://github.com/jinyuanlu/dotfiles/tree/main/.claude/skills/eval-harness
Command: npx skills add https://github.com/jinyuanlu/dotfiles --skill eval-harness-jinyuanlu

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Formal framework to define, implement, and evaluate eval-driven development tests for Claude Code sessions, enabling reproducible pass/fail criteria and regression checks.

Core Features & Use Cases

  • Capability and regression eval definitions
  • Deterministic (Code-based) and model-based graders
  • Eval storage and baselines for regression tests
  • Support for phased workflows (define, implement, evaluate, report)

Quick Start

Define an eval with a feature name, then run checks and generate a report.

Frequently Asked Questions about eval-harness

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I set up regression testing for AI model capability changes?▼

AI regression testing requires defining capability and regression evals with structured pass/fail criteria. You can define an eval with a feature name, run checks across model versions and prompts, and generate evaluation reports to detect regressions.

What is eval-driven development and how does it apply to AI testing?▼

Eval-driven development is a formal framework to define, implement, and evaluate tests for AI sessions. It applies to building capability and regression evals by enforcing a structured workflow with phases: define, implement, evaluate, and report.

Can I use both deterministic and model-based graders for AI evals?▼

Yes, AI evals support both deterministic code-based graders and model-based graders. You can apply these grader types within the evaluate phase to assess outputs against defined pass/fail criteria and baselines.

How do I evaluate AI prompts across different model versions?▼

Evaluating prompts across model versions involves storing baselines and running regression checks. The framework supports generating evaluation reports across model versions and prompts, applying deterministic or model-based graders to compare results against stored baselines.

Do I need any external dependencies to run eval-driven development tests?▼

No external dependencies are required to run eval-driven development tests. The framework operates independently to define, implement, evaluate, and report on AI capability and regression evals within your project eval store.