Unified live eval toolkit for coding-agent CLIs.
cli-evals runs the same scenario suite across Claude Code, OpenAI Codex,
opencode, and GitHub Copilot by driving real interactive CLIs through
@agent-ix/agent-pty.
pnpm add -D @agent-ix/cli-agent-evalsOr install globally:
npm install -g @agent-ix/cli-agent-evalsPrerequisites for live runs:
tmux>= 3.0claude,codex,opencode, or Copilot/ghonPATH- authenticated local agent sessions for the agents you run
Check local readiness:
cli-evals doctorCreate cli-agent-evals.config.mjs:
import { defineSuite } from "@agent-ix/cli-agent-evals";
export default defineSuite({
name: "my-cli",
rootDir: import.meta.dirname,
scenarios: [
{
id: "EV-001",
canary: true,
prompt:
"Use my CLI to complete the happy path, then print the success sentinel.",
},
],
});Run canaries:
cli-evals run --suite ./cli-agent-evals.config.mjs --canary --agent claude --model sonnetRun one scenario and keep the workdir:
cli-evals run --suite ./cli-agent-evals.config.mjs --filter EV-001 --agent codex --model gpt-5 --keepPrint a previous report:
cli-evals rebuild --report evals/reports/latest.jsonClaude Code:
claude plugin marketplace add agent-ix/cli-agent-evals
claude plugin install cli-agent-evalsCodex:
codex plugin marketplace add agent-ix/cli-agent-evals
codex plugin add cli-agent-evalsopencode:
gh skill install agent-ix/cli-agent-evals --all --scope user --agent opencodeGitHub Copilot:
gh skill install agent-ix/cli-agent-evals --all --scope user --agent github-copilotInstalled skills:
cli-evals: run, inspect, and debug suites.cli-evals-author: draft scenarios, fixtures, assertions, and classifiers.