哲学
評価駆動開発は評価を「AI開発のユニットテスト」として扱います: - 実装前に期待される動作を定義 - 開発中に継続的に評価を実行 - 変更ごとにリグレッションを追跡 - 信頼性測定にpass@kメトリクスを使用
affaan-m/ECC
Use it for engineering tasks; the detail page covers purpose, installation, and practical steps.
npx skills add https://github.com/affaan-m/ECC --skill "docs/ja-JP/skills/eval-harness"Source checked Jul 28, 2026·Refresh due Oct 26, 2026
Reorganized from the pinned upstream SKILL.md
Claude Codeセッションの正式な評価フレームワークで、評価駆動開発(EDD)の原則を実装します。
npx skills add https://github.com/affaan-m/ECC --skill "docs/ja-JP/skills/eval-harness"The pinned source supports a structured brief, but not an expanded tutorial. Only detected inputs, outputs, and sections are shown.
216 source words · 38 usable sections
Documentation workflow
Sections are extracted automatically from the pinned SKILL.md and link back to the source.
評価駆動開発は評価を「AI開発のユニットテスト」として扱います: - 実装前に期待される動作を定義 - 開発中に継続的に評価を実行 - 変更ごとにリグレッションを追跡 - 信頼性測定にpass@kメトリクスを使用
Claudeが以前できなかったことができるようになったかをテスト:
Claudeが以前できなかったことができるようになったかをテスト:
Review the “リグレッション評価” section in the pinned source before continuing.
Documentation checklist
The source section “哲学” has been checked.
The source section “評価タイプ” has been checked.
The source section “能力評価” has been checked.
The source section “リグレッション評価” has been checked.
Static permission evidence
These are source excerpts matched by deterministic rules, not findings of malicious behavior, safety, or actual execution.
SKILL.md · L48
npm test -- --testPathPattern="auth" && echo "PASS" || echo "FAIL"The documentation asks the agent to run terminal commands or scripts.
SKILL.md · L51
npm run build && echo "PASS" || echo "FAIL"The documentation asks the agent to run terminal commands or scripts.
Choose a different workflow
Formal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles
A separate implementation from affaan-m/ECC; compare its source, maintenance signals, and permission requirements.
Open source detailFormal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles
A separate implementation from affaan-m/ECC; compare its source, maintenance signals, and permission requirements.
Open source detailFramework formal de evaluación para sesiones de Claude Code que implementa principios de desarrollo orientado a evals (EDD)
A separate implementation from affaan-m/ECC; compare its source, maintenance signals, and permission requirements.
Open source detailFAQ
Claude Codeセッションの正式な評価フレームワークで、評価駆動開発(EDD)の原則を実装します。
The source record exposes this install command: npx skills add https://github.com/affaan-m/ECC --skill "docs/ja-JP/skills/eval-harness". Inspect the command and pinned source before running it.
The pinned source record declares support for: claude code.
Static rules flagged exec-script in the source; the page lists the matching lines and excerpts.
Quality breakdown
Based on traceable docs and repository signals; stars are not treated as quality.
Compare before choosing
These links are selected from shared tasks, functions, stacks, platforms, and same-name variants. Compare the source owner, documentation, permissions, and maintenance signals.
Formal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles
Formal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles
Framework formal de evaluación para sesiones de Claude Code que implementa principios de desarrollo orientado a evals (EDD)
Use it for engineering tasks; the detail page covers purpose, installation, and practical steps.
Eval-driven development (EDD) ilkelerini uygulayan Claude Code oturumları için formal değerlendirme çerçevesi
Claude Codeセッションの正式な評価フレームワークで、評価駆動開発(EDD)の原則を実装します。
評価駆動開発は評価を「AI開発のユニットテスト」として扱います:
Claudeが以前できなかったことができるようになったかをテスト:
[CAPABILITY EVAL: feature-name]
タスク: Claudeが達成すべきことの説明
成功基準:
- [ ] 基準1
- [ ] 基準2
- [ ] 基準3
期待される出力: 期待される結果の説明
変更が既存の機能を破壊しないことを確認:
[REGRESSION EVAL: feature-name]
ベースライン: SHAまたはチェックポイント名
テスト:
- existing-test-1: PASS/FAIL
- existing-test-2: PASS/FAIL
- existing-test-3: PASS/FAIL
結果: X/Y 成功(以前は Y/Y)
コードを使用した決定論的チェック:
# ファイルに期待されるパターンが含まれているかチェック
grep -q "export function handleAuth" src/auth.ts && echo "PASS" || echo "FAIL"
# テストが成功するかチェック
npm test -- --testPathPattern="auth" && echo "PASS" || echo "FAIL"
# ビルドが成功するかチェック
npm run build && echo "PASS" || echo "FAIL"
Claudeを使用して自由形式の出力を評価:
[MODEL GRADER PROMPT]
次のコード変更を評価してください:
1. 記述された問題を解決していますか?
2. 構造化されていますか?
3. エッジケースは処理されていますか?
4. エラー処理は適切ですか?
スコア: 1-5(1=不良、5=優秀)
理由: [説明]
手動レビューのためにフラグを立てる:
[HUMAN REVIEW REQUIRED]
変更内容: 何が変更されたかの説明
理由: 人間のレビューが必要な理由
リスクレベル: LOW/MEDIUM/HIGH
「k回の試行で少なくとも1回成功」
「k回の試行すべてが成功」
## 評価定義: feature-xyz
### 能力評価
1. 新しいユーザーアカウントを作成できる
2. メール形式を検証できる
3. パスワードを安全にハッシュ化できる
### リグレッション評価
1. 既存のログインが引き続き機能する
2. セッション管理が変更されていない
3. ログアウトフローが維持されている
### 成功メトリクス
- 能力評価で pass@3 > 90%
- リグレッション評価で pass^3 = 100%
定義された評価に合格するコードを書く。
# 能力評価を実行
[各能力評価を実行し、PASS/FAILを記録]
# リグレッション評価を実行
npm test -- --testPathPattern="existing"
# レポートを生成
評価レポート: feature-xyz
========================
能力評価:
create-user: PASS (pass@1)
validate-email: PASS (pass@2)
hash-password: PASS (pass@1)
全体: 3/3 成功
リグレッション評価:
login-flow: PASS
session-mgmt: PASS
logout-flow: PASS
全体: 3/3 成功
メトリクス:
pass@1: 67% (2/3)
pass@3: 100% (3/3)
ステータス: レビュー準備完了
/eval define feature-name
.claude/evals/feature-name.mdに評価定義ファイルを作成
/eval check feature-name
現在の評価を実行してステータスを報告
/eval report feature-name
完全な評価レポートを生成
プロジェクト内に評価を保存:
.claude/
evals/
feature-xyz.md # 評価定義
feature-xyz.log # 評価実行履歴
baseline.json # リグレッションベースライン
## EVAL: add-authentication
### フェーズ 1: 定義(10分)
能力評価:
- [ ] ユーザーはメール/パスワードで登録できる
- [ ] ユーザーは有効な資格情報でログインできる
- [ ] 無効な資格情報は適切なエラーで拒否される
- [ ] セッションはページリロード後も持続する
- [ ] ログアウトはセッションをクリアする
リグレッション評価:
- [ ] 公開ルートは引き続きアクセス可能
- [ ] APIレスポンスは変更されていない
- [ ] データベーススキーマは互換性がある
### フェーズ 2: 実装(可変)
[コードを書く]
### フェーズ 3: 評価
Run: /eval check add-authentication
### フェーズ 4: レポート
評価レポート: add-authentication
==============================
能力: 5/5 成功(pass@3: 100%)
リグレッション: 3/3 成功(pass^3: 100%)
ステータス: 出荷可能