affaan-m/ECC

eval-harness

Eval-driven development (EDD) ilkelerini uygulayan Claude Code oturumları için formal değerlendirme çerçevesi

67CollectingClaude CodeRuns scripts
See how to use itView GitHub source
npx skills add https://github.com/affaan-m/ECC --skill "docs/tr/skills/eval-harness"
Automated source guide

Source checked Jul 28, 2026·Refresh due Oct 26, 2026

Reorganized from the pinned upstream SKILL.md

Turn eval-harness's source instructions into a guide you can follow

According to the pinned SKILL.md from affaan-m/ECC: Claude Code oturumları için eval-driven development (EDD) ilkelerini uygulayan formal değerlendirme çerçevesi.

npx skills add https://github.com/affaan-m/ECC --skill "docs/tr/skills/eval-harness"
Check the pinned source

Best fit

  • Eval-driven development (EDD) ilkelerini uygulayan Claude Code oturumları için formal değerlendirme çerçevesi

Bring this context

  • A concrete task that matches the documented purpose of eval-harness.
  • The files, examples, or context the task depends on.
  • Your constraints, target environment, and definition of done.

Expected outputs

  • A result that follows the pinned eval-harness instructions.
  • A concise record of assumptions, inputs used, and unresolved questions.
  • A final check against the source workflow and relevant permission signals.

Key source sections

Read eval-harness through these 5 source sections

Sections are extracted automatically from the pinned SKILL.md and link back to the source.

01

Ne Zaman Aktifleştirmeli

AI destekli iş akışları için eval-driven development (EDD) kurarken

SKILL.md · Ne Zaman Aktifleştirmeli
AI destekli iş akışları için eval-driven development (EDD) kurarkenClaude Code görev tamamlama için geçti/kaldı kriterleri tanımlarkenpass@k metrikleriyle agent güvenilirliğini ölçerken
02

Felsefe

Eval-Driven Development, eval'ları "AI geliştirmenin birim testleri" olarak ele alır: - İmplementasyondan ÖNCE beklenen davranışı tanımla - Geliştirme sırasında eval'ları sürekli çalıştır - Her değişiklikle regresyonları izle - Güvenilirlik ölçümü için pass@k metriklerini kullan

SKILL.md · Felsefe
İmplementasyondan ÖNCE beklenen davranışı tanımlaGeliştirme sırasında eval'ları sürekli çalıştırHer değişiklikle regresyonları izle
03

Eval Tipleri

Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:

SKILL.md · Eval Tipleri
Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:
04

Capability Eval'ları

Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:

SKILL.md · Capability Eval'ları
Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:
05

Regression Eval'ları

Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:

SKILL.md · Regression Eval'ları
Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:

SkillSignal prompt templates

Provide the task, context, and acceptance criteria

These prompts were written by SkillSignal from the source structure; they are not upstream text.

Task-start prompt

Confirm source fit, inputs, and outputs before acting.

Use eval-harness to help me with: [specific task]. Context: [files, data, or background]. Constraints: [environment, scope, and prohibited actions]. Before acting, check the pinned SKILL.md and explain which sections apply, what inputs are still missing, and what you will deliver.

Source-guided execution

Make the Agent explicitly follow the key extracted sections.

Apply the pinned eval-harness source to [task]. Pay particular attention to these source sections: “Ne Zaman Aktifleştirmeli”, “Felsefe”, “Eval Tipleri”, “Capability Eval'ları”, “Regression Eval'ları”. Preserve the important decision at each step. Mark facts not covered by the source as “needs confirmation” instead of inventing them. Then verify the result against my acceptance criteria: [criteria].

Result-review prompt

Check omissions, permissions, and source drift before delivery.

Review the current eval-harness result: (1) does it satisfy the original task; (2) were any applicable steps or limits in the pinned SKILL.md missed; (3) did it perform any unauthorized file, command, network, or data action; and (4) which conclusions remain unverified? List issues first, then fix only what the source or user authorization supports.

Output checklist

Verify each item before delivery

The task matches the purpose documented in the SKILL.md.

The source section “Ne Zaman Aktifleştirmeli” has been checked.

The source section “Felsefe” has been checked.

The source section “Eval Tipleri” has been checked.

The source section “Capability Eval'ları” has been checked.

Inputs, constraints, and acceptance criteria are explicit.

Unverified facts, compatibility, and outcome claims are clearly marked.

Any file, command, network, or data action has been reviewed.

Choose a different workflow

When another Skill is the better fit

FAQ

What does eval-harness do?

Claude Code oturumları için eval-driven development (EDD) ilkelerini uygulayan formal değerlendirme çerçevesi.

How do I start using eval-harness?

The catalog detected this source-specific install command: npx skills add https://github.com/affaan-m/ECC --skill "docs/tr/skills/eval-harness". Inspect the command and pinned source before running it.

Which Agent platforms does it declare?

claude code

Repository stars
234,327
Repository forks
35,711
Quality
67/100
Source repository last pushed

Quality breakdown

Based on traceable docs and repository signals; stars are not treated as quality.

67/100
Documentation23/30
Specificity14/25
Maintenance20/20
Trust signals10/25
View original Skill.mdThis page is parsed directly from the repository SKILL.md without editorial rewriting. Collected: Jul 28, 2026 · about 2 min

Eval Harness Skill

Claude Code oturumları için eval-driven development (EDD) ilkelerini uygulayan formal değerlendirme çerçevesi.

Ne Zaman Aktifleştirmeli

  • AI destekli iş akışları için eval-driven development (EDD) kurarken
  • Claude Code görev tamamlama için geçti/kaldı kriterleri tanımlarken
  • pass@k metrikleriyle agent güvenilirliğini ölçerken
  • Prompt veya agent değişiklikleri için regresyon test paketleri oluştururken
  • Model versiyonları arasında agent performansını benchmark ederken

Felsefe

Eval-Driven Development, eval'ları "AI geliştirmenin birim testleri" olarak ele alır:

  • İmplementasyondan ÖNCE beklenen davranışı tanımla
  • Geliştirme sırasında eval'ları sürekli çalıştır
  • Her değişiklikle regresyonları izle
  • Güvenilirlik ölçümü için pass@k metriklerini kullan

Eval Tipleri

Capability Eval'ları

Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:

[CAPABILITY EVAL: feature-name]
Görev: Claude'un başarması gereken şeyin açıklaması
Başarı Kriterleri:
  - [ ] Kriter 1
  - [ ] Kriter 2
  - [ ] Kriter 3
Beklenen Çıktı: Beklenen sonucun açıklaması

Regression Eval'ları

Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:

[REGRESSION EVAL: feature-name]
Baseline: SHA veya checkpoint adı
Testler:
  - existing-test-1: PASS/FAIL
  - existing-test-2: PASS/FAIL
  - existing-test-3: PASS/FAIL
Sonuç: X/Y geçti (önceden Y/Y)

Grader Tipleri

1. Code-Based Grader

Kod kullanarak deterministik kontroller:

# Dosyanın beklenen pattern içerip içermediğini kontrol et
grep -q "export function handleAuth" src/auth.ts && echo "PASS" || echo "FAIL"

# Testlerin geçip geçmediğini kontrol et
npm test -- --testPathPattern="auth" && echo "PASS" || echo "FAIL"

# Build'in başarılı olup olmadığını kontrol et
npm run build && echo "PASS" || echo "FAIL"

2. Model-Based Grader

Açık uçlu çıktıları değerlendirmek için Claude kullan:

[MODEL GRADER PROMPT]
Aşağıdaki kod değişikliğini değerlendir:
1. Belirtilen sorunu çözüyor mu?
2. İyi yapılandırılmış mı?
3. Edge case'ler işleniyor mu?
4. Hata işleme uygun mu?

Puan: 1-5 (1=kötü, 5=mükemmel)
Gerekçe: [açıklama]

3. Human Grader

Manuel inceleme için işaretle:

[HUMAN REVIEW REQUIRED]
Değişiklik: Neyin değiştiğinin açıklaması
Sebep: Neden insan incelemesi gerekli
Risk Seviyesi: DÜŞÜK/ORTA/YÜKSEK

Metrikler

pass@k

"k denemede en az bir başarı"

  • pass@1: İlk deneme başarı oranı
  • pass@3: 3 denemede başarı
  • Tipik hedef: pass@3 > %90

pass^k

"Tüm k denemeler başarılı"

  • Güvenilirlik için daha yüksek çıta
  • pass^3: Ardışık 3 başarı
  • Kritik yollar için kullan

Eval İş Akışı

1. Tanımla (Kodlamadan Önce)

## EVAL DEFINITION: feature-xyz

### Capability Eval'ları
1. Yeni kullanıcı hesabı oluşturabilir
2. Email formatını doğrulayabilir
3. Şifreyi güvenli şekilde hash'leyebilir

### Regression Eval'ları
1. Mevcut login hala çalışıyor
2. Oturum yönetimi değişmedi
3. Logout akışı sağlam

### Başarı Metrikleri
- capability eval'lar için pass@3 > %90
- regression eval'lar için pass^3 = %100

2. Uygula

Tanımlanan eval'ları geçmek için kod yaz.

3. Değerlendir

# Capability eval'ları çalıştır
[Her capability eval'ı çalıştır, PASS/FAIL kaydet]

# Regression eval'ları çalıştır
npm test -- --testPathPattern="existing"

# Rapor oluştur

4. Rapor

EVAL REPORT: feature-xyz
========================

Capability Eval'ları:
  create-user:     PASS (pass@1)
  validate-email:  PASS (pass@2)
  hash-password:   PASS (pass@1)
  Genel:           3/3 geçti

Regression Eval'ları:
  login-flow:      PASS
  session-mgmt:    PASS
  logout-flow:     PASS
  Genel:           3/3 geçti

Metrikler:
  pass@1: %67 (2/3)
  pass@3: %100 (3/3)

Durum: İNCELEMEYE HAZIR

Entegrasyon Kalıpları

İmplementasyondan Önce

/eval define feature-name

.claude/evals/feature-name.md konumunda eval tanım dosyası oluşturur

İmplementasyon Sırasında

/eval check feature-name

Mevcut eval'ları çalıştırır ve durumu raporlar

İmplementasyondan Sonra

/eval report feature-name

Tam eval raporu oluşturur

Eval Depolama

Eval'ları projede sakla:

.claude/
  evals/
    feature-xyz.md      # Eval tanımı
    feature-xyz.log     # Eval çalıştırma geçmişi
    baseline.json       # Regression baseline'ları

En İyi Uygulamalar

  1. Kodlamadan ÖNCE eval'ları tanımla - Başarı kriterleri hakkında net düşünmeyi zorlar
  2. Eval'ları sık çalıştır - Regresyonları erken yakala
  3. pass@k'yı zaman içinde izle - Güvenilirlik trendlerini gözle
  4. Mümkün olduğunda code grader kullan - Deterministik > olasılıksal
  5. Güvenlik için insan incelemesi - Güvenlik kontrollerini asla tam otomatikleştirme
  6. Eval'ları hızlı tut - Yavaş eval'lar çalıştırılmaz
  7. Eval'ları kodla versiyonla - Eval'lar birinci sınıf artifact'lardır

Örnek: Kimlik Doğrulama Ekleme

## EVAL: add-authentication

### Faz 1: Tanımla (10 dk)
Capability Eval'ları:
- [ ] Kullanıcı email/şifre ile kayıt olabilir
- [ ] Kullanıcı geçerli kimlik bilgileriyle giriş yapabilir
- [ ] Geçersiz kimlik bilgileri uygun hatayla reddedilir
- [ ] Oturumlar sayfa yeniden yüklemelerinde kalıcıdır
- [ ] Logout oturumu temizler

Regression Eval'ları:
- [ ] Halka açık rotalar hala erişilebilir
- [ ] API yanıtları değişmedi
- [ ] Veritabanı şeması uyumlu

### Faz 2: Uygula (değişir)
[Kod yaz]

### Faz 3: Değerlendir
Çalıştır: /eval check add-authentication

### Faz 4: Raporla
EVAL REPORT: add-authentication
==============================
Capability: 5/5 geçti (pass@3: %100)
Regression: 3/3 geçti (pass^3: %100)
Durum: YAYINLA

Product Eval'ları (v1.8)

Davranış kalitesi sadece birim testlerle yakalanamadığında product eval'ları kullan.

Grader Tipleri

  1. Code grader (deterministik assertion'lar)
  2. Rule grader (regex/şema kısıtlamaları)
  3. Model grader (LLM-as-judge rubric)
  4. Human grader (belirsiz çıktılar için manuel karar)

pass@k Kılavuzu

  • pass@1: doğrudan güvenilirlik
  • pass@3: kontrollü yeniden denemeler altında pratik güvenilirlik
  • pass^3: kararlılık testi (3 çalıştırmanın tümü geçmeli)

Önerilen eşikler:

  • Capability eval'ları: pass@3 >= 0.90
  • Regression eval'ları: yayın-kritik yollar için pass^3 = 1.00

Eval Anti-Kalıpları

  • Prompt'ları bilinen eval örneklerine overfitting yapmak
  • Sadece mutlu-yol çıktılarını ölçmek
  • Geçme oranlarını kovalamken maliyet ve gecikme kaymasını görmezden gelmek
  • Yayın kapılarında kararsız grader'lara izin vermek

Minimal Eval Artifact Düzeni

  • .claude/evals/<feature>.md tanımı
  • .claude/evals/<feature>.log çalıştırma geçmişi
  • docs/releases/<version>/eval-summary.md yayın snapshot'ı
Source repo
affaan-m/ECC
Skill path
docs/tr/skills/eval-harness/SKILL.md
Commit SHA
4e973d3eaf92
Repository license
MIT
Data collected