프로젝트 목록2026
⚖️
har_eval
증거-게이트 역량 결정 하네스 (build/adopt/keep)
"도구·기능·시스템 X를 만들·도입·유지할까?"를 의견·열정이 아니라 측정과 적대 감사로 결정하는 메타-하네스. 수개월 실 결정(메모리 도구 빌드-안함, serena keep/retire)에서 증류한 7단계 방법론과 자기 실패에서 파생된 가드레일 10개로 구성됩니다.
⚖️
Case
문제 → 해결 → 결과
- Problem
- "이거 만들까, 도입할까"를 의견과 열정으로 결정하면 잘못된 yes가 실제 빌드 시간을 통째로 태웁니다. 정직한 답이 "지금 것으로 충분"일 때가 많은데, 측정 없이는 그걸 지나치기 쉬웠습니다.
- AX Intervention
- 세 가지를 원칙으로 박았습니다. ① 만들기 전에 측정 — 현재(공짜)부터 기성 도구 순으로 싸게 게이팅하고, 기성을 실제로 붙여보고도 부족할 때만 직접 만듭니다(buy-before-build). ② 자기감사로 끝내지 않고 다른 벤더 모델로 교차 적대감사 — 한 모델은 자기 맹점을 못 보기 때문입니다(실제로 자기감사 8건 위에 교차감사가 13건을 더 찾음). ③ 모든 결론에 "실측(n)·추론·메커니즘" 신뢰도 라벨을 붙여, 안 돌려본 것을 판정으로 둔갑시키지 않았습니다.
- Outcome
- 여러 실제 결정을 데이터로 내렸고, 흔한 정직한 결론은 "안 만든다"였습니다 — 기억 도구는 안 만들고, 코드 심볼 도구는 범위를 한정해 유지하고, 토큰 프록시는 안전한 명령에만 조건부로. 열정이 아니라 측정이 빌드 시간을 지켰습니다.
Tech Stack
MarkdownClaude CodeCodexSkillEvidence-Gate
Features
주요 기능
01
7단계(Frame·Inventory·Design·Adversarial audit·Buy-before-build·Measure·Decide+Cleanup)로 잘못된 yes의 빌드 시간 낭비를 차단
02
교차모델 적대 감사 — 자기감사 위에 다른 벤더(Codex) 모델로 단일모델 구조적 맹점을 포착(실사례 13건 추가 발견)
03
buy-before-build + 싼것부터 게이팅 — 만들어서 확인하지 않고 기성 도구를 Control에 붙여 실토큰·정답률을 측정
04
자기 실패에서 파생된 반증가능 가드레일 10개(n≥6, 미측정 arm 추론금지, 모델 고정, 신뢰도 라벨)
05
모든 판정에 measured(n)/inferred/mechanism-backed 신뢰도 라벨을 붙여 측정과 추론을 분리
06
첫 임무는 "만들 이유 찾기"가 아니라 "안 만들어도 되는지 싸게 확인" — 흔한 정직한 결과는 "현재로 충분"
하이라이트
측정 + 교차모델 적대감사로 내리는 역량 결정 하네스