---
type: template
domain: product
role: Data·ML
status: active
last-reviewed: 2026-07-27
---

# 베이스라인·평가 계획

> 계약 요구(요구사항정의서·기능사양서의 ML 항목)를 고정 평가셋, baseline, metric과 **검수 threshold**로 바꾼다. 이 계획의 실행 결과가 납품 산출물인 **평가 리포트**(테스트결과서의 ML 절)가 된다. threshold는 착수 전 발주사와 합의된 값만 유효하다.

## 평가 계약 (검수 기준)

| 계약 요구·요구사항 ID | 평가 대상 | metric·산식 | 합의된 검수 threshold | 표본·slice | 판정자 |
|---|---|---|---|---|---|
|  |  |  |  |  |  |

## Baseline

| baseline | 설명·version | 지표 | 비용·지연 | 비교 이유 |
|---|---|---|---|---|
| 규칙·단순 모델 |  |  |  |  |

## 개선 시도 기록

> 검수 threshold 미달 시의 개선 작업도 동일 평가셋·산식으로 기록한다 — 진행 보고와 미달 시 협의의 근거.

| 시도 ID | 목적·개선 가설 | 변경 요소 | 고정 요소 | seed·환경 | 판정·중단 기준 |
|---|---|---|---|---|---|
| ML-RUN-001 |  |  |  |  |  |

## Slice·편향·실패 분석

| slice·조건 | 건수 | 목표 metric | 최저 허용치 | 예상 위험 | 실패 시 조치 |
|---|---|---|---|---|---|
|  |  |  |  |  |  |

## 재현 정보

> 검수·하자보수 시 결과를 재현하지 못하면 평가 리포트는 근거 능력을 잃는다. 인수인계 대상.

| 항목 | version·경로 |
|---|---|
| 코드·commit |  |
| 데이터 snapshot |  |
| 의존성·runtime |  |
| seed·config |  |
| artifact·평가 리포트 |  |

## 완료 질문

- [ ] baseline과 같은 평가셋·산식으로 비교하는가?
- [ ] 전체 평균 외 중요 업무·희소 slice를 평가하는가?
- [ ] threshold가 착수 전 발주사와 합의된 검수 기준인가? (기준 변경 요청은 CR로 회부)
- [ ] 평가 결과의 불확실성·표본 수와 실패 사례를 함께 제시하는가?
- [ ] 고정 test set에서 합의 threshold를 충족하지 못하면 PASS로 쓰지 않는가? (기준의 사후 완화 금지 — 미달 사실을 기록하고 발주사와 협의)
