---
tags: [AI-Agent, 가드레일, 안전]
---

# 가드레일 (Guardrails)

> 한 줄 정의
> 에이전트의 입력·행동·출력을 정책과 안전 기준 안에 묶어두는 통제 계층. 자율성을 부여하는 만큼 반드시 함께 설계해야 하는 안전장치다.

## 세 층위의 가드레일

### 1. 입력 가드레일 (Input)
모델에 들어가기 전 사용자·외부 데이터를 검사한다.
- 프롬프트 인젝션·탈옥 탐지 → [[Prompt Injection]]
- 오프토픽·악성·정책 위반 입력 차단
- 입력에 섞인 민감정보 사전 처리 → [[PII Redaction]]

### 2. 행동 가드레일 (Action)
에이전트가 도구를 실행하는 단계를 제약한다.
- **도구 화이트리스트**와 권한 최소화
- **최대 스텝·예산·시간 한도** (무한 루프·비용 폭주 방지)
- **비가역·고위험 행동**(결제, 삭제, 외부 전송)은 사람 승인 게이트 → [[Human In the Loop]]

### 3. 출력 가드레일 (Output)
응답을 사용자/다운스트림에 내보내기 전 검증한다.
- PII·유해성·정책 위반 필터링
- 출력 포맷·스키마 검증, 근거 일치 확인 → [[Grounding]] · [[Hallucination Detection]]

## 구현 원칙

- **규칙 기반 + LLM 분류기 병행**: 정규식·스키마로 빠르게 거르고, 모호한 판정은 LLM judge로 보강한다 → [[Critic Agent]].
- **Fail-closed**: 가드레일이 불확실하면 통과가 아니라 차단·에스컬레이션을 기본값으로.
- **관측과 결합**: 차단·위반 이벤트를 로깅해 회귀를 추적한다 → [[Logging]] · [[Tracing]].

## 대표 도구

- **NeMo Guardrails** (NVIDIA), **Guardrails AI** — 선언적 레일 정의
- **Llama Guard**, **OpenAI Moderation** — 안전성 분류 모델

## 관련 노트

- [[Prompt Injection]]
- [[PII Redaction]]
- [[Human In the Loop]]
- [[Agent 설계 원칙]]
- [[Tool Calling]]
- [[Hallucination Detection]]
