---
type: knowledge
domain: aws
status: active
last-reviewed: 2026-07-12
tags:
  - aws
  - reliability
  - disaster-recovery
---

# 신뢰성과 재해 복구

> 한 줄 정의
> 장애를 예외가 아니라 정상 입력으로 취급하고, 정량화한 RTO·RPO에 맞춰 복구 전략을 선택·시험한다.

## 기본 용어

| 용어 | 질문 |
|---|---|
| RTO | 서비스가 얼마 안에 복구돼야 하나? |
| RPO | 얼마만큼의 데이터 손실을 허용하나? |
| HA | 일상적 구성요소 장애에도 서비스를 지속하는가? |
| DR | 리전·계정·대규모 운영 사고에서 어떻게 복구하는가? |
| Durability | 저장한 데이터가 사라지지 않을 확률 |
| Availability | 요청 시 서비스가 사용 가능한 비율 |

## 신뢰성 패턴

- 한 리전 다중 AZ를 기본으로 하고 단일 AZ 종속성을 목록화한다.
- 상태 없는 계층, 자동 대체, health check, load balancer, autoscaling을 사용한다.
- timeout은 모든 원격 호출에, retry는 재시도 가능한 오류에만 지수 백오프+jitter로 적용한다.
- circuit breaker, bulkhead, rate limit, load shedding으로 연쇄 장애를 막는다.
- 큐로 급증을 흡수하고 멱등성으로 중복 처리를 안전하게 만든다.
- 정적 안정성: 장애 중 제어 영역 API 호출 없이도 데이터 영역이 계속 동작하도록 설계한다.
- Service Quotas를 용량 계획에 포함하고 상향 요청을 배포 전에 완료한다.

## DR 전략

| 전략 | 평상시 상태 | RTO/RPO 경향 | 비용 |
|---|---|---|---|
| Backup & Restore | 백업만 타 리전에 보존 | 가장 김 | 가장 낮음 |
| Pilot Light | 핵심 데이터 계층만 실행 | 중간 | 낮음~중간 |
| Warm Standby | 축소된 전체 스택 실행 | 짧음 | 중간~높음 |
| Multi-site Active/Active | 여러 리전에서 서비스 | 가장 짧음 | 가장 높음·복잡 |

멀티리전은 마지막 단계다. DNS, 데이터 충돌, 세션, 비밀, 인증, 배포, 관측, 운영자 접근과 failback까지 설계하지 않으면 복구가 아니라 새 장애원이 된다.

## 백업 설계

- AWS Backup 정책을 조직 단위로 배포하고 별도 계정·리전에 복사한다.
- Vault Lock/Object Lock 등 변경 불가능성을 랜섬웨어 위협 모델에 맞게 검토한다.
- 암호화 키가 없으면 백업도 복원할 수 없으므로 키 DR을 포함한다.
- 자원 구성은 IaC, 데이터는 백업/복제로 각각 복구한다.
- 샘플이 아닌 전체 복구 경로를 정기 시험하고 시간과 데이터 검증 결과를 기록한다.

## 게임데이

1. 실패 가설과 허용 영향 범위를 정의한다.
2. 관측과 중단 기준, 롤백 담당자를 정한다.
3. 인스턴스·AZ·DB failover, 자격 증명 폐기, 큐 적체, DNS 전환 등을 주입한다.
4. SLO 영향, 탐지 시간, 대응 시간, 런북의 오류를 측정한다.
5. 개선 작업에 owner와 기한을 부여한다.

> [!WARNING] Route 53 전환
> DNS TTL만 낮추면 DR이 완성되지 않는다. 헬스체크의 의미, 클라이언트 캐시, 인증서, 데이터 준비 상태, 복귀 절차를 함께 시험한다.

## 공식 문서

- [Reliability Pillar](https://docs.aws.amazon.com/wellarchitected/latest/reliability-pillar/welcome.html)
- [Disaster Recovery of Workloads on AWS](https://docs.aws.amazon.com/whitepapers/latest/disaster-recovery-workloads-on-aws/welcome.html)
- [AWS Backup](https://docs.aws.amazon.com/aws-backup/)
- [AWS Fault Isolation Boundaries](https://docs.aws.amazon.com/whitepapers/latest/aws-fault-isolation-boundaries/abstract-and-introduction.html)

## 관련 문서

- [[장애 대응 실전]] · [[01_글로벌 인프라와 Well-Architected]] · [[11_관측성과 운영]]

