---
type: knowledge
domain: aws
status: active
last-reviewed: 2026-07-12
tags:
  - aws
  - observability
  - operations
---

# 관측성과 운영

> 한 줄 정의
> 메트릭·로그·트레이스·변경·감사 데이터를 상관관계 있게 모으고, 사용자 영향에 연결된 SLO와 실행 가능한 알림으로 운영한다.

## 도구 구분

| 도구 | 답하는 질문 |
|---|---|
| CloudWatch Metrics/Alarms | 지금 수치가 정상 범위인가? |
| CloudWatch Logs/Logs Insights | 어떤 이벤트와 오류가 있었나? |
| OpenTelemetry·ADOT → CloudWatch/X-Ray | 요청이 어느 구간에서 느리거나 실패했나? |
| CloudTrail | 누가 어떤 AWS API를 호출했나? |
| AWS Config | 리소스 구성이 어떻게 바뀌었나? 규칙을 준수하나? |
| Managed Prometheus/Grafana | Prometheus 생태계 메트릭과 대시보드 |
| Systems Manager | 인벤토리, 패치, 원격 명령, 세션, 자동화 |
| Health Dashboard | AWS 계정·서비스에 영향을 주는 이벤트는? |
| Trusted Advisor | 비용·성능·보안·내결함성 권고 |

CloudTrail은 애플리케이션 로그가 아니고 Config는 실시간 위협 탐지가 아니다. 목적별 신호를 연결한다.

> [!WARNING] 2026년 트레이싱 기준
> X-Ray **서비스/backend**는 계속 사용할 수 있지만 X-Ray SDK와 daemon은 2026-02-25부터 유지보수 모드다. 신규 계측은 OpenTelemetry를 기본으로 하고 CloudWatch agent 또는 OpenTelemetry collector를 통해 CloudWatch/X-Ray로 보낸다. 기존 X-Ray SDK는 계획적으로 마이그레이션한다.

## 관측 설계

- 로그는 JSON 구조화, UTC timestamp, service, env, request/correlation id, error code를 포함한다.
- 메트릭은 RED(request rate, errors, duration) 또는 USE(utilization, saturation, errors)로 시작한다.
- trace id를 HTTP, 메시지, 비동기 작업 전 구간에 전파한다.
- 신규 애플리케이션은 OpenTelemetry SDK·자동 계측과 W3C Trace Context를 기본 후보로 검토한다.
- 고카디널리티 값은 메트릭 dimension에 무분별하게 넣지 않는다.
- 로그 그룹별 보존 기간, 민감정보 마스킹, 구독 필터, 아카이브를 명시한다.
- 대시보드는 사용자 결과 → 서비스 → 의존성 → 인프라 순으로 drill-down 가능하게 만든다.

## SLI·SLO·알림

| 개념 | 예 |
|---|---|
| SLI | 성공 요청 비율, p95 지연, 작업 완료 시간 |
| SLO | 30일 동안 성공률 99.9% |
| Error budget | 허용 실패량. 변경 속도와 신뢰성의 공통 언어 |

- 알림은 증상이 사용자에게 영향을 주거나 곧 줄 때 발생시킨다.
- CPU 80% 자체보다 오류율·지연·queue age·용량 고갈을 우선한다.
- 모든 알림에는 owner, severity, runbook, dashboard, 자동 해제 조건이 있어야 한다.
- composite alarm과 anomaly detection은 노이즈를 줄일 때 사용한다.

## 운영 자동화

- EventBridge 이벤트 → Lambda/SSM Automation으로 안전하고 반복 가능한 조치를 자동화한다.
- 자동 복구는 영향 범위, 최대 실행 횟수, 롤백, 감사 로그를 가져야 한다.
- 패치, AMI 갱신, 인증서 만료, 백업 실패, 할당량, 비용 이상을 정기 점검한다.
- CloudWatch Synthetics/외부 합성 테스트로 사용자 경로를 지속 확인한다.

## 운영 지표

- MTTD, MTTA, MTTR, 변경 실패율, 배포 빈도, 복구 시험 성공률
- 알람 수보다 actionable alert 비율과 오탐률
- 로그 수집 지연, 누락률, 보존 비용
- 서비스 할당량 사용률과 용량 고갈 예상 시점

> [!TIP] 첫 대시보드
> 트래픽, 성공률, p50/p95/p99 지연, 배포 버전, 하류 의존성, queue age, DB 연결, 비용/일을 한 화면에서 본다.

## 공식 문서

- [Choosing monitoring and observability services](https://docs.aws.amazon.com/decision-guides/latest/monitoring-on-aws-how-to-choose/monitoring-on-aws-how-to-choose.html)
- [Amazon CloudWatch](https://docs.aws.amazon.com/cloudwatch/)
- [AWS CloudTrail](https://docs.aws.amazon.com/cloudtrail/)
- [AWS Config](https://docs.aws.amazon.com/config/)
- [AWS Systems Manager](https://docs.aws.amazon.com/systems-manager/)
- [X-Ray SDK and daemon support timeline](https://docs.aws.amazon.com/xray/latest/devguide/xray-sdk-daemon-timeline.html)
- [Migrate X-Ray instrumentation to OpenTelemetry](https://docs.aws.amazon.com/xray/latest/devguide/xray-sdk-migration.html)

## 관련 문서

- [[장애 대응 실전]] · [[12_신뢰성과 재해 복구]] · [[17_실전 체크리스트와 런북]]
