반응형
(개념) 서비스가 허용할 수 있는 장애/오류의 최대 허용치를 뜻하는 SRE(Site Reliability Engineering)
(핵심 공식)
에러 버짓 = 100% − SLO(Service Level Objective)
예: SLO가 99.9%라면, 에러 버짓은 0.1% → 한 달(약 43,200분) 기준 약 43분의 다운타임/오류가 "예산" 내에 있는 것으로 허용됨
(필요 항목)
100% 무결점을 목표로 하면 배포 속도가 극도로 느려지고 혁신이 막힘
반대로 안정성을 전혀 신경 안 쓰면 서비스 신뢰도가 무너짐
에러 버짓은 이 둘 사이의 객관적 기준선 역할을 함
(실제 운영 방식)
버짓이 남아 있으면 → 새 기능 배포, 실험적 변경 등 리스크 있는 작업 진행 가능
버짓을 다 소진하면 → 신규 배포를 일시 중단(release freeze)하고 안정성 개선에 집중
"burn rate"(소진 속도)를 모니터링해서, 예산이 예상보다 빨리 줄어들면 조기 경보를 발생시키는 방식으로도 활용
(클라우드 네이티브 환경에서의 의미)
마이크로서비스, 잦은 배포, 오토스케일링이 일상인 환경에서는 정성적 판단("이번엔 괜찮겠지")보다 이런 정량적 기준이 팀 간(개발 vs 운영) 갈등을 줄이고, 배포 여부를 데이터 기반으로 결정할 수 있게 해줍니다.
실제 Prometheus/Grafana 로 SLI 를 측정하고, SLO/에러 버짓 대시보드를 만들어 운영 룰과 연결하면 바로 활용 가능함
728x90
반응형
'12. 메일진' 카테고리의 다른 글
| [용어] NUMA (Non-Uniform Memory Access) (0) | 2026.07.28 |
|---|---|
| [용어] MIG (Multi-Instance GPU) (0) | 2026.07.28 |
| ITFIND 메일진 제1264호 산업분야별 정보메일 (발행 : 2026-07-24) (0) | 2026.07.25 |
| [용어] AI 모델의 방출 특성(Emission Behavior) (0) | 2026.07.20 |
| [용어] 브레드크럼(Breadcrumb) (0) | 2026.07.19 |


