주요업무
1. Observability 시스템 구축 및 운영
• Metrics, Logs, Traces 기반의 관측 파이프라인 설계·구축·운영 (Mimir, Grafana, Loki, Tempo 등)
• 서비스 토폴로지 및 의존성 기반의 대시보드 설계, 이상 탐지 알림 체계 고도화
• 관측 데이터의 수집·저장·조회 성능 최적화 및 자원 관리
2. SLI/SLO 및 신뢰성 관리
• 서비스별 SLI 정의 (Latency, Availability, Error Rate 등) 및 SLO 목표 수립
• Error Budget 기반의 릴리스/변경 의사결정 프레임워크 운영
• SLO 달성률 리포팅 및 신뢰성 개선 과제 도출
3. 장애 대응 및 Post-mortem
• 온콜 체계 설계 및 Incident Response 프로세스 구축·운영
• 장애 발생 시 신속한 원인 분석(RCA) 및 복구 리드
• Post-mortem 작성 및 재발 방지 액션 아이템 추적·관리
• Runbook 작성 및 장애 대응 자동화 (자동 복구, 에스컬레이션 등)
4. 개발·운영 프로세스 개선
• 배포 파이프라인, 롤백 절차 등 운영 페인포인트 발굴 및 자동화
• Toil 식별·측정 및 체계적 제거
• 개발팀과 협업하여 서비스의 운영성(Operability) 개선 제안 및 반영
5. Kubernetes 환경 운영
• 프라이빗 클라우드 기반 Kubernetes 클러스터 운영 및 안정성 관리
• 워크로드 리소스 최적화, HPA/VPA 튜닝, 노드 스케일링 전략 수립
• 네트워크 정책, 서비스 메시 등 클러스터 인프라 운영