주요업무
• 클라우드 사용자가 겪는 가상머신, 컨테이너, GPU 할당, 네트워크 설정 등 기술적 문제를 진단하고 해결책을 제시합니다.
• NVIDIA GPU 아키텍처에 대한 이해를 바탕으로 Driver, CUDA, NCCL 관련 이슈를 코드 및 커널 레벨에서 심층 분석합니다.
• 시스템 로그, 커널 메시지(dmesg), 애플리케이션 로그를 분석하여 반복되는 장애 패턴을 추출하고 대응 프로세스를 수립합니다.
• 반복되는 이슈를 효율적으로 해결하기 위해 스크립트 및 내부 관리용 툴을 직접 설계하고 개발합니다.
• 사용자를 위한 매뉴얼, FAQ, 그리고 내부 팀을 위한 장애 대응 매뉴얼을 작성하고 관리합니다.
• GPU 자원 사용량 및 시스템 상태를 모니터링하여 잠재적인 장애 요인을 파악하고 공지합니다.