[합류하게 될 팀에 대해 알려드려요]
• 토스뱅크의 ML Engineer (ML/LLM Ops) 는 ML Platform Team에 속해 있어요.
• ML Platform Team은 토스뱅크의 머신러닝과 LLM이 실제 금융 서비스 안에서 안정적으로 활용될 수 있도록, ML/LLM 플랫폼을 직접 만들고 운영하는 팀이에요.
• 우리는 모델을 만드는 것에서 끝나지 않고, 모델이 학습·검증·배포·서빙·모니터링되는 전 과정을 플랫폼화해요. ML Engineer, ML Modeler, Data Scientist, Data Engineer, Product Team과 함께 토스뱅크의 다양한 금융 서비스에 머신러닝과 LLM을 더 빠르고 안전하게 적용할 수 있도록 돕고 있어요.
• MLflow, Airflow, JupyterHub, Kubeflow, Feature Store, Triton Inference Server, vLLM/SGLang/TensorRT-LLM 기반 서빙 환경, LLM Gateway, Vector Database 등 ML/LLM 서비스를 위한 핵심 플랫폼을 다루고 있어요.
• 금융 도메인 특성상 안정성, 확장성, 보안, 개인정보 보호, 감사 가능성이 매우 중요해요. 단순히 기술을 도입하는 것을 넘어, 실제 운영 환경에서 신뢰할 수 있는 ML/LLM 플랫폼을 만드는 경험을 할 수 있어요.
주요업무
[합류하면 함께할 업무예요]
• ML 챕터 내 공통 기술을 개발하고, 토스뱅크의 ML/LLM 플랫폼을 함께 고도화해요.
• MLflow, Airflow, JupyterHub, Kubeflow 등 사내 머신러닝 플랫폼을 구축하고 운영해요.
• ScyllaDB 클러스터 기반의 Feature Store를 운영하고, ML 서비스가 안정적으로 데이터를 활용할 수 있는 환경을 만들어요.
• Triton Inference Server, vLLM, SGLang 등 다양한 서빙 기술을 활용해 ML/LLM 모델 서빙 환경을 개발하고 최적화해요.
• LLM Gateway, Workflow, Vector Database 등 LLMOps 플랫폼을 구축하고 운영해요.
• 기존 On-Premise 중심의 머신러닝/LLM 인프라를 AWS, GCP 등 클라우드 환경으로 확장하고 고도화해요.
• EKS, GKE 등 Kubernetes 기반 클라우드 환경에서 ML/LLM 워크로드를 안정적으로 운영할 수 있도록 플랫폼을 설계하고 개선해요.
• On-Premise와 Cloud가 함께 동작하는 Hybrid ML/LLM 인프라를 설계하고 운영해요.
• GPU 기반 학습/서빙 워크로드의 확장성, 가용성, 성능, 비용 효율을 높이기 위해 클러스터 운영, 오토스케일링, 모니터링 체계를 개선해요.
• Data Engineer, ML Modeler, Data Scientist, Product Engineer 등 다양한 동료들과 협업하며 ML/LLM 기술이 실제 금융 서비스에 안정적으로 적용될 수 있도록 만들어요.
자격 요건
[이런 분과 함께하고 싶어요]
• Kubernetes 위에서 서비스를 개발, 배포하고 운영해본 경험이 있으신 분이 필요해요.
• AWS, GCP 등 클라우드 환경에서 서비스를 설계, 구축, 운영해본 경험이 있으시면 좋아요.
• EKS, GKE 등 Kubernetes 기반 클라우드 환경에서 서비스를 운영하거나 트러블슈팅해본 경험이 있으시면 좋아요.
• On-Premise와 Cloud를 함께 사용하는 Hybrid 환경에 대한 이해 또는 경험이 있으시면 좋아요.
• MLflow, Airflow, JupyterHub, Kubeflow 등 ML 플랫폼을 구축하거나 운영해본 경험이 있으시면 좋아요.
• 대규모 트래픽 또는 ML/LLM 워크로드를 안정적으로 운영하기 위한 확장성, 가용성 설계 경험이 있으시면 좋아요.
• GPU 기반 워크로드를 운영하거나 성능/비용 최적화를 해본 경험이 있으시면 좋아요.
• vLLM, SGLang, Triton Inference Server, TensorRT-LLM 등 모델 서빙 프레임워크를 활용해본 경험이 있으시면 좋아요.
• LLM Gateway, Workflow, Vector Database 등 LLMOps 플랫폼을 구축하고 운영해본 경험이 있으시면 좋아요.
• Apache Cassandra, ScyllaDB 등 분산 데이터베이스를 운영한 경험이 있으시면 좋아요.
• Terraform, Helm, ArgoCD 등 IaC/배포 자동화 도구를 활용해 인프라 운영을 자동화해본 경험이 있으시면 좋아요.
• Prometheus, Grafana, OpenTelemetry 등으로 서비스와 인프라의 상태를 관측하고 개선해본 경험이 있으시면 좋아요.
• 최신 ML/LLM 기술에 관심이 많고, 다양한 상황에서 최적의 솔루션을 찾을 수 있는 문제해결능력과 원활한 커뮤니케이션 역량을 갖춘 분을 찾고 있어요.
우대사항
[이력서는 이렇게 작성하시는 걸 추천해요]
• 그동안 해오신 업무 중 임팩트가 컸던 프로젝트를 구체적으로 적어주세요.
• 단순히 사용한 기술 목록만 나열하기보다, 어떤 문제를 발견했고, 어떤 구조로 해결했고, 그 결과 어떤 변화가 있었는지 알려주시면 좋아요.
• 머신러닝 플랫폼, 모델 서빙 플랫폼, Feature Store, LLMOps 플랫폼 등을 구축하거나 운영한 경험이 있다면 자세히 적어주세요.
• Kubernetes, GPU, 분산 데이터베이스, 모델 서빙, LLM Gateway, Vector Database 등 운영 중 마주했던 장애나 성능 문제를 어떻게 해결했는지도 적어주세요.
• 실제 서비스에 적용해 개선한 경험이 있다면 처리량, 지연 시간, 비용, 장애율, 개발 생산성, 배포 리드타임 등 가능한 범위에서 결과를 수치로 표현해 주세요.
• ML/LLM 관련 팀과 협업하며 공통 플랫폼이나 표준을 만들었던 경험이 있다면, 본인의 역할과 의사결정 과정을 함께 적어주세요.
• 외부 공개가 민감한 내용은 제외하셔도 괜찮아요. 다만 문제의 성격, 해결 방식, 본인이 만든 기술적 기여가 드러나면 좋아요.
채용절차
[토스뱅크로의 합류 여정]
• 서류접수 > 라이브 코딩 테스트 > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우협의 > 최종합격 및 입사
기타안내
• 자율과 책임의 문화: 토스뱅크는 Manager가 아닌 Maker들로 구성된 조직으로, 투명한 정보 공유와 수평적인 문화 속에서 구성원 업무에 대한 위임과 신뢰를 바탕으로 세상을 변화 시켜 나가고자 해요.
• 효율적인 업무방식: 토스뱅크는 가장 중요하고, 큰 영향을 미칠 수 있는 일에 집중해요. 획일적인 업무 프로세스보다는 데이터 기반의 사고로 적극적으로 토론하며, 가장 효율적인 문제 해결을 위해 협업하고 실행해요.
• 훌륭한 팀과 동료: 토스뱅크는 각 분야 최고 수준의 역량을 갖춘 인재들이 자율과 책임의 원칙 아래 뛰어난 역량을 발휘하고 있어요.
1. 자율과 효율의 근무 환경을 제공해요.
• 자율 출퇴근 제도
• 자율 휴가 / 재택근무
• 근속 3년마다 리프레시 유급 휴가 1개월
• Early Friday
2. 업무와 성장에 몰두할 수 있게끔 지원해요.
• 비포괄임금제 운영
• 주택자금 이자 지원
• 업무 관련 비용 100% 지원
• 최고급 장비 및 소프트웨어 제공
• 반기별 성과급 지급
• 매월 통신비 및 체력단련비 지원
• 명절 상여금 및 생일축하비
• 직장단체보험비(가족 포함) 및 경조사비
• 인재추천비 500만원
• 야간 및 코로나 사회적 거리두기 단계에 따른 택시비 지원
3. 먹고 마시는 것까지 회사가 책임져요.
• 법인카드 전원 지급 (점심, 저녁 식사비 100% 지원)
• 사내카페 내 음료 및 디저트 무료
• 사내 편의점 운영 및 신청하는 모든 간식 구비
• 사내 헤어살롱 무료 이용
• 건물주차장 주차비 전액지원