company logo
(주)비바리퍼블리카

[토스플레이스] Site Reliability Engineer (SRE)

유니콘
시리즈 G
누적 투자 1조↑
1,001-10,000명
유연근무제
재택근무제
경조금
장기근속 포상
식대 지원
음료/간식 제공
점심 제공
저녁 제공
  • 공고소개
  • 주요업무
  • 자격요건
  • 우대사항
  • 채용절차
  • 기타안내
이 포지션에 합격해 입사하시면 리멤버에서 합격 보상금 50만원을 드립니다
(주)비바리퍼블리카 조직 이미지
[합류하게 될 팀에 대해 알려드려요] • 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요. • SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요. • Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요. • Observability 환경을 지속적으로 고도화하면서, 토스플레이스의 신뢰성을 어떻게 정의하고 측정할지 기준을 정립해요. 장애를 더 빠르게 발견하고 대응하며, 그 경험을 시스템 개선으로 연결하는 방식도 함께 만들어가요. • 토스플레이스의 SRE 역할과 업무 방식을 처음부터 정의하고, 신뢰성 기준과 실행 방법을 조직에 정착시켜 갈 첫 멤버를 기다리고 있어요.

주요업무

[합류하면 함께할 업무예요] • 토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요. • 결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요. • Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요. • 주요 장애의 대응을 조율하고 Post-mortem을 주도해요. 장애에서 얻은 학습을 코드, 자동화, 아키텍처와 프로세스 개선으로 연결해 반복 장애를 줄여요. • 서비스별 Alert와 Runbook의 소유권, 장애 등급, 1차 대응과 Escalation 기준을 정립하고 토스플레이스에 적합한 Incident Management 체계를 발전시켜요. • SPOF, 성능 병목, 용량 한계와 잠재적 실패 지점을 찾아 개선해요. 성능 테스트와 용량 계획, 안전하게 통제된 Fault Injection을 통해 장애 전파 경로와 시스템의 복구 방식을 검증해요. • 문제의 성격에 따라 제품팀과 함께 제품 코드를 개선하고, 공통 플랫폼에 필요한 기능과 진단, 복구 도구는 직접 개발해요. 반복적인 진단과 복구 작업은 자동화로 줄여 나가요.

자격 요건

[이런 분과 함께하고 싶어요] • 하나 이상의 프로그래밍 언어를 이용해 프로덕션 코드와 운영 도구를 개발하고 개선할 수 있는 분을 찾아요. • 운영 중인 서비스의 장애 대응과 원인 분석을 주도하고, 코드, 자동화, 아키텍처 개선을 통해 재발을 방지해 본 분을 찾아요. • 특정 기술 계층에 한정되지 않고, 가설과 데이터를 바탕으로 애플리케이션, OS, Network, Infrastructure 등 여러 계층에서 문제의 원인을 추적할 수 있는 분을 찾아요. • 분산 시스템의 가용성, 지연시간, 성능과 용량을 나타내는 지표를 정의하고, 이를 바탕으로 신뢰성 문제를 구조적으로 개선해 본 분을 찾아요. • AWS 등 Public Cloud 환경에서 Kubernetes 기반의 프로덕션 서비스를 운영하고 트러블슈팅해 본 분을 찾아요. • 신뢰성 기준이나 장애 대응 체계를 수립, 개선하고, 여러 제품팀과 우선순위를 조율하며 이를 조직의 업무 방식으로 정착시켜 본 분과 함께하고 싶어요.

우대사항

[이런 분이면 더 좋아요] • SLI, SLO 또는 Error Budget을 정의하고 실제 서비스 운영과 의사결정에 활용해 본 경험이 있으면 좋아요. • Incident Management, Post-mortem 또는 Reliability Review 체계를 만들거나 개선해 본 경험이 있으면 좋아요. • 클라이언트부터 서버와 외부 시스템까지 이어지는 엔드투엔드 흐름에서 장애를 분석하고 해결해 본 경험이 있으면 좋아요. • 결제처럼 장애나 데이터 정합성 문제가 고객과 비즈니스에 직접적인 영향을 주는 Mission-Critical 서비스를 운영해 본 경험이 있으면 좋아요. • Istio 등 Service Mesh 환경에서 서비스 간 트래픽 흐름과 장애 전파 경로를 분석하고 개선해 본 경험이 있으면 좋아요. • Fault Injection 실험이나 장애 복구 훈련을 설계하고, 시스템의 복원력을 검증, 개선해 본 경험이 있으면 좋아요. • Java/Kotlin과 Spring Ecosystem을 이용해 제품 또는 플랫폼 코드를 개발해 본 경험이 있으면 좋아요. [토스플레이스에서 사용하는 기술] • Java, Kotlin, Spring Boot, Spring Cloud, JPA/Hibernate, Gradle • MySQL, MongoDB, Elasticsearch, Redis, Kafka • AWS, Kubernetes, Istio, Podman, Containerd • Git, GoCD, ArgoCD, Vault • Prometheus, Thanos, Grafana • Chaos Mesh • 특정 기술의 사용 경험보다 문제를 정확히 이해하고 적절한 해결 방법을 선택하는 역량을 중요하게 생각해요. 서비스의 신뢰성을 높이는 데 필요한 기술과 도구는 함께 검토해 도입하거나 직접 개발할 수 있어요.

채용절차

서류전형 > 테크핏 인터뷰(30분) > 직무 인터뷰 > 문화적합성 인터뷰 > 레퍼런스 체크 > 처우협의 > 최종합격 및 입사

기타안내

[이런 지원을 받아요] 토스커뮤니티 복지 자세히 보기:
https://toss.im/career/culture
이 포지션에 필요한 전문분야/기술
Java
Spring
Kotlin
AWS
Kubernetes
회사 로고
(주)비바리퍼블리카
정보 보기
누적 투자 금액
14939억원 이상
투자사
토닉프라이빗에쿼티, 비공개투자자, 페블즈자산운용, 한국산업은행, 굿워터캐피털, 그레이하운드캐피털, 하베스트인베스트먼트, 알토스벤처스, 광주은행, 미래에셋증권, 우리벤처파트너스, 알키온캐피탈매니지먼트, 애스펙스매니지먼트, 세쿼이아캐피탈차이나, 클라이너퍼킨스코필드앤바이어스, 베세머벤처파트너스, 싱가포르투자청, 리빗캐피털, 퀄컴벤처스, 페이팔, 파테크벤처스, 아이비케이기업은행
리멤버에서 수집한 기업 정보입니다. 정보 수정이 필요할 경우, 아래 경로로 요청해 주세요.
리멤버 앱 > 더보기 > 1:1 문의
먼저 입사한 실무자에게 조언을 구해보세요
사용자가 커넥트에 입력한 정보를 기반으로 제공됩니다
company logo
(주)비바리퍼블리카

[토스플레이스] Site Reliability Engineer (SRE)

유니콘
시리즈 G
누적 투자 1조↑
1,001-10,000명
유연근무제
재택근무제
경조금
장기근속 포상
식대 지원
음료/간식 제공
점심 제공
저녁 제공
직급/직책기타
연봉협의
근무지서울특별시 서초구
경력7년~15년 차
학력학력 무관
마감일
채용 시 마감
이 공고를
주변에도 알려주세요