Recruitment background

Site Reliability Engineer

토스플레이스|2026. 7. 23. 게시|
84

공고 원문

경력7년 이상
채용 유형정규직
학력무관
지역서울
마감일마감
출처원티드

소개

[합류하게 될 팀에 대해 알려드려요] • 토스플레이스는 결제 단말기와 POS를 비롯해 사장님의 매장 운영을 돕는 다양한 제품과 서비스를 만들고 있어요. 장애가 고객의 결제 경험과 매장 운영에 직접 영향을 줄 수 있는 만큼, 서비스의 신뢰성을 중요한 제품 가치로 생각해요. • SRE는 특정 서버나 인프라에 한정되지 않고, 토스플레이스가 제공하는 모든 서비스의 신뢰성을 사용자 관점에서 고민해요. 결제 단말기와 POS를 비롯한 클라이언트에서 네트워크, 서버와 외부 시스템으로 이어지는 흐름을 살피며 각 영역의 엔지니어와 함께 문제를 해결해요. • Server Platform Team에 속해 Server Developer, DevOps Engineer, DBA뿐 아니라 각 제품팀의 Frontend Developer, Hardware Engineer 등 다양한 영역의 동료와 협업해요. 각 제품팀은 자신이 만드는 서비스의 안정성을 책임지고, SRE는 공통 신뢰성 기준을 만들며 여러 제품을 가로지르는 문제를 함께 해결해요. • Observability 환경을 지속적으로 고도화하면서, 토스플레이스의 신뢰성을 어떻게 정의하고 측정할지 기준을 정립해요. 장애를 더 빠르게 발견하고 대응하며, 그 경험을 시스템 개선으로 연결하는 방식도 함께 만들어가요. • 토스플레이스의 SRE 역할과 업무 방식을 처음부터 정의하고, 신뢰성 기준과 실행 방법을 조직에 정착시켜 갈 첫 멤버를 기다리고 있어요.

주요업무

[합류하면 함께할 업무예요] • 토스플레이스의 주요 제품과 사용자 흐름을 파악하고 서비스 중요도를 분류해, 각 중요도에 맞는 신뢰성 기준을 정립해요. • 결제와 매장 운영에 중요한 사용자 흐름부터 가용성, 지연시간과 정확성 등 사용자 경험을 나타내는 SLI와 SLO를 정의하고, 관측 데이터를 바탕으로 지속적으로 개선해요. • Metric과 Log 등 관측 데이터를 엔드투엔드 흐름과 사용자 영향 중심으로 연결하고, 이상 징후와 장애 원인을 빠르게 파악할 수 있도록 Observability와 Alert 체계를 고도화해요. • 주요 장애의 대응을 조율하고 Post-mortem을 주도해요. 장애에서 얻은 학습을 코드, 자동화, 아키텍처와 프로세스 개선으로 연결해 반복 장애를 줄여요. • 서비스별 Alert와 Runbook의 소유권, 장애 등급, 1차 대응과 Escalation 기준을 정립하고 토스플레이스에 적합한 Incident Management 체계를 발전시켜요. • SPOF, 성능 병목, 용량 한계와 잠재적 실패 지점을 찾아 개선해요. 성능 테스트와 용량 계획, 안전하게 통제된 Fault Injection을 통해 장애 전파 경로와 시스템의 복구 방식을 검증해요. • 문제의 성격에 따라 제품팀과 함께 제품 코드를 개선하고, 공통 플랫폼에 필요한 기능과 진단, 복구 도구는 직접 개발해요. 반복적인 진단과 복구 작업은 자동화로 줄여 나가요.

자격요건

[이런 분과 함께하고 싶어요] • 하나 이상의 프로그래밍 언어를 이용해 프로덕션 코드와 운영 도구를 개발하고 개선할 수 있는 분을 찾아요. • 운영 중인 서비스의 장애 대응과 원인 분석을 주도하고, 코드, 자동화, 아키텍처 개선을 통해 재발을 방지해 본 분을 찾아요. • 특정 기술 계층에 한정되지 않고, 가설과 데이터를 바탕으로 애플리케이션, OS, Network, Infrastructure 등 여러 계층에서 문제의 원인을 추적할 수 있는 분을 찾아요. • 분산 시스템의 가용성, 지연시간, 성능과 용량을 나타내는 지표를 정의하고, 이를 바탕으로 신뢰성 문제를 구조적으로 개선해 본 분을 찾아요. • AWS 등 Public Cloud 환경에서 Kubernetes 기반의 프로덕션 서비스를 운영하고 트러블슈팅해 본 분을 찾아요. • 신뢰성 기준이나 장애 대응 체계를 수립, 개선하고, 여러 제품팀과 우선순위를 조율하며 이를 조직의 업무 방식으로 정착시켜 본 분과 함께하고 싶어요.

우대사항

[이런 분이면 더 좋아요] • SLI, SLO 또는 Error Budget을 정의하고 실제 서비스 운영과 의사결정에 활용해 본 경험이 있으면 좋아요. • Incident Management, Post-mortem 또는 Reliability Review 체계를 만들거나 개선해 본 경험이 있으면 좋아요. • 클라이언트부터 서버와 외부 시스템까지 이어지는 엔드투엔드 흐름에서 장애를 분석하고 해결해 본 경험이 있으면 좋아요. • 결제처럼 장애나 데이터 정합성 문제가 고객과 비즈니스에 직접적인 영향을 주는 Mission-Critical 서비스를 운영해 본 경험이 있으면 좋아요. • Istio 등 Service Mesh 환경에서 서비스 간 트래픽 흐름과 장애 전파 경로를 분석하고 개선해 본 경험이 있으면 좋아요. • Fault Injection 실험이나 장애 복구 훈련을 설계하고, 시스템의 복원력을 검증, 개선해 본 경험이 있으면 좋아요. • Java/Kotlin과 Spring Ecosystem을 이용해 제품 또는 플랫폼 코드를 개발해 본 경험이 있으면 좋아요.

혜택 및 복지

[이렇게 일해요] • 자율과 책임의 문화: 토스는 Manager가 아닌 Maker들로 구성된 조직으로, 투명한 정보 공유와 수평적인 문화 속에서 구성원 업무에 대한 위임과 신뢰를 바탕으로 세상을 변화 시켜 나가고자 합니다. • 효율적인 업무방식: 가장 중요하고, 큰 영향을 미칠 수 있는 일에 집중합니다. 획일적인 업무 프로세스보다는 데이터 기반의 사고로 적극적으로 토론하며, 가장 효율적인 문제 해결을 위해 협업하고 실행합니다. • 훌륭한 팀과 동료: 각 분야 최고 수준의 역량을 갖춘 인재들이 자율과 책임의 원칙 아래 뛰어난 역량을 발휘하고 있습니다. [함께할 동료를 위한 한마디] "복잡한 오프라인의 문제를 해결하며, 전체 시스템을 직접 설계하고 주도하는 압도적인 성장을 경험하고 있어요." • 오프라인 결제 환경에서는 온라인보다 훨씬 다양한 변수와 예외를 마주하게 돼요. • 서버 플랫폼 팀은 이런 환경에서도 서비스가 안정적으로 운영될 수 있도록 공통 모듈과 플랫폼 서비스를 만들고, 장애를 더 빠르게 감지하고 회복할 수 있는 기반을 계속 개선하고 있어요. • 합류하시면 특정 서비스 하나가 아니라 전체 시스템을 더 나은 방향으로 설계하고 운영하는 경험을 할 수 있어요. 기술적 오너십을 가지고 깊이 기여하고 싶은 분, 좋은 동료들과 함께 답을 만들어가며 성장하고 싶은 분께 정말 좋은 팀이에요. [이런 지원을 받아요] 1. 자율과 효율의 근무 환경을 제공합니다. • 자율 출퇴근 제도 • 자율 휴가 / 재택근무 • Early Friday & OFF Week 2. 업무와 성장에 몰두할 수 있게끔 지원합니다. • 비포괄임금제 운영 • 업무 관련 비용 100% 지원 • 최고급 장비 및 소프트웨어 제공 • 반기별 성과급 지급 • 매월 통신비 및 체력단련비 지원 • 명절 상여금 및 생일축하비 • 직장단체보험비(가족 포함) 및 경조사비 • 인재추천비 3. 먹고 마시는 것까지 회사가 책임집니다. • 법인카드 전원 지급 (점심/저녁 식사비용, 야간교통비 등 100% 지원) • 사내카페 커피 Silo 무료 이용 • 사내 편의점, 헤어살롱 등 복지시설 무료 이용

이런 공고는 어때요?

엘리스그룹

엘리스그룹

5년~10년 · 정규직 · 서울

시니어 인프라 네트워크 엔지니어#네트워크설계  #GPU클러스터  #AI데이터센터
상시
그룹바이그룹바이
10
미리비트

미리비트

5년~10년 · 정규직 · 경기

K8s 기반 인증·인가 시스템 백엔드 엔지니어#OPA  #인증인가시스템  #Java백엔드
상시
그룹바이그룹바이
42
vox.ai

vox.ai

1년~9년 · 정규직 · 서울

Voice Agent Infrastructure Engineer#음성AI  #실시간미디어  #인프라엔지니어
상시
그룹바이그룹바이
89
몬드리안에이아이

몬드리안에이아이

5년~20년 · 정규직 · 인천

AI 인프라 엔지니어 리더 채용#AI인프라  #MLops구축
상시
그룹바이그룹바이
14
피트인

피트인

7년~10년 · 정규직 · 기타

백엔드 엔지니어#대용량트래픽  #전기차  #AWS비용최적화
상시
그룹바이그룹바이
12
와탭랩스

와탭랩스

6년~10년 · 정규직 · 서울

Kubernetes 에이전트 개발자#메트릭파이프라인  #SaaS  #복지포인트
상시
그룹바이그룹바이
56
더페어글로벌

더페어글로벌

4년~10년 · 정규직 · 서울

백엔드 개발자 (Python)#FastAPI  #하이브리드근무  #커머스
상시
그룹바이그룹바이
92
블리츠다이나믹스

블리츠다이나믹스

3년~10년 · 정규직 · 서울

AI 에이전트 SRE/시스템 안정성 엔지니어#AI인프라  #CICD구축
상시
그룹바이그룹바이
31
윤회

윤회

3년~10년 · 정규직 · 서울

[백엔드] DPP 플랫폼 엔지니어#DPP시스템  #순환경제  #SaaS설계
상시
그룹바이그룹바이
88
메크랩

메크랩

3년~10년 · 정규직 · 기타

시뮬레이션 SaaS 설계/구축/보안/시스템 엔지니어#시스템설계  #SaaS  #재택가능
상시
그룹바이그룹바이
69
프라임엔시스템

프라임엔시스템

1년~20년 · 정규직 · 서울

서버 관리자 (System Engineer)#서버운영  #자격증보유시  #IT인프라
상시
그룹바이그룹바이
19
페이타랩

페이타랩

10년 이하 · 정규직 · 서울

[No.1 카페주문앱 패스오더] DevOps Engineer#MSA운영  #클라우드
상시
그룹바이그룹바이
868
클루닉스

클루닉스

8년~20년 · 정규직 · 서울

[서울] AI/HPC 플랫폼 개발 경력직 채용#AIHPC  #플랫폼개발  #GPU자원
상시
그룹바이그룹바이
17
미리디

미리디

8년~20년 · 정규직 · 서울

[미리캔버스] DevOps Part Lead#IaC고도화  #EKS전환  #디자인플랫폼
상시
그룹바이그룹바이
12
알엑스

알엑스

5년~10년 · 정규직 · 서울

AI Agent 서비스 개발 경력 채용#플랫폼개발  #AI플랫폼
상시
그룹바이그룹바이
112
두노소프트

두노소프트

9년~20년 · 계약직 외 1개 · 서울

금융권 서버운영 SE/SM (가산IDC야간/고급/1년이상) 계약직,프리랜서 #서버운영  #주간근무  #데이터센터
상시
그룹바이그룹바이
3
데이터라이즈

데이터라이즈

3년 이상 · 정규직 · 서울

Backend Engineer#이커머스  #대용량처리  #재택가능
상시
그룹바이그룹바이
58
미리비트

미리비트

3년~10년 · 정규직 · 경기

Kubernetes 엔지니어 (PL / 3년 이상)#쿠버네티스  #빅데이터
상시
그룹바이그룹바이
410
엘리스그룹

엘리스그룹

5년~10년 · 정규직 · 서울

시니어 인프라 시스템 엔지니어#Linux  #GPU클러스터  #인프라설계
상시
그룹바이그룹바이
8
북엔드

북엔드

3년~10년 · 정규직 · 대전

백엔드 개발자#결제구독설계  #출판AI  #재택가능
상시
그룹바이그룹바이
252