Jobverse
DevOps Engineer · South Korea

Site Reliability Engineer (Senior)

vessl-ai·Seoul

🇰🇷 KO

View & apply on company site →

ABOUT THE ROLE

VESSL AI의 Senior Site Reliability Engineer는 VESSL GPU 클라우드 플랫폼의 가용성과 성능을 책임지며, 개별 장애 대응을 넘어 시스템 설계와 아키텍처 결정을 리드합니다. Observability와 자동화 체계를 구축하는 데 그치지 않고, 장애가 발생하기 전에 구조적 리스크를 발견해 제거하며, 팀 전반의 안정성 관행을 수립합니다.

그만큼 안정성이 중요한 건, VESSL GPU 클라우드 플랫폼이 대규모 GPU 클러스터, InfiniBand·RoCE 기반 고성능 네트워크, Kubernetes·Slurm 기반 스케줄링 시스템 등 여러 레이어로 구성되어 있기 때문입니다. GPU 워크로드는 몇 시간에서 몇 주까지 이어지는 경우가 많고, 노드 하나의 장애나 네트워크 지연만으로도 진행 중이던 학습·추론 작업 전체가 중단될 수 있어 일반적인 웹 서비스보다 훨씬 높은 수준의 안정성이 요구됩니다. 이를 위해 GPU, NIC, 드라이버, 커널에서부터 스케줄러, 네트워크 패브릭에 이르기까지 시스템 전 레이어의 상태를 지속적으로 모니터링하고, 장애가 발생했을 때 원인을 빠르게 좁혀 복구하며, 반복되는 운영 작업을 자동화로 줄여나가는 기능 구현 역할이 중요합니다.

WHAT YOU WILL DO

  • Reliability & Observability: 메트릭·로그·트레이스 등 Observability 스택을 구축하고, SLI/SLO를 정의해 플랫폼의 안정성을 정량적으로 추적
  • Incident Response Leadership: 주요 장애 발생 시 대응을 리드하고, Root Cause Analysis와 Postmortem을 통해 재발을 방지하며 장기적인 안정성 개선 과제로 연결
  • Architecture & Design: GPU 클러스터, 네트워크, 스케줄링 시스템 등 인프라 레이어의 설계에 참여해 안정성·확장성 관점의 의사결정을 주도
  • Automation & Tooling: 반복되는 운영 작업(Toil)을 제거하는 자동화 도구·프레임워크를 직접 구축하고, 여러 팀이 함께 사용할 수 있는 형태로 다듬어 운영
  • Proactive Reliability: 장애가 발생하기 전에 구조적 리스크(단일 장애점, 용량 한계 등)를 발견하고 제거하는 예방적 개선 과제를 주도
  • Capacity 검증 지원: 신규 인프라 배포 시 팀 내 Supply 조직과 협업하여 East-West/North-South 네트워크 구성, 스토리지 처리량, BIOS·펌웨어 설정 등 운영 관점의 요구사항을 정의하고 검증을 리드
  • 팀 프랙티스 정립 및 멘토링: On-call 정책, Runbook, 알림 기준 등 팀의 안정성 프랙티스를 개선하고 주니어 엔지니어를 멘토링

QUALIFICATIONS

  • 컴퓨터공학, 전자공학, AI 등 관련 전공 학사 이상 학위 혹은 이에 준하는 실무 경험
  • 5년 이상의 Software/Site Reliability Engineering 경험
  • GPU/TPU/NPU 등 가속기 기반으로 상용 학습/인퍼런스 시스템을 구축/운영해 본 경험
  • Linux 시스템의 유저 스페이스와 커널 스페이스에 대한 깊은 이해와 트러블슈팅 경험
  • Python, Go 등의 언어로 자동화 도구·프레임워크를 직접 설계하고 구축해 본 경험
  • Kubernetes, Docker 등 컨테이너 오케스트레이션 환경을 운영해 본 경험
  • 대규모 서비스의 장애 대응을 주도적으로 리드하고 Postmortem을 작성해 본 경험
  • 여러 팀에 걸친 시스템 설계·안정성 관련 기술적 의사결정을 이끌어 본 경험
  • On-call 로테이션에 참여 가능하신 분

HELPFUL EXPERIENCE (NOT REQUIRED)

  • InfiniBand/RoCEv2 등 고성능 네트워크 기반 멀티노드 클러스터 환경 운영 경험
  • GPU, NVLink, InfiniBand 등 하드웨어·드라이버 레벨 이슈를 직접 디버깅해 본 경험
  • Slurm, Kubernetes 기반 GPU 스케줄링 환경을 대규모로 설계·운영해 본 경험
  • 대규모 서비스의 장애 대응을 리드하고 Postmortem을 작성해 본 경험
  • 여러 해에 걸쳐 핵심 프로덕션 시스템을 지속적으로 소유하고 발전시켜 본 경험
  • 주니어 엔지니어를 멘토링하고 팀의 기술 표준을 정립해 본 경험
  • perf, eBPF, strace, kernel crash dump 등 저수준 Linux 디버깅 도구 활용 경험
  • WEKA / VAST / Ceph / Hammerspace 등 고성능 병렬 스토리지 구축/운영 경험
  • DiRT, Chaos Engineering 등 선제적 안정성 확보 프랙티스를 설계·운영해 본 경험

LIFE & BENEFIT

함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원

  • 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
  • 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
  • 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
  • 구성원 간의 1on1 음료 지원

업무 생산성을 높여 몰입할 수 있는 환경

  • 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
  • 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
  • 월 1회 Allhands + Team Gathering 통한 업무 공유
  • 늦은 시간까지 근무 시, 야근식대/택시비 지원
  • 구성원 간의 1on1 음료 지원

몰입한 만큼 휴식과 생활 편의 지원

  • 개인 간식비 지원 (월 한도)
  • 장기근속자 리프레시 휴가 제공
  • 종합건강검진비 및 휴가 지원 (연 1회)
  • 입사 N주년 축하 선물 제공
  • 생일 반차 휴가 제공
  • 명절 선물, 각종 휴가 및 경조금 지원
  • 본인 및 배우자 출산휴가비 지원

JOINNING PROCESS

서류전형 → Coding Test → Technical Interview → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.

  • 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.
  • 지원서 (경력 세부 기술) 및 포트폴리오 (또는 Git 링크)를 필수로 제출해주세요. (양식 자유)
  • Technical Interview는 개발 실무자가 참여하며, 구조 설계 및 구현 방식 등 기술 중심의 대화로 문제 해결 역량을 파악하는 시간으로 최대 2시간 정도 소요됩니다.
  • Resume/Culture Interview는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.
  • 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.
  • 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.
  • 근무 형태
  • 정규직 (수습 3개월)
  • 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.
View & apply on company site →

Sourced from a public career listing. Jobverse is an aggregator, not the employer.

← All DevOps Engineer jobs