인기 검색

AI Systems Research and Development Engineer – LLM Inference Systems & Optimization
공고 요약
담당업무
분산 서빙, 런타임 시스템, GPU 실행 및 성능 핵심 커널을 포함한 고성능 LLM 추론 시스템 설계·개발
추론 지연시간, 생성 속도, 처리량, 메모리 효율, 확장성 및 비용 최적화 기법 개발
Speculative decoding, parallel decoding, prefill/decode disaggregation, adaptive parallelism, continuous batching, scheduling, KV-cache 관리, quantization 및 통신 최적화 탐구
새로운 모델 아키텍처·하드웨어·워크로드에 맞춰 실행 전략과 시스템 구성을 자동 최적화하는 지능형 추론 시스템 개발
자동 프로파일링, 병목 식별, 구성 탐색, 코드 생성, 실험, 런타임 전략 선택, 디버깅 및 성능 튜닝에 AI-native 방식 적용
고성능 시스템 문제를 독립적으로 발굴하고 가설 수립, 프로토타이핑, 연구 아이디어의 프로덕션 적용까지 주도
GPU와 노드 간 tensor, sequence, pipeline, data, expert parallelism을 활용한 분산 추론 전략 설계
멀티모델 서빙, 동적 자원 관리, 모델 로딩·교체 및 워크로드 기반 스케줄링 개발
Attention, MoE, 통신 등 성능 핵심 모델 구성요소의 GPU 커널 및 연산자 분석·최적화
컴퓨팅, 메모리, 통신, 네트워크, 스케줄링 및 모델 실행 병목 파악을 위한 엔드투엔드 워크로드 프로파일링·벤치마킹
모델 연구자, 인프라 및 제품 팀과 협업하여 연구 혁신을 프로덕션에 배포
기술 블로그와 시스템·머신러닝 학회에 혁신 기술 공개 및 발표
자격요건
LLM 추론 시스템, 분산 AI 시스템, GPU 시스템 또는 고성능 컴퓨팅 경험
현대적인 LLM 추론 아키텍처와 대규모 모델 서빙의 성능 트레이드오프에 대한 이해
vLLM, SGLang, TensorRT-LLM 등 LLM 추론·서빙 프레임워크 실무 경험
스케줄링, 배칭, KV-cache 관리, 분산 실행, 병렬화, speculative decoding 또는 disaggregated serving 관련 런타임 설계·확장·최적화 경험
GPU 아키텍처 이해 및 CUDA, Triton 등 GPU 프로그래밍 환경 경험
CUTLASS, cuBLAS, cuDNN 등 성능 중심 라이브러리·프레임워크 경험
Nsight Systems, Nsight Compute 또는 동등한 도구를 활용한 엔드투엔드 시스템 성능 프로파일링·진단 경험
제한된 지시 아래 중요한 문제를 식별하고 기술적 질문을 정의하며 해결책을 추진하는 역량
모델, 런타임, 분산 시스템 및 하드웨어 계층을 아우르는 엔드투엔드 성능 트레이드오프 분석 역량
연구·엔지니어링·제품 팀과 효과적으로 협업할 수 있는 커뮤니케이션 역량
우대사항
AI-native 엔지니어링 방식으로 소프트웨어 개발, 실험, 디버깅, 최적화 또는 시스템 적응을 가속한 경험
보상과 복리후생
기본 연봉 $236,000 - $309,750
보너스 및 equity plan 참여
의료·치과·시력·생명·장애 보험
401(k) 퇴직연금 제도
유연 지출 계정 및 건강 저축 계정
최소 12일의 유급 공휴일
유급휴가
부모휴가
직원 지원 프로그램 및 기타 회사 복리후생
지원방법
Snowflake Careers Site에서 APPLY NOW를 통해 지원
근무환경
AI Research 팀과의 연구·개발 협업
모델 연구자, 인프라 팀 및 제품 팀과의 협업
연구 혁신의 프로덕션 적용
기술 블로그 및 시스템·머신러닝 학회 발표와 오픈소스 활동
마감기한
상시채용
스노우플레이크 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
댓글
스노우플레이크에 맞는
이력서로 자동 수정하기