Recruitment background
오늘 공고

Sr. Data Center GPU Validation and Debug Engineer

AMD|2026. 9. 11. 게시|
0

공고 요약

경력5년 이상
채용 유형정규직
학력학사
지역해외
마감일상시채용
출처직행

담당업무

  • 데이터센터 GPU 제품의 소프트웨어·하드웨어 전체 스택 검증 및 디버깅

  • GPU hang, crash, memory fault, firmware 오류, 성능 저하 분석

  • 장애 재현 및 최소 실행 가능한 테스트 케이스 도출

  • GPU, CPU, 메모리, 네트워킹, 전력, 플랫폼 토폴로지 간 시스템 수준 상호작용 분석

  • GPU 플랫폼·펌웨어·소프트웨어 릴리스의 AI, HPC, 통신 워크로드 검증

  • 컴퓨팅·메모리·통신 병목 특성화 및 성능 분석

  • 단일·다중 GPU의 워크로드 구성, NUMA, 전력, 열 조건별 동작 분석

  • 벤치마크·기준선·회귀 감지 방법 수립 및 마이크로벤치마크와 실제 워크로드 결과 상관 분석

  • 자동화 진단, 스트레스 테스트, 성능 테스트, 회귀 테스트 인프라 구축

  • 고객 환경 기반 검증 및 에스컬레이션 장애 재현 지원

자격요건

  • Linux 및 시스템 엔지니어링 경험

  • C/C++, Python, shell 자동화 경험

  • 데이터센터 GPU, 가속기 또는 고성능 시스템 경험

  • GPU 아키텍처, 메모리 계층, 병렬 실행, 통신, 동기화 이해

  • 소프트웨어·펌웨어·커널·하드웨어 경계 전반의 디버깅 경험

  • 로그, 트레이스, 하드웨어 텔레메트리, 성능 카운터 분석 능력

  • 비자 스폰서십 미제공

우대사항

  • Linux 커널 드라이버, PCIe, 펌웨어 연동, 메모리 관리 지식

  • ROCm/HIP, RCCL 또는 CUDA 기반 GPU 프로그래밍 모델·런타임 경험

  • PyTorch, vLLM, SGLang 등 AI 학습·추론 프레임워크 경험

  • AI 추론·학습 또는 HPC 워크로드 벤치마킹, roofline 분석, 모델 수준 프로파일링 경험

  • 프로파일링 도구, 통계 분석, 회귀 감지 경험

  • 다중 GPU 토폴로지, PCIe·패브릭 인터커넥트, NUMA, GPU 펌웨어, RAS, 랙 스케일 플랫폼 경험

  • 시스템 bring-up, qualification 또는 데이터센터 운영 경험

  • CI 시스템, 자동화 검증 인프라, 대규모 플릿 테스트 경험

근무환경

하이브리드 근무

마감기한

상시채용

AMD 지원하기 전 이력서 Check

시간이 없다면 AI와 한번에 수정해보세요

공고 원문

AMD Sr. Data Center GPU Validation and Debug Engineer 채용공고
이런 공고 어때요?
지금 많이 보는 공고

댓글