Recruitment background

Data Pipeline Engineer Intern

씨그로|2026. 8. 27. 게시|
11

공고 요약

경력20년 이하
채용 유형전환형인턴
학력무관
지역서울
마감일마감
출처그룹바이

담당업무

  • Prefect 스케줄 run 상태와 자가치유 flow 동작 점검

  • BigQuery mart와 PostgreSQL DB의 최신 파티션 생성 여부 확인

  • 실패한 flow run의 에러 코드 분류 및 1차 대응

  • raw JSONL, 로그, 원본 파일, DB 테이블 기반 데이터 정합성 조사

  • 원천 플랫폼·API 응답·내부 mart 간 수치 불일치 원인 재현 및 조사 결과 문서화

  • 신규 채널 데이터 파이프라인 개발 및 dbt 모델링

  • 표준화된 staging·mart 데이터 구조 설계

  • 데이터 적재 로직 구축, 쿼리 성능 최적화, 필터링 기능 구현

  • 데이터 품질 검증 자동화 테스트 작성 및 데이터 누락·이상 징후 탐지 구조 개선

  • Claude Code 서브에이전트를 활용한 반복 운영 절차·규칙 정형화

  • 알람·uptime·메트릭 관측성 구축 및 클라우드 리소스·쿼리 비용 최적화

  • spec 승인부터 zod contracts, Fastify API, Next.js web 구현 및 pnpm verify 통과까지 기능 수직 슬라이스 개발

  • packages/contracts의 zod 스키마를 기준으로 BE safeParse와 FE parse 일치

  • Python·FastAPI 레거시의 엑셀 업로드 파싱 방어 등 v1 국소 버그 수정

  • 파이프라인과 연계된 제품 화면 검증 및 예외 처리 설계 참여

자격요건

  • Claude Code 등 AI 코딩 도구로 결과물을 완성한 경험

  • AI 결과물의 오류 발견 및 교정 방법 설명 능력

  • 검증되지 않은 수정 사항의 push를 방지하기 위한 장치 설계 경험

  • 추측과 확인된 사실을 구분하고 확인 필요 사항을 명확히 밝히는 태도

  • SQL 집계 쿼리 작성 경험

  • JOIN과 GROUP BY를 활용한 수치 산출 경험

우대사항

  • 데이터 파이프라인 구축 후 일정 기간 운영한 경험

  • 헬스체크 알림 구성 및 장애·복구 기록 보유

  • 부분 수집, 환불 소급, 부가세 포함·제외 등을 고려한 데이터 불일치 원인 규명 경험

  • dbt incremental 모델, 외부 테이블, BigQuery 파티션 필터 비용 개념 이해

  • API 요청·응답, 인증, 상태 코드, rate limit 등 HTTP·네트워크 디버깅 경험

  • 매출, 수수료, VAT, 취소·환불의 과거 소급 구조 등 이커머스·재무 도메인 이해

  • AI 도메인 지식 및 인프라 세팅 경험

근무환경

  • 유연출근제

  • 1분 단위 휴가

  • 개인 휴게시간

  • 원격근무 없음

마감기한

상시채용

공고 원문

주요업무

이런 일을 해요 업무의 중심은 데이터 파이프라인 운영과 개선이에요. 70여 개 채널에서 들어오는 데이터가 매일 정확하게 쌓이도록 지키고, 새 채널을 붙이고, 반복되는 대응을 알람과 문서로 줄여나가는 일이에요. 저희가 가장 경계하는 장애 유형은 하나예요. 배치는 성공으로 기록됐지만 실제 데이터는 적재되지 않은 경우예요. 이 원인을 mart → staging → raw 원본 순으로 내려가며 규명하는 역량이 이 포지션에 상시 요구돼요. 매일 하는 일 - 파이프라인 운영 — Prefect에서 스케줄 run 상태와 자가치유 flow 동작 여부를 확인하고, BigQuery mart와 PostgreSQL DB의 최신 파티션이 전일 기준까지 정상적으로 생성됐는지 점검해요. - 장애 1차 트리아지 — 실패한 flow run의 에러 코드를 고객 조치·사내 조치·외부 벤더 문제로 분류하고 대응해요. - 정합성 조사 — “수집은 됐는데 컬럼이 전부 NULL”인 유형의 신고가 접수되면 raw JSONL을 직접 열어 원본에 값이 존재하는지부터 확인해요. UI가 아니라 로그·원본 파일·DB 테이블을 진실 원천으로 삼아요. - 협업 기반 데이터 품질 관리 — CX·PM 및 고객사가 확인하는 기준을 함께 정리하고, 원천 플랫폼·API 응답·내부 mart 사이에서 수치가 달라지는 원인을 재현하고 설명 가능한 조사 결과로 남겨요. 만들고 개선하는 일 신규 채널 데이터 파이프라인 개발 및 dbt 모델링 — 서로 다른 채널의 원천 데이터를 표준화된 staging·mart 구조로 변환하고, 확장 가능하고 유지보수할 수 있는 데이터 모델을 설계해요. 기업용 데이터 적재 로직 구축과 쿼리 성능 최적화, 필터링 기능 구현에 참여해요. 데이터 품질 검증을 위한 자동화 테스트를 작성하고, 데이터 누락과 이상 징후를 조기에 발견할 수 있는 구조를 개선해요. AI 기반 운영 자동화(AX) — Claude Code 서브에이전트로 반복 운영을 절차서와 규칙으로 정형화하고, 알람·uptime·메트릭 관측성을 붙여 회사 인프라로 남겨요. 파이프라인의 쿼리·적재 성능뿐 아니라 클라우드 리소스와 쿼리 비용까지 고려해 운영 효율을 개선해요. 제품 개발도 일부 함께해요 Cigro v2가 표시하는 수치는 위 파이프라인에서 생성돼요. 그래서 장애를 조사한 경험이 그대로 화면의 검증과 예외 처리 설계로 이어져요. 파이프라인 업무와 맞물리는 범위에서 제품 개발에도 참여해요. 기능 수직 슬라이스 구현 — spec 승인 → contracts(zod) → api(Fastify) → web(Next.js) → pnpm verify 통과까지가 완료의 정의예요. 계약 기반 개발 — packages/contracts의 zod 스키마를 단일 계약 소스로 두고, BE의 safeParse와 FE의 parse를 함께 일치시켜요. v1 국소 버그 수정 — 운영 중인 Python·FastAPI 레거시의 엑셀 업로드 파싱 방어 등을 문서화된 선례에 따라 수행해요. TypeScript와 Python 두 스택을 함께 다루는 것이 이 포지션 업무의 일부예요.

자격요건

이런 분과 함께하고 싶어요 필수 요건 Claude Code 등 AI 코딩 도구로 결과물을 완성해 본 경험 규모는 작아도 괜찮아요. 다만 AI가 틀렸을 때 어떻게 발견하고 교정했는지, 검증 없이 push하지 않기 위해 어떤 장치를 뒀는지는 설명하실 수 있어야 해요. 저희 시스템은 멀티테넌트 구조이기 때문에 검증되지 않은 수정 하나가 여러 고객사의 데이터에 그대로 증폭될 수 있어요. 추측과 확인된 사실을 구분하는 태도 불확실한 사항을 사실처럼 단정하지 않고, 확인이 필요한 부분을 명확히 밝힐 수 있어야 해요. 문서와 업무 모두 확인된 사실만 기재하는 것이 원칙이에요. 다른 역량은 교육할 수 있지만 이 태도는 교육만으로 형성하기 어렵다고 판단해요. SQL 집계 쿼리 작성 경험 JOIN과 GROUP BY를 사용해 원하는 수치를 산출해 본 수준이면 충분해요.

우대사항

이런 분이면 더 좋아요 아래 내용은 필수 요건이 아니라 강점이 되는 경험이에요. 파이프라인 운영 경험 — 구축에 그치지 않고 일정 기간 운영해 본 경험. 헬스체크 알림 구성, 장애 및 복구 기록이 남아 있으면 강점이에요. 데이터 불일치의 원인을 규명해 본 경험 — 정산서·엑셀 다운로드·매출 수치가 일치하지 않는 문제를 부분 수집, 환불 소급, 부가세 포함·제외까지 짚어 정리해 본 경험이면 충분해요. dbt·BigQuery — incremental 모델, 외부 테이블, 파티션 필터의 비용 개념을 이해하고 있으면 좋아요. HTTP·네트워크 디버깅 — API 요청·응답, 인증, 상태 코드, rate limit 등의 문제를 추적해 본 경험이 있으면 좋아요. 이커머스·재무 도메인 — 매출, 수수료, VAT, 취소·환불의 과거 소급 구조를 이해하고 있으면 좋아요. AI 도메인 지식 및 인프라 세팅 경험

기술스택

TypeScript, Python, SQL, BigQuery, dbt, Claude Code

이런 공고는 어때요?

워트인텔리전스

워트인텔리전스

7년~20년 · 정규직 · 서울

Data Engineer: Ontology 전문가 (7년 이상)#그래프설계  #지식그래프
상시
그룹바이그룹바이
13
울트라 텐던시 코리아

울트라 텐던시 코리아

20년 이하 · 정규직 · 해외

[100%재택]데이터브릭스 레지던트 솔루션 아키텍트#데이터브릭스  #아키텍처설계
상시
그룹바이그룹바이
46
어쎈드(ASCEND)

어쎈드(ASCEND)

10년 이하 · 정규직 · 서울

Quantitative Research Engineer#퀀트트레이딩  #트레이딩개발  #재택가능
상시
그룹바이그룹바이
792
페이스웹

페이스웹

20년 이하 · 정규직 · 서울

SLM Modeling & Data Engineering#데이터자산화  #파인튜닝  #의료AI
상시
그룹바이그룹바이
76
미리비트

미리비트

10년 이하 · 정규직 · 경기

빅데이터 엔지니어,서버 백엔드 엔지니어 (인메모리 기반)#파이프라인  #실시간데이터  #빅데이터
상시
그룹바이그룹바이
653
워트인텔리전스

워트인텔리전스

10년~15년 · 정규직 · 서울

Senior Data Engineer (10년 이상) | 시니어 데이터 플랫폼 엔지니어#시용기간  #아키텍처설계  #데이터플랫폼
상시
그룹바이그룹바이
4
앰플랩

앰플랩

3년~20년 · 정규직 · 대전

Field AI Solutions Engineer#데이터설계  #AI자동화  #스마트팩토리
상시
그룹바이그룹바이
7
스텝에이아이

스텝에이아이

20년 이하 · 정규직 · 서울

[팀 스케일업] AI 풀스택 개발자 (LLM 파이프라인 · 대규모 데이터 수집)#B2BAI  #대용량데이터  #LLM파이프라인
상시
그룹바이그룹바이
152
미리디

미리디

3년~6년 · 정규직 · 서울

[미리디] Data Engineer#레이크하우스  #데이터엔지니어  #디자인플랫폼
상시
그룹바이그룹바이
41
콕스웨이브

콕스웨이브

3년~7년 · 정규직 · 서울

[AX AgentX] 데이터 엔지니어(RAG/LLM Pipeline)#LLMOps  #ETL파이프라인  #AI솔루션
상시
그룹바이그룹바이
42
미리비트

미리비트

3년~10년 · 정규직 · 경기

데이터 플랫폼 엔지니어 (3년차~PL) Spark · Airflow · K8s#스트리밍  #빅데이터
상시
그룹바이그룹바이
62
그로잉랩

그로잉랩

3년~9년 · 정규직 · 서울

개인투자자의 블룸버그, '버틀러'의 데이터 엔진을 구축할 시니어 엔지니어#연봉1억이상  #핀테크  #ETL파이프라인
상시
그룹바이그룹바이
202
페이스웹

페이스웹

20년 이하 · 정규직 · 서울

AI 학습데이터 · SLM 운영 담당#파인튜닝  #데이터정제  #의료AI
상시
그룹바이그룹바이
43
피에프씨테크놀로지스

피에프씨테크놀로지스

7년 이상 · 정규직 · 서울

B2B Senior Data Engineer(시니어 데이터 엔지니어)-Databricks#핀테크  #데이터플랫폼  #시차출퇴근
상시
그룹바이그룹바이
1
미리비트

미리비트

3년~10년 · 정규직 · 경기

데이터 플랫폼 엔지니어#숙소지원  #마이그레이션  #데이터플랫폼
상시
그룹바이그룹바이
71
위시켓

위시켓

3년~10년 · 정규직 · 서울

AIDP FDE(Forward Deployed Engineer) (3년 ~ 12년)#BI구축  #데이터솔루션  #원격근무
상시
그룹바이그룹바이
44
피에프씨테크놀로지스

피에프씨테크놀로지스

3년 이상 · 정규직 · 서울

B2B Data Engineer(B2B 데이터 엔지니어) - Databricks#레이크하우스  #핀테크  #시차출퇴근
상시
그룹바이그룹바이
1
레브잇

레브잇

20년 이하 · 정규직 · 서울

[쇼포트] Product Engineer (Web Scraping)#이커머스  #대용량트래픽  #웹스크래핑
상시
그룹바이그룹바이
162
페이스웹

페이스웹

9년 이하 · 정규직 · 서울

[FACEWEB] 의료 SLM/LLM 엔지니어: Fine-tuning·STT·RAG•경량화#파인튜닝  #인공지능
상시
그룹바이그룹바이
98
포트로직스

포트로직스

5년 이상 · 정규직 · 경기

[FDE] Forward Deployed Engineer - 플랫폼셀#AI에이전트  #포워딩  #데이터통합
상시
그룹바이그룹바이
3