인기 검색

공고 요약
담당업무
고객사 Agent Workflow 실패 사례 분석 및 재현 가능한 데이터·평가 문제 구축
Agent 실행 정보 수집, 위험 탐지, 실행 중단·재시도·대체 경로·Human-in-the-loop 기능 구현
trace, event schema, 판단 API와 제어 기능 설계·구현
규칙·정책 기반 검증, LLM 기반 평가, ML 기반 이상 탐지
failure taxonomy와 benchmark 데이터셋 구축
Grader, human evaluation 및 자동화된 평가 파이프라인 구현
실험 코드의 테스트 가능하고 관찰 가능한 프로덕션 코드 전환
연구 질문 발굴, 실험·benchmark 수행 및 평가 결과 분석
Agent Reliability, failure attribution, online auditing, anomaly detection, runtime control 관련 연구
연구 결과의 논문·특허·기술 보고서 작성 기여
자격요건
Python 기반 데이터 처리, ML 실험 또는 AI 기능 구현 역량
Transformer와 LLM 기본 원리 이해
PyTorch, Hugging Face 등 ML Framework 활용 경험
ReAct, Tool-using Agent 또는 Multi-Agent System 설계·개발 경험
논문·기술 자료의 아이디어를 코드와 실험으로 구현하는 역량
가설·평가 기준·비교 대상 설정 및 실험 결과 기반 의사결정 역량
작성한 코드의 테스트 및 재사용 가능한 형태로 개선하는 태도
새로운 문제를 학습하고 동료와 협업해 해결하는 역량
실험 과정과 기술적 판단을 문서와 말로 설명하는 역량
역할범위
경력 수준에 따른 연구 또는 기능 과제 수행
연구·개발 과제 독립 수행 및 동료의 설계·실험 리뷰
고객사별 해법의 공통 원리 도출 및 표준 Krewa와 Trust System 기능화
연구 결과의 실제 제품 적용 및 안정적인 프로덕션 환경 검증
복리후생
식대지원
마감기한
상시채용
콕스웨이브 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
소개
[AX Team, krewa] • krewa는 기업이 AI에게 중요한 업무를 위임할 수 있는 운영 기반을 만들어요. • AI 모델은 이미 문서를 읽고, 판단하고, 도구를 사용할 만큼 강력해졌어요. 하지만 기업 현장에서는 여전히 사람이 결과를 전부 다시 확인해요. 80%가 맞아도 어느 20%가 틀렸는지 모르면 결국 100%를 검토해야 하니까요. AI가 아직 '초안 도우미'에 머물러 있고 이 상태로는 중요한 업무를 AI에게 맡길 수 없어요. • krewa는 이걸 모델 성능이 아니라 실행 구조로 풀고 있어요. AI Worker가 업무를 수행하고, Trust System이 실행 전 과정을 검증해요. 위험이 감지되면 실행을 멈추고 사람의 판단을 받은 뒤 다시 이어가요. 그 판단은 다음 실행을 더 정확하고 안전하게 만드는 데 활용돼요. • 이를 통해 사람의 판단이 필요해 자동화하기 어려웠던 반복 업무까지 AI에게 위임할 수 있게 해요. 직원은 반복적인 처리와 검토에서 벗어나, 자신의 전문성이 더 필요한 일에 집중할 수 있어요. • AI가 업무를 돕는 시대에서, 업무를 맡는 시대로. krewa는 AI가 기업 운영의 한 축이 되는 미래를 만들고 있어요. [krewa 를 만들어온 여정] • AI를 평가하는 데서, 실행을 통제하는 데까지 -- AI가 내린 판단과 업무 수행 과정을 검증하는 일은 콕스웨이브가 2021년부터 풀어온 문제예요. -- AI Agent 성능 평가 솔루션을 운영하며 300개 이상의 글로벌 고객사에 품질 평가와 분석 기능을 제공했어요. -- 금융 고객사의 실제 업무 데이터를 월 수십만 건 규모로 분석하고 평가하고 있어요. -- 독자 파운데이션 모델의 지시 이행 성능을 평가하는 기준을 만들고, 평가 데이터의 품질을 검증했어요. -- 2025년부터 AI의 이상 행동을 탐지하는 기술을 개발하고 있어요. -- AI 실행 통제 관련 국가 표준화 작업에 참여하고 있어요. -- 행정안전부, 국가인공지능위원회 등 여러 기관에 AI Agent 통제 기술을 자문했어요. • 연구를 넘어, 제품과 시장에서 증명해 왔어요 -- 우리는 기술을 연구하는 데서 멈추지 않고, 실제 제품과 고객의 성과로 연결해 왔어요. -- 국내 최초의 생성형 AI 서비스 매각 사례를 만들었어요. -- 2023년부터 Microsoft의 Agent Orchestration 오픈소스 프로젝트에 코어 컨트리뷰터로 참여하고 있어요. -- Meta, PwC 등 글로벌 기업의 AX 프로젝트를 수행하고, 현대차를 비롯한 여러 기업에 AI Agent 연구와 개발을 자문했어요. -- NVIDIA, Anthropic, OpenAI 등 글로벌 기술 기업과 협업하고 파트너십을 구축했어요. -- Anthropic, OpenAI와 서밋과 해커톤을 공동 개최하며 국내 AI 생태계의 성장을 함께 만들어 왔어요. [지금 krewa 팀에 합류한다는 것] • krewa는 아이디어만 있는 단계도, 답이 모두 정해진 단계도 아니에요. 고객사와 실제 Agent 를 만들며 반복적으로 나타나는 문제를 발견하고, 그 해법을 표준 Krewa와 Trust System의 공통 기능으로 발전시키는 단계에 있어요. • Agent는 여러 단계에 걸쳐 판단하고 도구를 사용하기 때문에 최종 결과만 확인해서는 어디서 왜 실패했는지 알기 어려워요. 형식이나 정책을 위반할 수 있고, 근거 없이 판단하거나 잘못된 도구를 호출할 수도 있어요. 개별 판단은 맞더라도 전체 실행 흐름이 의도와 다르게 진행될 수도 있어요. • 우리는 이런 실패를 사후에 평가하는 데서 멈추지 않으려고 해요. Agent의 실행을 관찰하고, 위험을 탐지하고, 원인을 추적하고, 필요한 경우 실행을 중단하거나 사람의 판단을 요청할 수 있는 Trust System을 만들고 있어요. • Trust System은 특정 Agent Framework에 종속되지 않는 독립적인 시스템을 지향해요. krewa뿐 아니라 다른 Agent Workflow에도 연결할 수 있도록 공통 실행 정보와 판단 인터페이스를 설계해야 해요. 동시에 고객 현장의 구체적인 실패를 실제로 해결하면서, 어떤 기술이 제품에서 유효한지 증명해야 해요. [이런 분과 함께하고 싶어요] • 이 포지션은 Agent의 실패를 연구하고, 이를 실제로 탐지하고 통제할 수 있는 Trust System의 기능으로 구현하는 Research Engineer예요. • 논문을 읽고 실험하는 데서 끝나지 않아요. 고객 환경에서 발견한 실패를 데이터와 평가 문제로 구체화하고, 탐지 모델과 평가 파이프라인을 구현하며, 검증된 결과를 동료 연구자 및 엔지니어와 함께 실제 제품에 적용해요. 제품 개발 과정에서 얻은 결과는 다시 연구로 발전시켜 논문과 특허로 남겨요. • 경력 수준에 따라 명확하게 정의된 연구 또는 기능을 맡는 것부터, 하나의 연구·개발 과제를 독립적으로 이끌고 동료의 설계와 실험을 리뷰하는 것까지 역할 범위가 달라질 수 있어요. • 연차보다 실제로 해결해 본 문제와 성장 가능성을 중요하게 봐요. 모든 경험을 이미 갖춘 사람보다, 자신의 강점이 분명하고 부족한 부분을 동료와 함께 빠르게 학습하며 결과를 완성할 수 있는 사람을 찾아요. [합류 후 함께할 일] • 고객사의 실제 Agent Workflow에서 발생하는 실패 사례를 분석하고, 재현 가능한 데이터와 평가 문제로 만들어요. • Agent의 실행 정보를 수집하고 위험을 탐지하며, 필요한 경우 실행을 중단하거나 사람의 승인을 요청할 수 있는 Trust System을 함께 구축해요. • 특정 고객을 위해 만든 해법에서 공통 요소를 찾아 표준 Krewa에 적용할 수 있는 기능으로 발전시켜요. • 제품 문제에서 연구 질문을 발굴하고, 실험과 benchmark를 구축하여 탑티어 학회 논문과 특허에 기여해요. • 연구 결과가 실험에 머물지 않고 안정적인 프로덕션 시스템에서 작동하도록 연구자 및 엔지니어와 함께 구현하고 검증해요.
주요업무
• Trust System 기술 전략 및 아키텍처 -- Agent의 어떤 실패를 다룰지 함께 정의하고, 이를 판단하기 위해 필요한 실행 정보와 신호를 탐색해요. -- krewa와 외부 Agent Workflow에 연결되는 trace, event schema, 판단 API와 제어 기능을 설계하고 구현해요. -- 탐지 정확도뿐 아니라 오탐과 미탐, 응답 지연, 비용, 설명 가능성 및 운영 안정성을 실험하고 개선해요. • Agent 오류 탐지 및 실행 통제 -- 규칙과 정책 기반 검증, LLM 기반 평가, ML 기반 이상 탐지 등을 활용하여 Agent의 오류와 의도하지 않은 행동을 탐지해요. -- 환각, 추론 오류, 정책 위반, 잘못된 도구 호출, 일관성 오류 등 주요 실패의 원인을 실행 단계별로 분석해요. -- 위험 수준과 판단 근거에 따라 실행 허용, 중단, 재시도, 대체 경로 또는 Human-in-the-loop로 연결되는 기능을 구현해요. • 평가 체계 및 개선 루프 -- Agent의 실패를 일관되게 분류할 수 있는 failure taxonomy와 benchmark 데이터셋을 만들어요. -- Grader, human evaluation 및 자동화된 평가 파이프라인을 구현하고 평가 결과의 신뢰도와 재현성을 검증해요. -- 실행 결과와 사람의 피드백을 prompt, retrieval, memory, workflow와 Trust System 개선으로 연결해요. • Research-to-Production -- 최신 연구를 읽고 핵심 아이디어를 빠르게 구현하여 실제 제품 문제에 유효한지 실험해요. -- 실험 코드를 테스트 가능하고 관찰 가능한 프로덕션 코드로 발전시키고 실제 환경에서 운영 결과를 확인해요. -- 고객사별 구현에서 공통 원리와 재사용 가능한 기능을 찾아 표준 Krewa와 Trust System의 제품 자산으로 만들어요. • 논문 및 지식재산화 -- Agent Reliability, failure attribution, online auditing, anomaly detection, runtime control 등 제품과 연결되는 연구에 참여해요. -- 재현 가능한 실험을 설계하고 결과를 분석하며, 경력과 기여 범위에 따라 논문 작성 및 투고를 주도하거나 공동 저자로 참여해요. -- 업무 과정에서 발견한 독창적인 기술을 특허와 기술 보고서로 정리하는 데 기여해요.
자격요건
• Python을 사용하여 데이터 처리, ML 실험 또는 AI 기능을 구현할 수 있어요. • Transformer와 LLM의 기본적인 동작 원리를 이해하고, PyTorch, Hugging Face 등 ML Framework를 활용할 수 있어요. • ReAct, Tool-using Agent 또는 Multi-Agent System을 직접 설계하고 개발해 본 경험이 있어요. • 논문이나 기술 자료의 아이디어를 이해하고 실행 가능한 코드와 실험으로 옮길 수 있어요. • 가설, 평가 기준과 비교 대상을 세우고 실험 결과를 근거로 다음 행동을 결정할 수 있어요. • 자신이 작성한 코드를 테스트하고, 동료가 이해하고 재사용할 수 있는 형태로 개선하려고 노력해요. • 익숙하지 않은 문제를 만났을 때 필요한 내용을 학습하고 동료와 협업하여 끝까지 해결할 수 있어요. • 자신의 실험 과정과 기술적 판단을 문서와 말로 명확하게 설명할 수 있어요.
우대사항
• LLM 또는 Agent 기능을 연구하거나 실제 서비스에 적용해 본 경험이 있어요. • Benchmark, LLM-as-a-Judge, human evaluation 또는 online monitoring을 구현해 본 경험이 있어요. • Agent의 오류, reliability, safety, observability 또는 runtime control 문제를 다뤄 본 경험이 있어요. • 대규모 비정형 문서를 OCR, layout detection, table extraction 또는 multimodal model로 구조화하고, 출처 추적성과 품질 및 처리 비용을 함께 개선해 본 경험이 있어요. • Agent Memory의 검색, 충돌 해소, 버전 관리, provenance 및 lifecycle을 설계하거나 실험해 본 경험이 있어요. • 평가 결과와 사용자 피드백을 prompt, retrieval, memory 또는 workflow 개선으로 연결하는 자동화된 loop를 구축해 본 경험이 있어요. • NeurIPS, ICML, ICLR, ACL, EMNLP 등 주요 학회 논문에 참여하거나, 자신의 연구 결과를 논문 또는 기술 보고서로 완결해 본 경험이 있어요. • 자신의 기술적 성과를 특허로 출원하거나 등록해 본 경험이 있어요. • 컴퓨터공학, 인공지능 또는 관련 분야의 학위를 보유했거나 그에 준하는 연구·개발 경험이 있어요.
혜택 및 복지
• 자율 출근제(오전 8시~11시) 및 재택 근무(주1회) 제도 운영 • 최신 업무 장비 제공 • 근로계약 외 별도 식대 소정 제공 • 간식 및 음료 제공 • 월간 팀 회식비 지원 • 경조사 지원 및 근속 연차별 포상 제도 운영 • Claude 등 AI 도구 구독 지원 • 업무 관련 도서 지원 • 업무 유관 컨퍼런스 참가비 지원
댓글
콕스웨이브에 맞는
이력서로 자동 수정하기