MOLLKOM / AI & 머신러닝

Research Engineer, AI Evaluation & Agent Reliability

AI 품질을 주관적 인상에서 더 나은 의사결정을 위한 객관적 데이터로 전환합니다.

사우디아라비아 리야드하이브리드시니어 (Senior)지원 접수 중

미션

커머스 성과는 유려한 답변만으로는 달성되지 않습니다. 문장의 유창함, 정보의 정확성, 작업의 완결성을 명확히 구분 평가하여 팀이 측정 가능한 성과를 바탕으로 기능을 배포할 수 있도록 지원합니다.

담당 업무

  • 카탈로그, 콘텐츠, 대화, 도구 활용 작업에 대한 종합 벤치마크를 구축합니다.
  • 평가 기준표(루브릭)를 설계하고 일치도, 편향, 커버리지 분석을 포함한 사람/자동화 평가 파이프라인을 운영합니다.
  • 권한 우회 및 근거 없는 주장(환각)을 방지하기 위한 리그레션 및 적대적(Adversarial) 테스트를 개발합니다.
  • 실험과 모델 비교 결과를 분석하여 실행 가능한 인사이트와 통계적 한계를 명확히 전달합니다.

자격 요건

  • 머신러닝 평가, 응용 연구 또는 AI 품질 엔지니어링 실무 경험.
  • 우수한 Python 역량, 데이터 분석 및 엄밀한 실험 설계 능력.
  • LLM-as-a-judge의 한계점, 데이터 유출, 평가 편향에 대한 깊은 이해.
  • 분석 결과를 명확히 커뮤니케이션하고 인사이트를 엔지니어링 개선점으로 전환할 수 있는 역량.

당신의 문제 해결 방식을 보여주세요

결과물로 당신의 역량을 보여주세요.

직접 설계한 평가 체계와 그것이 모델 선택이나 배포 결정에 어떻게 결정적인 영향을 주었는지 공유해 주세요.

이전 직장의 기밀 정보가 노출되지 않는 선에서 공개 링크나 간단한 프로젝트 설명을 공유해 주세요.

Mollkom 소개

Mollkom은 AI 기반 커머스 운영 환경입니다. 상품 등록, 콘텐츠, 마케팅, 고객 응대를 주문, 재고, POS, 배송과 하나로 연결하여 모든 단계가 하나의 공유된 지식 위에서 유기적으로 작동하도록 만듭니다.

플랫폼 알아보기
이 포지션에 지원하기