MOLLKOM / AI 与机器学习

研究工程师 — AI 评测与智能体可靠性 (Research Engineer, AI Evaluation & Agent Reliability)

告别主观感知,用严谨的数据量化 AI 质量,赋能科学决策。

沙特阿拉伯利雅得混合办公高级 (Senior)开放申请中

我们的使命

商业成果的落地,绝不能仅仅满足于语言通顺。你需要设计科学的评测体系,精准区分文采、事实准确度与任务完成度,助力团队推出具备明确量化收益的产品迭代。

岗位职责

  • 针对目录构建、内容生成、客服对话及工具调用等任务搭建全面的基准测试集。
  • 设计评测指标体系,结合人机混合评估,深入分析一致性、偏见与评测覆盖度。
  • 针对权限越权、虚假无支撑陈述等风险构建回归测试与对抗性测试套件。
  • 深入分析实验指标与多模型对比,提炼可落地的工程洞察并指出统计学局限。

任职要求

  • 具备机器学习评测、应用研究或 AI 质量工程领域的实操经验。
  • 精通 Python、统计数据分析以及科学的实验设计方法。
  • 深刻理解 LLM-as-a-judge 的局限性、数据泄漏风险与评测偏差成因。
  • 沟通清晰利落,擅长将数据评测结论高效转化为具体的工程优化举措。

展现你的专业思考

用你的作品开启我们的第一场对话。

分享一个你主导设计的评测方案,并说明它如何影响了版本上线或模型选型决策。

可提供公开作品链接或简短阐述,注意请勿透露前司的机密或敏感信息。

关于 Mollkom

Mollkom 是一体化 AI 商业操作系统。我们将商品建档、图文内容、营销投放与客户服务,与订单、库存、线下门店及终端履约紧密联结,让每一个业务步骤都在统一的知识语境下顺畅协同。

探索平台
申请此岗位