MOLLKOM / ИИ и машинное обучение

Research Engineer, AI Evaluation & Agent Reliability

Превращайте субъективную оценку качества ИИ в доказательную базу для взвешенных решений.

Эр-Рияд, Саудовская АравияГибридный форматSeniorПрием заявок открыт

Наша миссия

Коммерческий результат требует большего, чем просто гладкий текст. Создавайте системы оценки, отделяющие красивый стиль от фактической точности и реального выполнения действий, помогая команде выпускать релизы с измеримой отдачей.

Чем предстоит заниматься

  • Создавать бенчмарки для задач каталога, генерации контента, клиентских диалогов и использования внешних инструментов.
  • Разрабатывать критерии и пайплайны автоматической и экспертной оценки с анализом согласованности, смещений и полноты покрытия.
  • Создавать регрессионные и состязательные (adversarial) тесты для контроля прав доступа и недопустимых утверждений.
  • Анализировать эксперименты и сравнения моделей, формулируя практические выводы с указанием статистических ограничений.

Что мы ожидаем от вас

  • Опыт оценки качества ML, прикладных исследований или обеспечения качества ИИ-систем.
  • Уверенный Python, навыки анализа данных и проектирования экспериментов.
  • Понимание ограничений подхода LLM-as-judge, утечки данных (data leakage) и смещений оценки.
  • Умение прозрачно доносить результаты и переводить аналитические выводы в конкретные инженерные задачи.

ПОКАЖИТЕ СВОЙ ПОДХОД К ДЕЛУ

Пусть ваши проекты расскажут о вас сами.

Расскажите о разработанной вами методике оценки и о том, как она повлияла на решение о релизе или выборе модели.

Поделитесь публичными ссылками или кратким описанием кейсов, не раскрывая конфиденциальную информацию с прошлых мест работы.

О Mollkom

Mollkom — операционная среда для коммерции на базе ИИ. Мы объединяем работу с каталогом, контент, маркетинг и клиентский сервис с заказами, складом, кассой и доставкой, чтобы все процессы опирались на единую базу знаний.

О платформе
Откликнуться на вакансию