MOLLKOM / ИИ и машинное обучение
Research Engineer, AI Evaluation & Agent Reliability
Превращайте субъективную оценку качества ИИ в доказательную базу для взвешенных решений.
Наша миссия
Коммерческий результат требует большего, чем просто гладкий текст. Создавайте системы оценки, отделяющие красивый стиль от фактической точности и реального выполнения действий, помогая команде выпускать релизы с измеримой отдачей.
Чем предстоит заниматься
- Создавать бенчмарки для задач каталога, генерации контента, клиентских диалогов и использования внешних инструментов.
- Разрабатывать критерии и пайплайны автоматической и экспертной оценки с анализом согласованности, смещений и полноты покрытия.
- Создавать регрессионные и состязательные (adversarial) тесты для контроля прав доступа и недопустимых утверждений.
- Анализировать эксперименты и сравнения моделей, формулируя практические выводы с указанием статистических ограничений.
Что мы ожидаем от вас
- Опыт оценки качества ML, прикладных исследований или обеспечения качества ИИ-систем.
- Уверенный Python, навыки анализа данных и проектирования экспериментов.
- Понимание ограничений подхода LLM-as-judge, утечки данных (data leakage) и смещений оценки.
- Умение прозрачно доносить результаты и переводить аналитические выводы в конкретные инженерные задачи.
ПОКАЖИТЕ СВОЙ ПОДХОД К ДЕЛУ
Пусть ваши проекты расскажут о вас сами.
Расскажите о разработанной вами методике оценки и о том, как она повлияла на решение о релизе или выборе модели.
Поделитесь публичными ссылками или кратким описанием кейсов, не раскрывая конфиденциальную информацию с прошлых мест работы.
О Mollkom
Mollkom — операционная среда для коммерции на базе ИИ. Мы объединяем работу с каталогом, контент, маркетинг и клиентский сервис с заказами, складом, кассой и доставкой, чтобы все процессы опирались на единую базу знаний.
О платформе