MOLLKOM / ШІ та машинне навчання
Research Engineer, AI Evaluation & Agent Reliability
Перетворюйте суб'єктивні враження про якість ШІ на переконливі докази для рішень команди.
Наша місія
Для реального комерційного результату замало красивих формулювань. Створюйте методики тестування, які відокремлюють гарний стиль від фактичної точності та успішності виконаної дії, допомагаючи впроваджувати оновлення з вимірюваним ефектом.
Чим ви займатиметеся
- Створювати бенчмарки для завдань каталогу, генерації контенту, діалогів і роботи з інструментами.
- Розробляти критерії ручної й автоматизованої оцінки з аналізом узгодженості, упередженості та повноти охоплення.
- Створювати регресійні та змагальні (adversarial) тести для перевірки дотримання прав доступу й захисту від недостовірних тверджень.
- Аналізувати результати експериментів і порівняння моделей, формулюючи практичні інженерні висновки з урахуванням статистичних обмежень.
Що ми очікуємо від вас
- Досвід у сфері ML-оцінювання, прикладних досліджень або контролю якості систем штучного інтелекту.
- Впевнене володіння Python, навички аналізу даних і проєктування експериментів.
- Розуміння обмежень підходу LLM-as-a-judge, проблеми витоку даних (data leakage) та оціночних зміщень.
- Вміння чітко презентувати висновки та переводити аналітичні знахідки в конкретні інженерні кроки.
ПОКАЖІТЬ СВІЙ ПІДХІД
Нехай ваші результати скажуть самі за себе.
Розкажіть про розроблену вами систему тестування та про те, як вона вплинула на реліз чи вибір моделі.
Поділіться відкритими посиланнями або коротким описом проєктів без розголошення конфіденційної інформації з попередніх місць роботи.
Про Mollkom
Mollkom — це інтегроване операційне середовище для торгівлі з ШІ-можливостями. Ми поєднуємо роботу з каталогом, створення контенту, маркетинг і клієнтську підтримку із замовленнями, складом, касами та доставкою, формуючи єдиний контекст для всіх процесів.
Про платформу