MOLLKOM / IA et Machine Learning
Research Engineer, Évaluation de l'IA et fiabilité des agents
Faites de la qualité de l'IA une preuve tangible pour guider de meilleures décisions.
La mission
Le succès commercial exige plus que des réponses bien rédigées. Concevez des évaluations différenciant fluidité du style, exactitude des données et succès des actions, afin d'aider l'équipe à déployer des améliorations aux effets quantifiables.
Vos missions au quotidien
- Établir des benchmarks pour le catalogue, le contenu, les conversations et l'utilisation d'outils.
- Concevoir des grilles d'évaluation manuelles et automatisées avec analyse de consensus, des biais et de la couverture.
- Développer des tests de non-régression et contradictoires portant sur les permissions et les affirmations non vérifiées.
- Analyser les tests comparatifs de modèles, en communiquant des recommandations concrètes et leurs limites statistiques.
Votre profil
- Expérience en évaluation de modèles de ML, recherche appliquée ou ingénierie de la qualité IA.
- Maîtrise approfondie de Python, de l'analyse de données et de la conception de protocoles de test.
- Compréhension des limites du recours aux LLM comme juges, des fuites de données et des biais d'évaluation.
- Facilité à restituer des résultats avec clarté et à les traduire en améliorations techniques concrètes.
DÉMONTREZ VOTRE APPROCHE
Laissez vos réalisations parler pour vous.
Présentez un protocole d'évaluation que vous avez conçu et son incidence sur un déploiement ou un choix de modèle.
Partagez des liens publics ou une synthèse sans divulguer d'informations confidentielles issues de vos postes précédents.
À propos de Mollkom
Mollkom est un environnement opérationnel unifié pour le commerce propulsé par l'IA. Nous connectons le catalogage, le contenu, le marketing et le service client aux commandes, aux stocks, au point de vente et à la livraison, pour des flux basés sur une connaissance partagée.
Découvrir la plateforme