MOLLKOM / IA y aprendizaje automático
Research Engineer, AI Evaluation & Agent Reliability
Transforma la calidad de la IA de una mera impresión en evidencia contrastada para tomar mejores decisiones.
La misión
Los resultados comerciales exigen más que respuestas fluidas. Diseña evaluaciones que diferencien entre buena redacción, datos correctos y acciones completadas con éxito, ayudando al equipo a desplegar mejoras con impacto medible.
En qué trabajarás
- Construir benchmarks para tareas de catálogo, contenido, conversaciones y uso de herramientas.
- Diseñar rúbricas y sistemas de evaluación humanos y automatizados con análisis de concordancia, sesgos y cobertura.
- Desarrollar pruebas de regresión y análisis adversariales para permisos y afirmaciones no sustentadas.
- Analizar experimentos y comparaciones entre modelos, comunicando hallazgos accionables y límites estadísticos.
Qué aportarás
- Experiencia en evaluación de ML, investigación aplicada o ingeniería de calidad de IA.
- Sólidos conocimientos de Python, análisis de datos y diseño experimental.
- Comprensión de las limitaciones de LLM-as-judge, fuga de datos (data leakage) y sesgos de evaluación.
- Capacidad para comunicar resultados de forma clara y trasladar conclusiones a mejoras de ingeniería.
MUESTRA TU ENFOQUE
Deja que tu trabajo inicie la conversación.
Comparte una evaluación que hayas diseñado y cómo influyó en una decisión de despliegue o selección de modelo.
Comparte enlaces públicos o una breve explicación sin desvelar datos confidenciales de proyectos anteriores.
Acerca de Mollkom
Mollkom es un entorno operativo de comercio impulsado por IA. Conectamos la preparación de producto, contenido, marketing y atención al cliente con pedidos, inventario, punto de venta y reparto, para que cada fase opere desde una base de conocimiento unificada.
Conoce la plataforma