MOLLKOM / IA e Machine Learning
Research Engineer, AI Evaluation & Agent Reliability
Transforme a qualidade da inteligência artificial de mera impressão em evidências sólidas para decisões melhores.
Nossa missão
Resultados no comércio eletrônico demandam muito mais do que respostas bem escritas. Projete baterias de avaliação que diferenciem fluência verbal, precisão de dados e conclusão efetiva de ações, ajudando a equipe a lançar melhorias com impactos mensuráveis.
Seus desafios
- Desenvolver benchmarks para tarefas de catálogo, geração de conteúdo, conversas e uso de ferramentas.
- Estruturar rubricas e metodologias de avaliação humana e automatizada, com análise de concordância, viés e cobertura.
- Criar testes de regressão e testes adversariais focados em controle de permissões e prevenção de respostas não autorizadas.
- Analisar experimentos e comparações de modelos, traduzindo resultados em orientações práticas com clareza dos limites estatísticos.
O que buscamos em você
- Experiência em avaliação de modelos de ML, pesquisa aplicada ou engenharia focada na qualidade de IA.
- Domínio de Python, análise estatística de dados e metodologia de experimentação.
- Compreensão aprofundada dos limites de LLM-as-a-judge, vazamento de dados de treino e vieses de avaliação.
- Habilidade para comunicar resultados com clareza e transformar análises em melhorias de engenharia.
MOSTRE SUA FORMA DE PENSAR
Deixe seus projetos abrirem as portas.
Compartilhe uma avaliação que você desenhou e explique como ela determinou um deploy ou a escolha de um modelo.
Compartilhe links públicos ou uma síntese clara dos projetos, preservando eventuais informações confidenciais de trabalhos anteriores.
Sobre a Mollkom
A Mollkom é um ambiente operacional de comércio impulsionado por inteligência artificial. Integramos o cadastro de produtos, conteúdo, marketing e atendimento com pedidos, estoque, ponto de venda e frete, garantindo que todas as etapas operem com dados unificados.
Conheça a plataforma