MOLLKOM / IA e machine learning
Research Engineer, AI Evaluation & Agent Reliability
Trasforma la qualità dell'IA da una percezione soggettiva a evidenze concrete per decisioni migliori.
La missione
Nel commercio servono più che risposte fluide. Progetta valutazioni capaci di distinguere una buona prosa da informazioni corrette e azioni portate a termine, aiutando il team a rilasciare miglioramenti dall'impatto misurabile.
Di cosa ti occuperai
- Crea benchmark per compiti su catalogo, contenuti, conversazioni e utilizzo dei tool.
- Sviluppa rubriche di valutazione umana e automatica con analisi di concordanza, bias e copertura.
- Sviluppa test di regressione e test avversari su permessi, allucinazioni e affermazioni non verificate.
- Analizza esperimenti e confronti tra modelli, comunicando indicazioni operative e limiti statistici in modo chiaro.
Cosa cerchiamo
- Esperienza nella valutazione di modelli ML, ricerca applicata o ingegneria della qualità dell'IA.
- Solida competenza in Python, analisi dei dati e progettazione sperimentale.
- Profonda comprensione dei limiti di LLM-as-a-judge, data leakage e bias di valutazione.
- Capacità di comunicare i risultati con chiarezza e tradurre le scoperte in miglioramenti architetturali.
MOSTRACI COME RAGIONI
Lascia che siano i tuoi progetti a parlare.
Raccontaci una suite di valutazione che hai progettato e come ha guidato una decisione di rilascio o di selezione del modello.
Condividi link pubblici o una sintesi dei tuoi progetti, senza rivelare informazioni riservate relative a precedenti incarichi.
Chi siamo
Mollkom è un ambiente operativo per il commercio basato sull'IA. Unifichiamo preparazione dei prodotti, contenuti, marketing e assistenza clienti con ordini, inventario, punto vendita e spedizioni, affinché ogni passaggio tragga vantaggio da una base di conoscenza comune.
Scopri la piattaforma