MOLLKOM / IA e machine learning

Research Engineer, AI Evaluation & Agent Reliability

Trasforma la qualità dell'IA da una percezione soggettiva a evidenze concrete per decisioni migliori.

Riad, Arabia SauditaIbridoSeniorCandidature aperte

La missione

Nel commercio servono più che risposte fluide. Progetta valutazioni capaci di distinguere una buona prosa da informazioni corrette e azioni portate a termine, aiutando il team a rilasciare miglioramenti dall'impatto misurabile.

Di cosa ti occuperai

  • Crea benchmark per compiti su catalogo, contenuti, conversazioni e utilizzo dei tool.
  • Sviluppa rubriche di valutazione umana e automatica con analisi di concordanza, bias e copertura.
  • Sviluppa test di regressione e test avversari su permessi, allucinazioni e affermazioni non verificate.
  • Analizza esperimenti e confronti tra modelli, comunicando indicazioni operative e limiti statistici in modo chiaro.

Cosa cerchiamo

  • Esperienza nella valutazione di modelli ML, ricerca applicata o ingegneria della qualità dell'IA.
  • Solida competenza in Python, analisi dei dati e progettazione sperimentale.
  • Profonda comprensione dei limiti di LLM-as-a-judge, data leakage e bias di valutazione.
  • Capacità di comunicare i risultati con chiarezza e tradurre le scoperte in miglioramenti architetturali.

MOSTRACI COME RAGIONI

Lascia che siano i tuoi progetti a parlare.

Raccontaci una suite di valutazione che hai progettato e come ha guidato una decisione di rilascio o di selezione del modello.

Condividi link pubblici o una sintesi dei tuoi progetti, senza rivelare informazioni riservate relative a precedenti incarichi.

Chi siamo

Mollkom è un ambiente operativo per il commercio basato sull'IA. Unifichiamo preparazione dei prodotti, contenuti, marketing e assistenza clienti con ordini, inventario, punto vendita e spedizioni, affinché ogni passaggio tragga vantaggio da una base di conoscenza comune.

Scopri la piattaforma
Candidati per questa posizione