MOLLKOM / AI og maskinlæring

Research Engineer, AI Evaluation & Agent Reliability

Gjør AI-kvalitet om fra subjektive inntrykk til dokumenterte fakta for bedre beslutninger.

Riyadh, Saudi-ArabiaHybridSeniorÅpen for søknader

Oppdraget

Gode resultater innen handel krever mer enn velskrevet tekst. Utvikle evalueringer som skiller god formuleringsevne, korrekt informasjon og faktisk utført handling, slik at teamet kan rulle ut forbedringer med målbar effekt.

Hva du vil jobbe med

  • Bygg ytelsestester (benchmarks) for varekatalog, innhold, kundesamtaler og verktøybruk.
  • Utform evalueringskriterier samt manuelle og automatiserte tester med analyser av samstemmighet, skjevhet og dekningsgrad.
  • Utvikle regresjonstester og motstandstester (adversarial testing) for tilganger og udokumenterte påstander.
  • Analyser eksperimenter og modellsammenligninger, og formidle handlingsrettede funn og statistiske begrensninger.

Hva du tar med deg

  • Erfaring med evaluering av maskinlæring, anvendt forskning eller kvalitetsutvikling for AI.
  • Sterke ferdigheter i Python, dataanalyse og design av eksperimenter.
  • Forståelse for begrensningene ved LLM-as-a-judge, datalekkasje og evalueringsskjevhet.
  • Evne til å formidle resultater tydelig og omsette innsikt til tekniske forbedringer.

VIS HVORDAN DU TENKER

La arbeidet ditt åpne samtalen.

Del en evaluering du har utformet, og hvordan den påvirket en produksjonssetting eller et modellvalg.

Del offentlige lenker eller en kort beskrivelse, uten å oppgi konfidensiell informasjon fra tidligere arbeidsforhold.

Om Mollkom

Mollkom er et AI-drevet driftsmiljø for handel. Vi samler produktklargjøring, innhold, markedsføring og kundeservice med ordre, lager, kassesystem og levering, slik at alle ledd opererer ut fra felles kunnskap.

Møt plattformen
Søk på denne stillingen