MOLLKOM / AI & maskinlæring

Research Engineer, AI Evaluation & Agent Reliability

Gør AI-kvalitet fra en mavefornemmelse til dokumenteret viden, der skaber bedre beslutninger.

Riyadh, Saudi-ArabienHybridSeniorÅben for ansøgninger

Missionen

Kommerciel værdi kræver mere end blot velskrevne svar. Design evalueringer, der skelner mellem godt sprog, korrekte fakta og fuldførte handlinger, så teamet kan lancere forbedringer med målbar effekt.

Hvad du kommer til at arbejde med

  • Opbyg benchmarks for kataloghåndtering, indhold, samtaler og værktøjsbaserede handlinger.
  • Design evalueringskriterier og menneskelige/automatiserede test med analyse af overensstemmelse, bias og dækning.
  • Udvikl regressions- og modstridende tests mod rettighedsbrud og udokumenterede påstande.
  • Analyser eksperimenter og modelsammenligninger, og formidl handlingsorienterede konklusioner og statistiske usikkerheder.

Det bringer du med

  • Erfaring med ML-evaluering, anvendt forskning eller kvalitetssikring af AI.
  • Stærke kompetencer i Python, dataanalyse og forsøgsdesign.
  • Forståelse for begrænsningerne ved LLM-as-a-judge, datalækage og evalueringsbias.
  • Evne til at formidle resultater klart og omsætte indsigter til tekniske produktforbedringer.

VIS HVORDAN DU TÆNKER

Lad dit arbejde indlede dialogen.

Del en evaluering, du har designet, og hvordan den påvirkede en release eller et modelvalg.

Del gerne offentlige links eller en kort beskrivelse uden at afsløre fortrolige oplysninger fra tidligere stillinger.

Om Mollkom

Mollkom er et AI-drevet styresystem til digital handel. Vi forbinder klargøring af produkter, indhold, markedsføring og kundeservice med ordrer, lager, kassesystemer og levering, så hele kæden drives ud fra én fælles viden.

Lær platformen at kende
Søg denne stilling