MOLLKOM / AI & machine learning

Research Engineer, AI Evaluation & Agent Reliability

Verander AI-kwaliteit van een subjectieve indruk naar onderbouwde feiten voor betere besluiten.

Riyad, Saoedi-ArabiëHybrideSeniorSollicitaties geopend

De missie

Succes in commerce vraagt om meer dan vloeiend geformuleerde antwoorden. Ontwerp evaluaties die helder onderscheid maken tussen goede schrijfstijl, feitelijke juistheid en geslaagde acties, zodat het team updates met meetbare impact kan uitrollen.

Wat u gaat doen

  • Bouw benchmarks voor catalogus-, content-, conversatie- en toolgebruikstaken.
  • Ontwerp evaluatierubrieken en menselijke/geautomatiseerde beoordelingen met analyses van inter-beoordelaarsbetrouwbaarheid, bias en dekking.
  • Ontwikkel regressie- en 'adversarial'-tests voor permissies en ongegronde claims.
  • Analyseer experimenten en modelvergelijkingen en vertaal statistische uitkomsten naar heldere, bruikbare inzichten.

Wat u meebrengt

  • Ervaring met ML-evaluatie, toegepast onderzoek of kwaliteitsborging van AI-systemen.
  • Sterke Python-skills, bedreven in data-analyse en experimentontwerp.
  • Grondig inzicht in de beperkingen van LLM-as-a-judge, datalekken en evaluatiebias.
  • Sterke communicatieve vaardigheden om bevindingen om te zetten in concrete technische verbeteringen.

LAAT ZIEN HOE U DENKT

Laat uw werk het startpunt zijn van het gesprek.

Deel een door u opgezette evaluatie en laat zien hoe deze een release of modelselectie heeft beïnvloed.

Deel openbare links of een beknopte toelichting zonder vertrouwelijke gegevens van eerdere werkgevers prijs te geven.

Over Mollkom

Mollkom is een AI-gestuurde commerciële werkomgeving. We verbinden productinname, content, marketing en klantenservice naadloos met orders, voorraad, kassa en bezorging, zodat alle processen werken vanuit dezelfde centrale data.

Ontdek het platform
Solliciteer op deze functie