MOLLKOM / AI & maskininlärning

Research Engineer, AI Evaluation & Agent Reliability

Omvandla upplevelsen av AI-kvalitet till konkreta bevis för bättre beslut.

Riyadh, SaudiarabienHybridSeniorAnsökan öppen

Vårt uppdrag

Affärsresultat kräver mer än bara välformulerade svar. Designa utvärderingar som särskiljer bra språk, korrekt information och faktiskt utförda åtgärder, så att teamet kan driftsätta förbättringar med mätbar effekt.

Vad du kommer att arbeta med

  • Bygg benchmarks för uppgifter inom kataloghantering, innehåll, konversationer och verktygsanrop.
  • Utforma bedömningsmallar och utvärderingsflöden (manuella och automatiserade) med analys av samstämmighet, bias och täckning.
  • Utveckla regressions- och säkerhetstester för behörigheter och felaktiga påståenden.
  • Analysera experiment och modelljämförelser, och kommunicera handfasta insikter och statistiska begränsningar.

Din bakgrund

  • Erfarenhet av ML-utvärdering, tillämpad forskning eller kvalitetsutveckling inom AI.
  • Starka färdigheter i Python, dataanalys och experimentdesign.
  • Förståelse för begränsningarna med LLM-as-a-judge, dataläckage och utvärderingsbias.
  • Förmåga att kommunicera resultat tydligt och omsätta analysinsikter i tekniska förbättringar.

VISA HUR DU TÄNKER

Låt ditt arbete starta samtalet.

Dela en utvärdering du har tagit fram och berätta hur den påverkade ett beslut om release eller modellval.

Dela publika länkar eller en kort beskrivning utan att avslöja konfidentiell information från tidigare uppdrag.

Om Mollkom

Mollkom är en AI-driven plattform och operativ miljö för modern handel. Vi kopplar samman produktförberedelser, innehåll, marknadsföring och kundtjänst med ordrar, lager, kassasystem och leveranser, så att alla delar samverkar utifrån en gemensam kunskapsbas.

Lär känna plattformen
Ansök till den här tjänsten