MOLLKOM / KI & Machine Learning

Research Engineer, KI-Evaluation & Agenten-Zuverlässigkeit

Verwandeln Sie KI-Qualität von einem vagen Eindruck in belastbare Daten für fundierte Entscheidungen.

Riad, Saudi-ArabienHybridSeniorBewerbungen möglich

Die Mission

Im Handel zählen verlässliche Ergebnisse, nicht nur flüssige Texte. Entwickeln Sie Evaluierungen, die sprachliche Qualität, inhaltliche Korrektheit und erfolgreiche Aktionen differenzieren, damit Neuerungen messbaren Nutzen bringen.

Ihre Aufgaben

  • Aufbau von Benchmarks für Katalog-, Content-, Kundendialog- und Tool-Aufgaben.
  • Entwurf von Bewertungsrastern sowie menschlichen und automatisierten Testverfahren mit Inter-Annotator-Agreement, Bias- und Abdeckungsanalysen.
  • Entwicklung von Regressions- und Adversarial-Tests zur Absicherung von Zugriffsrechten und Faktenprüfungen.
  • Analyse von Modellen und Experimenten sowie klare Kommunikation handlungsrelevanter Erkenntnisse und statistischer Grenzen.

Was Sie mitbringen

  • Erfahrung in ML-Evaluierung, angewandter Forschung oder AI-Quality-Engineering.
  • Sehr gute Kenntnisse in Python, Datenanalyse und wissenschaftlichem Versuchsdesign.
  • Fundiertes Wissen über die Grenzen von LLM-as-a-Judge, Data Leakage und Auswertungs-Biases.
  • Fähigkeit, komplexe Ergebnisse verständlich zu vermitteln und in technische Verbesserungen zu übersetzen.

IHRE ARBEITSWEISE

Lassen Sie Ihre Arbeitsergebnisse für sich sprechen.

Präsentieren Sie eine von Ihnen entwickelte Evaluation und wie sie eine Release- oder Architekturentscheidung geprägt hat.

Teilen Sie öffentlich zugängliche Links oder eine prägnante Beschreibung, ohne vertrauliche Interna früherer Arbeitgeber offenzulegen.

Über Mollkom

Mollkom ist eine KI-gestützte Handels-Betriebsumgebung. Wir verbinden Produktvorbereitung, Content, Marketing und Kundenservice mit Bestellungen, Inventar, Point of Sale und Zustellung – basierend auf einer gemeinsamen Wissensbasis.

Die Plattform kennenlernen
Für diese Stelle bewerben