MOLLKOM / AI i uczenie maszynowe

Research Engineer, AI Evaluation & Agent Reliability

Zmień subiektywne wrażenie jakości AI w twarde dowody wspierające lepsze decyzje.

Rijad, Arabia SaudyjskaPraca hybrydowaSeniorRekrutacja otwarta

Misja

Sukces w handlu wymaga czegoś więcej niż tylko płynnych odpowiedzi. Projektuj ewaluacje, które odróżniają dobry styl wypowiedzi od poprawności merytorycznej i faktycznie zrealizowanego zadania, pomagając zespołowi wdrażać mierzalne ulepszenia.

Czym będziesz się zajmować

  • Buduj benchmarki dla zadań katalogowych, treści, konwersacji i wywoływania narzędzi.
  • Projektuj rubryki ocen oraz ewaluacje manualne i automatyczne, analizując zgodność, obciążenia (bias) i pokrycie scenariuszy.
  • Twórz testy regresyjne i adwersarialne pod kątem uprawnień oraz nieuzasadnionych twierdzeń modeli (hallucinations).
  • Analizuj wyniki eksperymentów i porównań modeli, przekazując zespołowi praktyczne wnioski oraz ograniczenia statystyczne.

Czego oczekujemy

  • Doświadczenie w ewaluacji modeli ML, badaniach stosowanych lub inżynierii jakości AI.
  • Biegła znajomość Pythona, analizy danych i metodologii projektowania eksperymentów.
  • Zrozumienie ograniczeń metody LLM-as-a-judge, zjawiska przecieku danych (data leakage) oraz błędów poznawczych w ewaluacji.
  • Umiejętność jasnego komunikowania wyników i przekładania wniosków na konkretne usprawnienia inżynieryjne.

POKAŻ SWÓJ SPOSÓB MYŚLENIA

Niech Twoje projekty mówią same za siebie.

Opisz zaprojektowaną przez siebie ewaluację i wyjaśnij, jak wpłynęła ona na decyzję o wdrożeniu lub doborze modelu.

Podziel się publicznymi linkami lub zwięzłym opisem, bez ujawniania poufnych informacji z poprzednich miejsc pracy.

O Mollkom

Mollkom to zintegrowane środowisko operacyjne dla handlu, napędzane przez AI. Łączymy przygotowanie produktów, treści, marketing i obsługę klienta z zamówieniami, magazynem, punktem sprzedaży i logistyką, aby wszystkie procesy bazowały na spójnej wiedzy.

Poznaj platformę
Aplikuj na to stanowisko