MOLLKOM / AI i uczenie maszynowe
Research Engineer, AI Evaluation & Agent Reliability
Zmień subiektywne wrażenie jakości AI w twarde dowody wspierające lepsze decyzje.
Misja
Sukces w handlu wymaga czegoś więcej niż tylko płynnych odpowiedzi. Projektuj ewaluacje, które odróżniają dobry styl wypowiedzi od poprawności merytorycznej i faktycznie zrealizowanego zadania, pomagając zespołowi wdrażać mierzalne ulepszenia.
Czym będziesz się zajmować
- Buduj benchmarki dla zadań katalogowych, treści, konwersacji i wywoływania narzędzi.
- Projektuj rubryki ocen oraz ewaluacje manualne i automatyczne, analizując zgodność, obciążenia (bias) i pokrycie scenariuszy.
- Twórz testy regresyjne i adwersarialne pod kątem uprawnień oraz nieuzasadnionych twierdzeń modeli (hallucinations).
- Analizuj wyniki eksperymentów i porównań modeli, przekazując zespołowi praktyczne wnioski oraz ograniczenia statystyczne.
Czego oczekujemy
- Doświadczenie w ewaluacji modeli ML, badaniach stosowanych lub inżynierii jakości AI.
- Biegła znajomość Pythona, analizy danych i metodologii projektowania eksperymentów.
- Zrozumienie ograniczeń metody LLM-as-a-judge, zjawiska przecieku danych (data leakage) oraz błędów poznawczych w ewaluacji.
- Umiejętność jasnego komunikowania wyników i przekładania wniosków na konkretne usprawnienia inżynieryjne.
POKAŻ SWÓJ SPOSÓB MYŚLENIA
Niech Twoje projekty mówią same za siebie.
Opisz zaprojektowaną przez siebie ewaluację i wyjaśnij, jak wpłynęła ona na decyzję o wdrożeniu lub doborze modelu.
Podziel się publicznymi linkami lub zwięzłym opisem, bez ujawniania poufnych informacji z poprzednich miejsc pracy.
O Mollkom
Mollkom to zintegrowane środowisko operacyjne dla handlu, napędzane przez AI. Łączymy przygotowanie produktów, treści, marketing i obsługę klienta z zamówieniami, magazynem, punktem sprzedaży i logistyką, aby wszystkie procesy bazowały na spójnej wiedzy.
Poznaj platformę