MOLLKOM / AI a strojové učení

Research Engineer, AI Evaluation & Agent Reliability

Proměňte hodnocení kvality AI z pouhých dojmů na prokazatelná data pro lepší rozhodování.

Rijád, Saúdská ArábieHybridní režimSeniorPřihlašování otevřeno

Naše mise

V reálném obchodě nestačí jen plynule znějící odpovědi. Navrhujte evaluace, které spolehlivě odliší hezký styl od faktické správnosti a dotažené akce, a pomáhejte týmu nasazovat změny s jasně měřitelným přínosem.

Na čem budete pracovat

  • Vytvářejte benchmarky pro katalog, obsah, konverzace i úlohy využívající externí nástroje (tool use).
  • Navrhujte hodnoticí kritéria a systémy manuální i automatizované evaluace s analýzou shody hodnotitelů, zkreslení a pokrytí.
  • Vyvíjejte regresní i zátěžové (adversarial) testy zaměřené na ověřování oprávnění a nepodložených tvrzení.
  • Analyzujte experimenty a porovnání modelů a formulujte konkrétní technická doporučení s ohledem na statistické limity.

Co očekáváme

  • Zkušenosti s evaluací ML modelů, aplikovaným výzkumem nebo řízením kvality AI systémů.
  • Skvělý Python, pokročilá analýza dat a návrh vědeckých experimentů.
  • Porozumění limitům přístupu LLM-as-a-judge, úniku trénovacích dat (data leakage) a zkreslení při hodnocení.
  • Schopnost srozumitelně prezentovat výsledky a převádět zjištění do konkrétních technických vylepšení.

UKAŽTE SVÉ UVAŽOVÁNÍ

Nechte za sebe mluvit svou práci.

Sdílejte evaluační proces, který jste navrhli, a popište, jak ovlivnil rozhodnutí o nasazení verze nebo volbě modelu.

Sdílejte veřejné odkazy nebo stručné vysvětlení, aniž byste vyzradili důvěrné informace z předchozích projektů.

O Mollkom

Mollkom je integrované obchodní operační prostředí s umělou inteligencí. Propojujeme přípravu produktů, obsah, marketing i zákaznický servis s objednávkami, sklady, pokladním systémem POS a doručováním, aby všechny kroky vycházely ze sdílených znalostí.

Poznejte platformu
Přihlásit se na tuto pozici