MOLLKOM / AI a strojové učení
Research Engineer, AI Evaluation & Agent Reliability
Proměňte hodnocení kvality AI z pouhých dojmů na prokazatelná data pro lepší rozhodování.
Naše mise
V reálném obchodě nestačí jen plynule znějící odpovědi. Navrhujte evaluace, které spolehlivě odliší hezký styl od faktické správnosti a dotažené akce, a pomáhejte týmu nasazovat změny s jasně měřitelným přínosem.
Na čem budete pracovat
- Vytvářejte benchmarky pro katalog, obsah, konverzace i úlohy využívající externí nástroje (tool use).
- Navrhujte hodnoticí kritéria a systémy manuální i automatizované evaluace s analýzou shody hodnotitelů, zkreslení a pokrytí.
- Vyvíjejte regresní i zátěžové (adversarial) testy zaměřené na ověřování oprávnění a nepodložených tvrzení.
- Analyzujte experimenty a porovnání modelů a formulujte konkrétní technická doporučení s ohledem na statistické limity.
Co očekáváme
- Zkušenosti s evaluací ML modelů, aplikovaným výzkumem nebo řízením kvality AI systémů.
- Skvělý Python, pokročilá analýza dat a návrh vědeckých experimentů.
- Porozumění limitům přístupu LLM-as-a-judge, úniku trénovacích dat (data leakage) a zkreslení při hodnocení.
- Schopnost srozumitelně prezentovat výsledky a převádět zjištění do konkrétních technických vylepšení.
UKAŽTE SVÉ UVAŽOVÁNÍ
Nechte za sebe mluvit svou práci.
Sdílejte evaluační proces, který jste navrhli, a popište, jak ovlivnil rozhodnutí o nasazení verze nebo volbě modelu.
Sdílejte veřejné odkazy nebo stručné vysvětlení, aniž byste vyzradili důvěrné informace z předchozích projektů.
O Mollkom
Mollkom je integrované obchodní operační prostředí s umělou inteligencí. Propojujeme přípravu produktů, obsah, marketing i zákaznický servis s objednávkami, sklady, pokladním systémem POS a doručováním, aby všechny kroky vycházely ze sdílených znalostí.
Poznejte platformu