MOLLKOM / الذكاء الاصطناعي والتعلّم الآلي

مهندس أبحاث تطبيقية — تقييم النماذج والوكلاء

حوّل جودة الذكاء الاصطناعي من انطباع إلى دليل يمكن اتخاذ القرار بناءً عليه.

الرياض، السعوديةهجينSeniorالتقديم مفتوح

المهمة

نجاح التجارة لا يقاس بطلاقة إجابة وحدها. ستصمّم تقييمات تميّز بين النص الجيد والمعلومة الصحيحة والإجراء الذي اكتمل، وتساعد الفريق على إطلاق تحسينات يمكن الوثوق بأثرها.

ما الذي ستعمل عليه؟

  • بناء benchmarks لمهام الكتالوج والمحتوى والمحادثات واستخدام الأدوات.
  • تصميم rubrics وتقييم بشري وآلي مع قياس اتفاق المقيمين والتحيز والتغطية.
  • تطوير اختبارات regression وحالات خصومية للصلاحيات والمعلومات غير المدعومة.
  • تحليل نتائج التجارب ومقارنة النماذج وتقديم توصيات قابلة للتنفيذ مع حدودها الإحصائية.

ما الذي نبحث عنه؟

  • خبرة في ML evaluation أو applied research أو هندسة جودة أنظمة الذكاء الاصطناعي.
  • إتقان Python وتحليل البيانات وتصميم التجارب.
  • فهم قيود LLM-as-judge وتسرب البيانات والتحيز في مجموعات الاختبار.
  • قدرة على كتابة نتائج واضحة وتحويل الملاحظات إلى تحسينات هندسية.

SHOW YOUR THINKING

دع عملك يفتح الحوار.

شارك تقييمًا صممته وكيف أثّر في قرار إطلاق أو اختيار نموذج.

يمكنك إرفاق روابط عامة، أو شرح مختصر دون مشاركة أي بيانات سرية من أعمالك السابقة.

عن مولْكوم

مولْكوم بيئة تشغيل للتجارة مدعومة بالذكاء الاصطناعي. نصل تجهيز المنتجات وصناعة المحتوى والتسويق وخدمة العملاء بالطلبات والمخزون ونقاط البيع والتوصيل، لتعمل الخطوات بمعرفة مشتركة.

تعرّف إلى المنصة
قدّم على هذه الوظيفة