MOLLKOM / AI & học máy

Research Engineer, AI Evaluation & Agent Reliability

Biến chất lượng AI từ cảm nhận chủ quan thành bằng chứng xác thực cho các quyết định tối ưu.

Riyadh, Ả Rập Xê ÚtHybridSeniorĐang mở ứng tuyển

Sứ mệnh

Hiệu quả thương mại đòi hỏi nhiều hơn là những câu trả lời trôi chảy. Thiết kế các phép đánh giá phân biệt rõ văn phong tốt, thông tin chính xác và tác vụ hoàn tất, giúp đội ngũ phát hành các cải tiến có tác động đo lường được.

Công việc của bạn

  • Xây dựng bộ chuẩn đánh giá cho danh mục sản phẩm, nội dung, hội thoại và các tác vụ sử dụng công cụ.
  • Thiết kế tiêu chí chấm điểm và đánh giá kết hợp giữa con người và tự động, phân tích độ đồng thuận, độ chệch và độ bao phủ.
  • Phát triển các bài kiểm thử hồi quy và đối kháng (adversarial tests) cho vấn đề phân quyền và các tuyên bố vô căn cứ.
  • Phân tích thử nghiệm và so sánh mô hình, truyền đạt rõ các phát hiện thực tiễn và giới hạn thống kê.

Những gì bạn mang lại

  • Kinh nghiệm trong đánh giá học máy, nghiên cứu ứng dụng hoặc kỹ thuật đảm bảo chất lượng AI.
  • Thành thạo Python, phân tích dữ liệu và thiết kế thử nghiệm.
  • Thấu hiểu hạn chế của phương pháp dùng LLM làm giám khảo (LLM-as-judge), hiện tượng rò rỉ dữ liệu và thiên kiến đánh giá.
  • Khả năng truyền đạt kết quả rõ ràng và chuyển hóa các phát hiện thành cải tiến kỹ thuật cụ thể.

THỂ HIỆN TƯ DUY CỦA BẠN

Hãy để sản phẩm thực tế mở đầu câu chuyện.

Chia sẻ một phương pháp đánh giá bạn từng thiết kế và cách nó thay đổi quyết định phát hành hoặc lựa chọn mô hình.

Chia sẻ các liên kết công khai hoặc phần giải thích ngắn gọn mà không tiết lộ thông tin bảo mật từ công việc trước đây.

Về Mollkom

Mollkom là môi trường điều hành thương mại tích hợp AI. Chúng tôi kết nối khâu chuẩn bị sản phẩm, nội dung, marketing và chăm sóc khách hàng với đơn hàng, tồn kho, điểm bán hàng và giao vận, giúp mọi mắt xích vận hành từ một nguồn tri thức chung.

Khám phá nền tảng
Ứng tuyển vị trí này