MOLLKOM / AI & การเรียนรู้ของเครื่อง (Machine Learning)
Research Engineer, AI Evaluation & Agent Reliability
เปลี่ยนการประเมินคุณภาพ AI จากความรู้สึกให้กลายเป็นหลักฐานเชิงประจักษ์เพื่อการตัดสินใจที่ดียิ่งขึ้น
ภารกิจของเรา
ผลลัพธ์ทางธุรกิจต้องการมากกว่าคำตอบที่สละสลวย ร่วมออกแบบการประเมินที่แยกแยะระหว่างการเขียนที่ดี ข้อมูลที่ถูกต้อง และการทำงานที่สำเร็จลุล่วง เพื่อช่วยให้ทีมปล่อยอัปเดตได้อย่างมั่นใจพร้อมผลลัพธ์ที่วัดค่าได้
สิ่งที่คุณจะได้ร่วมสร้างสรรค์
- สร้างชุดทดสอบมาตรฐาน (Benchmarks) สำหรับงานด้านแคตตาล็อก คอนเทนต์ การสนทนา และการใช้เครื่องมือ
- ออกแบบเกณฑ์การให้คะแนน (Rubrics) และระบบประเมินผลทั้งโดยมนุษย์และแบบอัตโนมัติ พร้อมวิเคราะห์ความสอดคล้อง อคติ และความครอบคลุม
- พัฒนาการทดสอบแบบถดถอย (Regression) และ Adversarial Tests สำหรับสิทธิ์การใช้งานและการป้องกันการกล่าวอ้างที่ไม่มีข้อมูลรองรับ
- วิเคราะห์การทดลองและการเปรียบเทียบโมเดล พร้อมสื่อสารข้อค้นพบที่นำไปปฏิบัติได้จริงและข้อจำกัดทางสถิติ
สิ่งที่คุณจะนำมาต่อยอดร่วมกัน
- มีประสบการณ์ด้านการประเมินผล ML, งานวิจัยประยุกต์ หรือวิศวกรรมคุณภาพ AI (AI Quality Engineering)
- มีความเชี่ยวชาญในภาษา Python การวิเคราะห์ข้อมูล และการออกแบบการทดลอง
- เข้าใจข้อจำกัดของการใช้ LLM เป็นผู้ตัดสิน (LLM-as-judge), ปัญหา Data Leakage และอคติในการประเมินผล
- สามารถสื่อสารผลลัพธ์ได้อย่างชัดเจน และแปลงข้อค้นพบไปสู่การปรับปรุงเชิงวิศวกรรมได้
แสดงแนวคิดและกระบวนการทำงานของคุณ
ให้ผลงานที่ผ่านมาเป็นจุดเริ่มต้นของการพูดคุย
นำเสนอการประเมินผลที่คุณออกแบบ และอธิบายว่าส่งผลต่อการตัดสินใจปล่อยระบบหรือการเลือกโมเดลอย่างไร
แชร์ลิงก์สาธารณะหรือคำอธิบายสั้นๆ โดยไม่เปิดเผยข้อมูลที่เป็นความลับจากที่ทำงานเดิม
เกี่ยวกับ Mollkom
Mollkom คือสภาพแวดล้อมระบบปฏิบัติการเพื่อการพาณิชย์ที่ขับเคลื่อนด้วย AI เราเชื่อมโยงการจัดเตรียมสินค้า คอนเทนต์ การตลาด และการบริการลูกค้า เข้ากับคำสั่งซื้อ สต็อกสินค้า จุดขายหน้าร้าน และการจัดส่ง เพื่อให้ทุกขั้นตอนทำงานบนฐานข้อมูลเดียวกัน
ทำความรู้จักกับแพลตฟอร์ม