MOLLKOM / AI & 機械学習
リサーチエンジニア(AI評価&エージェント信頼性担当)
AIの品質を主観的な「印象」から、より良い意思決定のための「客観的エビデンス」へと昇華させます。
サウジアラビア、リヤドハイブリッドシニア募集中
ミッション
コマースにおける成果には、流暢な文章以上のものが求められます。優れた文章表現、正確な情報、そして完遂されたアクションを明確に見極める評価系を設計し、測定可能な効果をもってチームが改善をリリースできるよう支援します。
担当する業務
- カタログ、コンテンツ生成、顧客対話、ツール利用タスク向けのベンチマークを構築する。
- ルーブリック、人間による評価および自動評価を設計し、評価者間一致度、バイアス、網羅性を分析する。
- アクセス権限や根拠のないハルシネーション(非対応の主張)に対するリグレッションテストおよび敵対的テストを開発する。
- 実験結果やモデル間比較を分析し、実行可能な示唆と統計的限界をチームに分かりやすく共有する。
求める人物像・スキル
- 機械学習の評価、応用研究、またはAI品質エンジニアリングの実務経験。
- 高度なPythonスキル、データ分析力、および厳密な実験設計能力。
- LLM-as-a-judgeの限界、データ漏洩(データリーク)、評価バイアスに関する深い理解。
- 分析結果を明瞭に伝え、得られた示唆をエンジニアリング上の改善へと落とし込む能力。
あなたの思考プロセスを見せてください
過去の実績や成果物を通じて対話を始めましょう。
自身が設計した評価システムと、それがリリース判断やモデル選定の意思決定をどのように変えたかの事例を提示してください。
前職の機密情報に触れない範囲で、公開リンクや簡潔な説明を添えて共有してください。
Mollkom について
MollkomはAI搭載の統合コマースオペレーティング環境です。商品登録、コンテンツ、マーケティング、カスタマーサービスを注文、在庫、POS、配送とシームレスにつなぎ、すべての工程が共有されたナレッジに基づいて機能します。
プラットフォームを見る