AI研究工程师
岗位摘要
与Scale运营团队及企业客户合作,将模糊需求转化为结构化评估数据,指导创建和维护作为AI评估系统基准的人工标注黄金数据集及专家评估标准;分析反馈和收集的数据,识别模式,优化评估框架,建立迭代改进循环,以提升人工评估的质量和相关性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 与Scale运营团队及企业客户合作,将模糊需求转化为结构化评估数据,指导创建和维护作为AI评估系统基准的人工标注黄金数据集及专家评估标准
- 分析反馈和收集的数据,识别模式,优化评估框架,建立迭代改进循环,以提升人工评估的质量和相关性
- 设计、研究和开发LLM-as-a-Judge自动评分框架及AI辅助评估系统,包括创建能够评判、打分和解释智能体输出的模型,以及可扩展的评估流程和诊断工具
- 开展研究计划,探索自动分析、评估和改进企业智能体行为的新方法,推动在真实场景中评估和优化AI系统的边界
任职要求
- 计算机科学、电气工程或相关领域的学士学位,或具备同等实践经验
- 在机器学习或应用研究领域拥有2年以上经验,专注于应用ML系统或评估基础设施
- 在专业或研究环境中具备大型语言模型和生成式AI的实践经验
- 深刻理解前沿模型评估方法及当前研究现状
- 精通Python及主流ML框架
- 具备扎实的工程和统计分析基础,拥有开发数据驱动方法来评估模型质量的经验
- 拥有计算机科学、机器学习或相关定量领域的高级学位者优先
- 在NeurIPS、ICML、ICLR或KDD等顶级ML或AI会议上发表过研究论文者优先
- 具备设计、构建或部署LLM-as-a-Judge框架或其他针对复杂模型的自动化评估系统经验者优先
- 具备与运营或外部团队合作制定高质量人工标注指南经验者优先
- 在ML研究工程、随机系统、可观测性或用于模型评估分析的LLM应用方面具备专业知识者优先
- 具备为自动化评估和监控大规模模型及智能体的可扩展流程做出贡献的经验者优先
- 熟悉分布式计算框架和现代云基础设施者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。