返回岗位列表

Scale AI

机器学习工程师 - 模型评估,公共部门

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

为机器学习模型开发和维护自动化评估流水线,涵盖功能、性能、鲁棒性和安全指标,包括基于LLM评判的评估;设计测试数据集和基准,以衡量泛化能力、偏见、可解释性和故障模式;为LLM智能体构建评估框架,包括基于场景和环境的测试基础设施

岗位职责

  • 为机器学习模型开发和维护自动化评估流水线,涵盖功能、性能、鲁棒性和安全指标,包括基于LLM评判的评估
  • 设计测试数据集和基准,以衡量泛化能力、偏见、可解释性和故障模式
  • 为LLM智能体构建评估框架,包括基于场景和环境的测试基础设施
  • 对模型架构、训练过程和评估结果进行对比分析
  • 为机器学习系统实施持续监控、回归测试和质量保证工具
  • 设计和执行压力测试及红队演练工作流,以发现漏洞和边缘情况
  • 与运营团队和领域专家合作,制作高质量的评估数据集
  • 此职位需要持有或能够获得安全许可

任职要求

  • 在生产环境中拥有计算机视觉、深度学习、强化学习或自然语言处理方面的经验
  • 具备扎实的Python编程技能;有TensorFlow或PyTorch使用经验
  • 拥有算法、数据结构和面向对象编程的背景
  • 具有LLM流水线、模拟环境或自动化评估系统的经验
  • 能够将研究见解转化为可衡量的评估标准

福利待遇

  • 全面的健康、牙科和视力保险
  • 学习和发展津贴
  • 丰厚的带薪休假
  • 可能符合通勤津贴等额外福利条件