机器学习工程师,大语言模型评估与可观测性
岗位摘要
设计和策划评估数据集,包括采样策略、查询多样性和黄金数据集,以提供可靠且具有代表性的真实助手行为覆盖;构建和维护大规模评估管道,用于衡量数千个真实用户查询的助手质量;构建LLM驱动的评判器,用于评分正确性、完整性和响应质量等指标,并使其与人类判断对齐
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和策划评估数据集,包括采样策略、查询多样性和黄金数据集,以提供可靠且具有代表性的真实助手行为覆盖
- 构建和维护大规模评估管道,用于衡量数千个真实用户查询的助手质量
- 构建LLM驱动的评判器,用于评分正确性、完整性和响应质量等指标,并使其与人类判断对齐
- 在新模型和产品变更发布前进行评估,提供质量信号以控制发布并防止回归
- 为AI代理构建可观测性基础设施,包括追踪增强、数据管道和仪表板,使助手行为可检查
- 利用评估结果、客户反馈和自动提示迭代等技术,闭环质量测量与改进,推动助手行为的具体提升
- 与公司各团队工程师合作,使评估成为发布流程的一等公民
任职要求
- 2年以上软件工程经验,具备扎实的编码能力
- 扎实的后端基础,熟悉Go和Python,能够处理分布式数据管道
- 有LLM评估、基于人类反馈的强化学习或相关领域经验者优先
- 对质量有深刻理解,能够构建可衡量系统
- 具备良好的协作和沟通能力,能够跨团队推动评估实践
福利待遇
- 参与构建全球领先的工作AI平台,影响数百万用户
- 与顶尖工程师和研究人员合作,推动AI评估和可观测性前沿
- 灵活的工作环境,支持远程办公
- 有竞争力的薪酬和股权激励
- 全面的健康保险和福利计划
- 持续学习和职业发展机会
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。