机器学习工程师,大语言模型评估与可观测性
岗位摘要
设计和策划评估数据集,包括采样策略、查询多样性和黄金数据集,以提供对真实助手行为的可靠、代表性覆盖;构建和维护大规模评估管道,在数千个真实用户查询上衡量助手质量;构建基于LLM的评判模型,评估正确性、完整性和响应质量等指标,并与人类判断对齐
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和策划评估数据集,包括采样策略、查询多样性和黄金数据集,以提供对真实助手行为的可靠、代表性覆盖
- 构建和维护大规模评估管道,在数千个真实用户查询上衡量助手质量
- 构建基于LLM的评判模型,评估正确性、完整性和响应质量等指标,并与人类判断对齐
- 在新模型和产品变更发布前进行评估,提供质量信号以控制发布并防止回归
- 构建AI代理的可观测性基础设施,包括追踪增强、数据管道和仪表板,使助手行为可检查
- 利用评估结果、客户反馈和自动提示迭代等技术,闭环质量测量与改进,推动助手行为的具体提升
- 与公司各团队工程师合作,使评估成为发布流程的一等公民
任职要求
- 2年以上软件工程经验,具备扎实的编码能力
- 扎实的后端基础,熟悉Go和Python,能处理分布式数据管道
- 有大语言模型评估或基于人类反馈的强化学习经验
福利待遇
- 参与构建影响全球企业AI应用的核心基础设施
- 与顶尖团队合作,直接推动产品质量和用户体验提升
- 在快速发展的AI领域获得前沿技术实践机会
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。