研究工程师
岗位摘要
开发和实施新颖的评估方法和指标,以评估大型语言模型的安全性和对齐性;研究和开发模型对齐、价值学习和可解释性的前沿技术;进行对抗性测试,主动发现模型中的潜在漏洞和失败模式;通过人类反馈强化学习(RLHF)和微调等技术,分析和减轻大型语言模型中的偏见、毒性和其他有害行为
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 开发和实施新颖的评估方法和指标,以评估大型语言模型的安全性和对齐性
- 研究和开发模型对齐、价值学习和可解释性的前沿技术
- 进行对抗性测试,主动发现模型中的潜在漏洞和失败模式
- 通过人类反馈强化学习(RLHF)和微调等技术,分析和减轻大型语言模型中的偏见、毒性和其他有害行为
- 与工程和产品团队合作,将安全研究转化为实用、可扩展的解决方案和最佳实践
- 紧跟AI安全研究的最新进展,并通过出版物和演讲为学术界做出贡献
任职要求
- 拥有计算机科学、机器学习或相关领域的博士学位(或同等经验)
- 能够编写清晰、干净的面向生产和训练的代码
- 有使用GPU(训练、服务、调试)的经验
- 有数据管道和数据基础设施的经验
- 对现代机器学习技术有深刻理解,特别是变压器和强化学习,并关注其安全影响
- 对AI的负责任开发充满热情,致力于解决复杂的安全挑战
福利待遇
- 薪酬范围:22.5万至40万美元
- 加入一个快速发展的团队,参与塑造消费者AI的未来
- 有机会与顶尖的研究人员和工程师合作
- 贡献于一个被数百万人使用的平台
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。