Helix AI工程师(强化学习方向)
岗位摘要
为在真实世界和模拟环境中运行的具身智能体设计和实现强化学习算法;训练能够从交互、反馈和跨多样化任务的大规模经验中学习的策略;针对复杂、长时域行为开发奖励建模、信用分配和探索策略;提升策略对噪声、部分可观测性和环境变化等现实挑战的鲁棒性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 为在真实世界和模拟环境中运行的具身智能体设计和实现强化学习算法
- 训练能够从交互、反馈和跨多样化任务的大规模经验中学习的策略
- 针对复杂、长时域行为开发奖励建模、信用分配和探索策略
- 提升策略对噪声、部分可观测性和环境变化等现实挑战的鲁棒性
- 在在线和离线强化学习场景中工作,包括从大规模记录的机器人数据中学习
- 与预训练、视频、生成、智能体和机器人学习团队紧密合作,将强化学习集成到完整的自主技术栈中
- 构建可扩展的强化学习训练系统,包括分布式部署、模拟基础设施和实验管理
- 设计评估框架以衡量策略性能、稳定性和泛化能力
任职要求
- 在复杂环境中开发和实施强化学习算法的经验
- 对强化学习基础有深入理解(如策略优化、值函数方法、基于模型的强化学习)
- 在模拟和/或真实世界系统中训练策略的经验
- 精通Python和深度学习框架(如PyTorch)
- 具备大规模实验和分布式训练系统的经验
- 具备严格的实验素养,能够诊断和改进学习系统
- 扎实的软件工程技能,能够构建可扩展、可靠的系统
- 能够独立工作并推动模糊、高影响力的技术问题解决
- 加分项:将强化学习应用于机器人、控制系统或具身AI的经验
- 加分项:大规模强化学习基础设施(分布式部署、大规模模拟)经验
- 加分项:离线强化学习、模仿学习或混合学习方法背景
- 加分项:奖励建模或人在回路学习经验
- 加分项:曾在OpenAI、Google DeepMind、Anthropic或xAI等领先AI实验室工作
- 加分项:熟悉机器人系统、模拟环境或真实世界部署约束
- 加分项:在强化学习、机器学习或机器人领域有发表记录
福利待遇
- 美国全职岗位基本薪资范围:200,000 - 400,000美元
- 根据个人因素(如知识、技能和经验)提供差异化薪酬
- 总薪酬包可能包含其他额外组成部分/福利(视具体职位而定)
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。