Helix AI 工程师(强化学习)
岗位摘要
设计并实现适用于真实与仿真环境中具身智能体的强化学习算法;训练能够通过交互、反馈和大规模经验在多样任务中学习的策略;为复杂长时程行为开发奖励建模、信用分配和探索策略;提升策略对噪声、部分可观测性和环境变化等真实世界挑战的鲁棒性
岗位职责
- 设计并实现适用于真实与仿真环境中具身智能体的强化学习算法
- 训练能够通过交互、反馈和大规模经验在多样任务中学习的策略
- 为复杂长时程行为开发奖励建模、信用分配和探索策略
- 提升策略对噪声、部分可观测性和环境变化等真实世界挑战的鲁棒性
- 覆盖在线与离线强化学习场景,包括从大规模机器人日志数据中学习
- 与预训练、视频、生成、智能体和机器人学习团队紧密合作,将强化学习集成到完整自主技术栈中
- 构建可扩展的强化学习训练系统,包括分布式 rollout、仿真基础设施和实验管理
- 设计评估框架,衡量策略性能、稳定性和泛化能力
任职要求
- 具备在复杂环境中开发和应用强化学习算法的经验
- 深入理解强化学习基础,如策略优化、价值方法和基于模型的强化学习
- 具备在仿真和/或真实系统中训练策略的经验
- 熟练掌握 Python 以及 PyTorch 等深度学习框架
- 具备大规模实验和分布式训练系统的经验
- 具备严谨的实验能力,能够诊断并改进学习系统
- 具备扎实的软件工程能力,能够构建可扩展、可靠的系统
- 能够独立工作,并推动模糊且高影响力的技术问题
- 优先考虑:具备将强化学习应用于机器人、控制系统或具身 AI 的经验
- 优先考虑:具备大规模强化学习基础设施经验,如分布式 rollout 和大规模仿真
- 优先考虑:具备离线强化学习、模仿学习或混合学习方法的背景
- 优先考虑:具备奖励建模或人在回路学习经验
- 优先考虑:曾在 OpenAI、Google DeepMind、Anthropic 或 xAI 等领先 AI 实验室工作
- 优先考虑:熟悉机器人系统、仿真环境或真实部署约束
- 优先考虑:在强化学习、机器学习或机器人领域有发表记录
福利待遇
- 美国全职岗位基本薪资范围为 20 万至 40 万美元
- 具体薪酬将根据岗位相关知识、技能和经验等个人因素确定
- 总薪酬方案可能根据具体职位包含额外组成部分和福利
- 若发出录用通知,将分享更多薪酬信息