大模型基础设施工程师
岗位摘要
负责代码执行沙箱(Sandbox)的设计与开发,支持多语言、多场景的安全隔离执行环境,满足后训练阶段大规模并发评测需求;负责评测框架(Harness)的建设与维护,支持多种任务类型(代码、数学、工具调用等)的自动化评分与奖励信号生成
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责代码执行沙箱(Sandbox)的设计与开发,支持多语言、多场景的安全隔离执行环境,满足后训练阶段大规模并发评测需求
- 负责评测框架(Harness)的建设与维护,支持多种任务类型(代码、数学、工具调用等)的自动化评分与奖励信号生成
- 与算法团队紧密协作,将ENV平台无缝接入RL训练流水线,确保环境反馈的低延迟与高可靠性
- 持续优化沙箱的资源调度与隔离策略,提升吞吐量,降低单次rollout的执行成本
- 参与镜像管理、容器调度及编排系统的建设,保障训练集群的稳定运行
任职要求
- 熟悉Linux容器技术(Docker / gVisor / Firecracker等),具备沙箱安全隔离设计经验
- 有评测框架或在线判题系统(OJ)开发经验者优先
- 熟悉Kubernetes或类似容器编排系统,具备大规模分布式服务运维能力
- 熟悉RL后训练流程(PPO、GRPO等),理解ENV在训练闭环中的作用
- 编程能力扎实,Python / Go / Rust至少精通其一
- 有强烈的工程品质意识,能在快速迭代中保持系统稳定性
加分项
- Bench、代码 agent 评测平台或 LLM 后训练基建实际落地经验
- 有 HPC / GPU 集群运维或训练调度相关背景
- 吴珣 刚刚活跃
福利待遇
- 薪资范围40-70K·16薪
- 工作地点在北京海淀区
- 有机会参与前沿大模型基础设施研发
- 与顶尖算法团队紧密协作
工作地址
北京海淀区大恒科技大厦00
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。