社招-AI院-强化学习训练框架工程师
岗位摘要
负责强化学习训练框架的研发、优化和维护,根据业务需求持续改进训练框架和策略,提升模型训练效率;分析和定位训练中的性能瓶颈,实施针对性优化措施,提升训练效率和稳定性;跟进业界技术进展,不断同步与集成最新训练优化策略
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责强化学习训练框架的研发、优化和维护,根据业务需求持续改进训练框架和策略,提升模型训练效率
- 分析和定位训练中的性能瓶颈,实施针对性优化措施,提升训练效率和稳定性
- 跟进业界技术进展,不断同步与集成最新训练优化策略
任职要求
- 本科及以上学历,计算机相关专业,2-5 年工作经验
- 对自然语言处理、计算机视觉和多模态算法有深入理解,熟悉主流的 LLM 模型架构,有分布式训练经验
- 对常见 RL 训练算法有基本了解
- 熟悉 vllm 或 sglang 等常用开源推理框架的优先考虑
- 更多信息:团队工作介绍
- GLM-4.5: Reasoning, Coding, and Agentic Abililties
- https://z.ai/blog/glm-4.5
- GLM-4.5 is built with 355 billion total parameters and 32 billion active parameters, and GLM-4.5-Air with 106 billion total parameters and 12 billion active parameters. Both are designed to unify reasoning, coding, and agentic capabilities into a single model in order to satisfy more and more complicated requirements of fast rising agentic applications.
- slime: An SGLang-Native Post-Training Framework for RL Scaling
- https://lmsys.org/blog/2025-07-09-slime/
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。