技术团队成员 - 推理后训练
岗位摘要
应用并创新后训练方法(如微调、强化学习变体、数据增强)以提升模型的推理技能,确保输出更准确、连贯和有洞察力;设计新颖的策略来增强推理能力,例如定制提示框架、合成推理数据集或混合技术,通过跳出框框的思维推动模型认知的极限
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 应用并创新后训练方法(如微调、强化学习变体、数据增强)以提升模型的推理技能,确保输出更准确、连贯和有洞察力
- 设计新颖的策略来增强推理能力,例如定制提示框架、合成推理数据集或混合技术,通过跳出框框的思维推动模型认知的极限
- 创造性地解决广泛的推理挑战,从调试逻辑不一致到为边缘案例场景设计解决方案,通过迭代实验发掘模型的隐藏潜力
- 开发创造性的基准和指标来评估后训练对推理的影响,实现快速的改进周期,以适应不断变化的用户需求和技术前沿
- 与多元化团队合作,将后训练进展整合到AI生态系统中,利用创造力激发思想交叉融合,加速整体模型智能的提升
任职要求
- 在后训练技术(如RLHF、DPO或对齐方法)方面拥有丰富的实践经验,专注于推理改进,并有成功的模型增强案例组合
- 在解决模糊的AI挑战方面展现出独创性,有创新项目、贡献或非常规方法带来突破的证据
- 精通工程工具(如Python、PyTorch),并对模型架构有扎实的理解,能够处理从构思到部署的广泛任务
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。