大模型数据链路工程师
岗位摘要
与算法团队深度合作,推进数据清洗、样本生成等场景下多阶段复杂 pipeline 的分布式引擎设计与落地;支撑大模型数据的清洗、分类、采样等场景,持续完善 Ray/Spark 内核功能及性能优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 与算法团队深度合作,推进数据清洗、样本生成等场景下多阶段复杂 pipeline 的分布式引擎设计与落地
- 支撑大模型数据的清洗、分类、采样等场景,持续完善 Ray/Spark 内核功能及性能优化
- 通过云原生技术栈搭建多云多地域的混合计算底座
- 参与 Ray/Spark 在 K8S 上的弹性、潮汐资源、集群稳定性、可观测性及平台化对接等能力建设
任职要求
- 具备扎实的 Python/Java/Scala/C++/Go 等高级语言编程功底
- 熟悉 Ray 内核或 Ray 相关框架应用
- 熟悉常见分布式计算框架如 Spark/Flink 等
- 熟悉常见数据湖框架 Delta/Iceberg/Hudi 等
- 具备良好的团队沟通协作能力及优秀的项目驱动能力
- 有数据平台研发、机器学习相关背景或 k8s 研发经验者优先
福利待遇
- 具有竞争力的薪酬待遇,40-70K·16薪
- 本科及以上学历,经验不限,发展空间广阔
- 位于北京海淀区,交通便利
工作地址
北京海淀区蓟门壹号8楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。