大模型数据链路实习生
岗位摘要
与算法团队深度合作,推进数据清洗、样本生成等场景下多阶段复杂流水线的分布式引擎设计和落地;支撑大模型数据的清洗、分类、采样等场景,持续完善Ray/Spark内核功能及性能;通过云原生技术栈搭建多云多地域的混合计算底座,参与Ray/Spark在K8S上的弹性与潮汐资源集群稳定性、可观测性及平台化对接…
岗位职责
- 与算法团队深度合作,推进数据清洗、样本生成等场景下多阶段复杂流水线的分布式引擎设计和落地
- 支撑大模型数据的清洗、分类、采样等场景,持续完善Ray/Spark内核功能及性能
- 通过云原生技术栈搭建多云多地域的混合计算底座,参与Ray/Spark在K8S上的弹性与潮汐资源集群稳定性、可观测性及平台化对接等能力建设
任职要求
- 2027届本科及以上,计算机科学、软件工程等相关专业
- 接受无数据开发经验者
- 具备扎实的Python/Java/Scala/C++/Go等高级语言编程功底
- 熟悉Ray内核或者Ray相关框架应用
- 熟悉常见的分布式计算框架,如Spark、Flink等
- 熟悉常见的数据湖框架,如Delta、Iceberg、Hudi等
- 有良好的团队沟通协作能力,以及优秀的项目驱动能力
- 有数据平台研发、机器学习相关背景或K8s研发经验者优先
工作地址
北京海淀区蓟门壹号6楼8F