数据研究科学家
岗位摘要
负责大规模数据管道的架构设计和实现,支持文本、图像、音频和视频数据集的模型训练和研究工作流;与研究及工程团队合作,策展、清洗和管理多样化的多模态数据集,用于模型的预训练和中期训练;开发可扩展的数据摄取、标注、过滤、增强和存储策略及工具
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大规模数据管道的架构设计和实现,支持文本、图像、音频和视频数据集的模型训练和研究工作流
- 与研究及工程团队合作,策展、清洗和管理多样化的多模态数据集,用于模型的预训练和中期训练
- 开发可扩展的数据摄取、标注、过滤、增强和存储策略及工具
- 确保数据质量、可靠性和合规性,包括管理数据生命周期中的隐私和伦理问题
- 优化大规模分布式训练管道的数据处理、转换和交付
- 原型化和生产化新的数据集创建、管理和持续改进方法,以响应研究人员需求
- 推动研究驱动的数据进步集成到生产级系统中
- 关注数据工程和ML数据管理的最新发展,将最佳实践引入系统
任职要求
- 5年以上在机器学习应用中构建和扩展数据管道的经验,担任过资深或首席工程师,最好在研究或模型训练环境中
- 在LLM、VLM或其他大规模多模态模型的数据工程和ML数据策展方面有深厚背景
- 精通分布式数据系统(如Spark、Hadoop、Ray等)和高效的大规模数据集处理/ETL工作流
- 具备构建稳健、可扩展、生产级ML管道数据基础设施的能力
- 有开发数据标注、过滤、去重、质量保证和数据集管理工具的经验
- 强大的编程技能(Python、SQL、PySpark等)和熟悉云数据平台(AWS、GCP、Azure)
- 了解数据收集和管理中的隐私、合规、伦理及最佳实践
- 出色的跨职能协作、问题解决和沟通能力
- 热衷于通过数据卓越推动前沿生成式AI和创意技术
福利待遇
- 有竞争力的薪资和高速增长初创公司的大量股权
- 全面的健康福利、401k匹配等
- 协作、使命驱动的团队环境,拥有重大成长机会
- 灵活的现场/远程混合工作模式(总部位于加州帕洛阿尔托)
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。