返回岗位列表

Pika

数据研究科学家

地点:美国 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责大规模数据管道的架构设计和实现,支持文本、图像、音频和视频数据集的模型训练和研究工作流;与研究及工程团队合作,策展、清洗和管理多样化的多模态数据集,用于模型的预训练和中期训练;开发可扩展的数据摄取、标注、过滤、增强和存储策略及工具

岗位职责

  • 负责大规模数据管道的架构设计和实现,支持文本、图像、音频和视频数据集的模型训练和研究工作流
  • 与研究及工程团队合作,策展、清洗和管理多样化的多模态数据集,用于模型的预训练和中期训练
  • 开发可扩展的数据摄取、标注、过滤、增强和存储策略及工具
  • 确保数据质量、可靠性和合规性,包括管理数据生命周期中的隐私和伦理问题
  • 优化大规模分布式训练管道的数据处理、转换和交付
  • 原型化和生产化新的数据集创建、管理和持续改进方法,以响应研究人员需求
  • 推动研究驱动的数据进步集成到生产级系统中
  • 关注数据工程和ML数据管理的最新发展,将最佳实践引入系统

任职要求

  • 5年以上在机器学习应用中构建和扩展数据管道的经验,担任过资深或首席工程师,最好在研究或模型训练环境中
  • 在LLM、VLM或其他大规模多模态模型的数据工程和ML数据策展方面有深厚背景
  • 精通分布式数据系统(如Spark、Hadoop、Ray等)和高效的大规模数据集处理/ETL工作流
  • 具备构建稳健、可扩展、生产级ML管道数据基础设施的能力
  • 有开发数据标注、过滤、去重、质量保证和数据集管理工具的经验
  • 强大的编程技能(Python、SQL、PySpark等)和熟悉云数据平台(AWS、GCP、Azure)
  • 了解数据收集和管理中的隐私、合规、伦理及最佳实践
  • 出色的跨职能协作、问题解决和沟通能力
  • 热衷于通过数据卓越推动前沿生成式AI和创意技术

福利待遇

  • 有竞争力的薪资和高速增长初创公司的大量股权
  • 全面的健康福利、401k匹配等
  • 协作、使命驱动的团队环境,拥有重大成长机会
  • 灵活的现场/远程混合工作模式(总部位于加州帕洛阿尔托)