预训练数据工程师(实习/全职)
岗位摘要
设计全网数据选取策略,包括链接质量预估、属性聚合、站点抓取配额等,保证数据多样性和覆盖;负责全网数据采集环路的设计与开发,构建高吞吐、可容错的分布式采集系统;通过识别低质站群、重复镜像站点等手段控制链接规模,提升链接库有效性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计全网数据选取策略,包括链接质量预估、属性聚合、站点抓取配额等,保证数据多样性和覆盖
- 负责全网数据采集环路的设计与开发,构建高吞吐、可容错的分布式采集系统
- 通过识别低质站群、重复镜像站点等手段控制链接规模,提升链接库有效性
- 参与大模型预训练语料清洗框架研发,建设稳定高效的大规模数据处理平台
- 研发核心语料清洗能力,如MinHash去重、向量去重,与多团队协作落地新策略
- 维护日常生产流水线,支持增量处理、任务调度、数据统计和稳定性保障
- 优化大规模数据清洗系统的性能、稳定性和可观测性
- 负责多模态数据的数据结构设计、存储架构规划与全生命周期管理
- 优化多模态数据清洗与标注链路,提升去重、结构化、质量筛选等流程效率
- 针对不同训练阶段设计数据存储方案,与框架和算法团队协同提升数据供给效率
- 建设数据分析与可视化体系,挖掘数据特征与模型训练效果的关联
- 负责键值数据库、消息队列等核心数据组件的开发、维护与调优
- 设计数据管理与数据湖方案,对接对象存储、分布式文件系统等底层基建
- 设计与开发分布式数据处理框架,支撑PB级数据高效处理
- 负责在线与批处理任务的CPU、内存、网络调优,提升吞吐与资源利用率
- 与数据采集处理、模型训练等团队协作,设计易用的API、库与工具
任职要求
- 计算机或数学相关专业,本科及以上学历
- 熟练使用至少一种编程语言,包括但不限于Python/C++/Rust
- 计算机、人工智能相关专业,本科及以上学历
- 熟练使用Python及任意一种常用数据处理工具链(pandas/spark/duckdb等)
- 计算机基础扎实,熟悉Python,了解PyTorch
- 具备系统性能分析与调优能力,能深入CPU、网络、存储等技术细节
- 熟悉常见数据处理与存储格式,了解常见数据结构
- 对多模态大模型有一定的认识和了解
- 对大规模多模态数据生产与管理有强烈兴趣
- 扎实Rust/C++/Python编程能力
- 扎实的工程能力与系统功底,深刻理解计算机组成、操作系统与计算机网络
- 深入理解分析型数据处理引擎的计算和数据存储格式
- 能灵活运用文献和开源项目中数据库系统的常见范式和经验
加分项
- 数学或信息学竞赛中取得优秀成绩
- 有大规模数据采集、爬虫或数据 pipeline 系统研发经验
- 语言数据处理方向
- 对世界有好奇心,对模型行为有自己独特的理解
- 对模型能力边界有敏锐判断,善于发现模型在真实场景中的短板和失效模式
- 优秀的跨团队沟通能力,能与标注、产品、工程等多角色高效协作
- 有大规模数据清洗 pipeline 落地经验(TB级别 tokens)
- 多模态数据方向
- 有大规模分布式数据处理系统的研发与性能优化经验
- 具备高并发、异步编程经验,有完整的大规模数据链路开发与调优经历
- 了解多模态模型的常见训练与部署框架(如 Megatron、vLLM 等)
- 在算法竞赛(NOI/IOI/ICPC/CCPC 等)中取得优异成绩
- 数据基建方向
- 有大规模存储、分布式 KV、数据库或数据湖、分布式数据处理框架的设计/研发/运维等经验
- 在高水平系统会议论文上发表过论文
- 预训练数据开采自人类世界全部已有知识所沉积的富矿,是驱动模型强大能力的核心燃料
- 预训练数据团队围绕大模型预训练,构建了从数据采集、清洗处理到底层基础设施的完整数据体系,持续为模型训练输送高质量、规模化、多模态的数据燃料,不断拓展模型的世界知识边界
- 如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类
- 数据采集 pipeline 方向、语言数据处理方向、多模态数据方向、数据基建方向
- 数据采集 pipeline 方向
福利待遇
- 参与构建驱动大模型能力的核心数据体系
- 与顶尖团队合作,拓展世界知识边界
- 以普惠方式将数据财富回馈全人类
- 提供实习和全职岗位,灵活选择
- 接触大规模分布式系统和前沿技术
- 在数据工程全链路中深入实践和成长
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。