返回岗位列表

智谱AI

大模型基座预训练数据算法工程师

地点:北京 薪资:40-65K 日期:2026-05-08

岗位摘要

设计和优化PB级多模态训练数据的筛选、去重、清洗体系;基于LLM模型开发语义级去重算法和质量筛选算法;制定领域特定数据筛选策略,支持代码、数学、科学等专业领域;构建基于大模型的数据质量自动评估系统

岗位职责

  • 设计和优化PB级多模态训练数据的筛选、去重、清洗体系
  • 基于LLM模型开发语义级去重算法和质量筛选算法
  • 制定领域特定数据筛选策略,支持代码、数学、科学等专业领域
  • 构建基于大模型的数据质量自动评估系统
  • 设计数据多样性、复杂度、有用性等多维度评估指标
  • 优化数据配比策略,包括领域权重、语言分布、质量分层
  • 构建数据污染检测算法,识别测试数据泄露

任职要求

  • 统招硕士及以上学历,有预训练项目经验,深度参与过大模型预训练数据处理
  • 有处理TB级以上训练数据的实际项目经验优先
  • 精通分布式计算框架(Spark、Ray、Maxcompute等)
  • 掌握高性能文本处理算法(LSH、SimHash等)
  • 熟悉云原生数据处理架构
  • 熟悉数据质量评估指标和方法
  • 有开源大模型项目数据相关贡献经验者优先
  • 发表过大模型数据相关顶会论文者优先
  • 熟悉AI伦理与安全合规的数据处理流程

加分项

  • 有开源大模型项目数据相关的贡献经验
  • 发表过大模型数据相关的顶会论文
  • 熟悉 AI 伦理与安全合规的数据处理流程

福利待遇

  • 具有竞争力的薪酬:40-65K·16薪
  • 参与前沿大模型预训练项目
  • 与顶尖团队共同攻克技术难题
  • 丰富的技术成长与职业发展机会

工作地址

北京海淀区搜狐网络大厦搜狐网络大厦11层