返回岗位列表

智谱AI

AI院-GLM开源基座模型-算法工程师

地点:北京 薪资:45-75K 日期:2026-05-08

岗位摘要

负责大语言模型多语言训练数据的质量优化,包括设计多语言文本质量评估和异常检测系统;开发跨语言文本相似度计算和去重方案,构建多语言数据分布优化策略;设计特定语言的数据清洗规则,确保数据质量符合模型训练需求

岗位职责

  • 负责大语言模型多语言训练数据的质量优化,包括设计多语言文本质量评估和异常检测系统
  • 开发跨语言文本相似度计算和去重方案,构建多语言数据分布优化策略
  • 设计特定语言的数据清洗规则,确保数据质量符合模型训练需求
  • 负责多语言数据处理,包括文本预处理(编码、分词、标准化)、语言检测和纯度评估
  • 进行机器翻译文本识别和混合语言文本处理,提升数据纯净度
  • 实施翻译版本聚类和去重、语言特定的质量评估及低资源语言数据增强

任职要求

  • 统招本科及以上学历,计算机或相关专业
  • 具有大模型公司工作经验,且参与过大规模语言模型预训练数据处理
  • 熟悉主流大模型的训练数据处理流程,有处理100TB以上训练数据的实际经验
  • 具备扎实的算法设计和分布式系统开发能力
  • 精通大规模文本处理技术,包括MinHash、LSH等相似度计算算法
  • 熟悉分布式文本处理框架(Spark、Flink等)和向量数据库(Milvus、Faiss等)
  • 了解大规模文本存储系统

加分项

  • 发表过数据质量相关论文
  • 熟悉CommonCrawl、C4等大规模数据集的处理
  • 了解大模型训练过程中的数据质量需求、有处理多模态数据经验
  • 智谱华章 · 高级HRBP

福利待遇

  • 薪资待遇优厚:45-75K·16薪
  • 参与智谱AI核心项目GLM开源基座模型的研发工作
  • 技术氛围浓厚,与行业顶尖团队共同探索大模型前沿技术
  • 多语言数据处理经验积累,提升技术视野和工程能力
  • 公司发展前景广阔,位于北京海淀区搜狐网络大厦

工作地址

北京海淀区搜狐网络大厦11层