AI院-GLM开源基座模型-算法工程师
岗位摘要
负责大语言模型多语言训练数据的质量优化,包括设计多语言文本质量评估和异常检测系统;开发跨语言文本相似度计算和去重方案,构建多语言数据分布优化策略;设计特定语言的数据清洗规则,确保数据质量符合模型训练需求
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大语言模型多语言训练数据的质量优化,包括设计多语言文本质量评估和异常检测系统
- 开发跨语言文本相似度计算和去重方案,构建多语言数据分布优化策略
- 设计特定语言的数据清洗规则,确保数据质量符合模型训练需求
- 负责多语言数据处理,包括文本预处理(编码、分词、标准化)、语言检测和纯度评估
- 进行机器翻译文本识别和混合语言文本处理,提升数据纯净度
- 实施翻译版本聚类和去重、语言特定的质量评估及低资源语言数据增强
任职要求
- 统招本科及以上学历,计算机或相关专业
- 具有大模型公司工作经验,且参与过大规模语言模型预训练数据处理
- 熟悉主流大模型的训练数据处理流程,有处理100TB以上训练数据的实际经验
- 具备扎实的算法设计和分布式系统开发能力
- 精通大规模文本处理技术,包括MinHash、LSH等相似度计算算法
- 熟悉分布式文本处理框架(Spark、Flink等)和向量数据库(Milvus、Faiss等)
- 了解大规模文本存储系统
加分项
- 发表过数据质量相关论文
- 熟悉CommonCrawl、C4等大规模数据集的处理
- 了解大模型训练过程中的数据质量需求、有处理多模态数据经验
- 智谱华章 · 高级HRBP
福利待遇
- 薪资待遇优厚:45-75K·16薪
- 参与智谱AI核心项目GLM开源基座模型的研发工作
- 技术氛围浓厚,与行业顶尖团队共同探索大模型前沿技术
- 多语言数据处理经验积累,提升技术视野和工程能力
- 公司发展前景广阔,位于北京海淀区搜狐网络大厦
工作地址
北京海淀区搜狐网络大厦11层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。