返回岗位列表

面壁智能

大模型数据开发工程师

地点:北京 薪资:30-60K 日期:2026-03-03

岗位摘要

负责大模型训练数据的清洗工作,针对文本、多模态等数据类型,设计高效的去重算法与异常数据过滤方案,剔除无效、冗余数据,提升数据集纯净度;开展多源异构数据的整合工作,打通不同渠道、不同格式的数据壁垒;运用聚类算法对数据进行分类梳理,挖掘数据内在关联,构建结构化、体系化的训练数据池

岗位职责

  • 负责大模型训练数据的清洗工作,针对文本、多模态等数据类型,设计高效的去重算法与异常数据过滤方案,剔除无效、冗余数据,提升数据集纯净度
  • 开展多源异构数据的整合工作,打通不同渠道、不同格式的数据壁垒;运用聚类算法对数据进行分类梳理,挖掘数据内在关联,构建结构化、体系化的训练数据池
  • 搭建大模型数据治理体系,制定数据质量标准与管控流程,通过技术手段实现数据质量的实时监控与问题修复,保障训练数据的准确性、一致性与安全性
  • 主导内容推理与数据标注工作,搭建自动打标系统,结合规则引擎与算法模型实现海量数据的高效标注;优化标注流程与质量校验机制,提升标注数据的精准度,为模型训练提供高价值密度的数据支撑
  • 基于Python技术栈持续优化数据处理流程,攻克大规模数据处理的效率瓶颈,推动数据处理工作的自动化、智能化升级,缩减数据交付周期

任职要求

  • 学历背景:计算机、软件工程、数据科学等相关专业硕士及以上学历
  • 工作经验:具备3年以上数据开发相关工作经验,有大模型训练数据处理经验者优先;熟悉大模型训练数据的特性与处理逻辑,能够独立完成数据清洗、整合、标注等核心工作
  • 技术功底:精通Python编程语言,熟练运用相关数据处理库;掌握数据清洗、去重、聚类、自动打标等核心技术,能够灵活运用算法解决数据处理中的实际问题
  • 综合能力:具备优秀的逻辑思维与问题分析能力,能够快速定位数据质量问题并提出解决方案;对大模型数据领域的技术发展有一定的敏感度;具备良好的沟通协调能力与团队协作意识,能高效联动算法、训练等团队推进工作

工作地址

北京海淀区科建大厦6层