返回岗位列表

面壁智能

大模型算法工程师-数据方向

地点:北京 薪资:20-40K 日期:2026-03-03

岗位摘要

负责构建面向大模型训练的高质量数据体系,主导语音、视觉、多模态数据的采集、存储、清洗及特征工程,探索基于生成式模型的合成数据构建(如数据增强、对抗生成等);设计与实施数据质量评估体系,开发高质量、高知识密度的数据筛选机制,构建数据质量-模型表现的闭环验证系统

岗位职责

  • 负责构建面向大模型训练的高质量数据体系,主导语音、视觉、多模态数据的采集、存储、清洗及特征工程,探索基于生成式模型的合成数据构建(如数据增强、对抗生成等)
  • 设计与实施数据质量评估体系,开发高质量、高知识密度的数据筛选机制,构建数据质量-模型表现的闭环验证系统
  • 研发智能化的数据处理pipeline,实现多模态数据的自动化对齐与标注,支持百亿级token的高效处理与版本化管理
  • 深入理解大模型训练需求,与算法团队协同设计数据混合策略,开发基于强化学习的数据采样与课程学习方案
  • 主导数据治理体系的搭建,建立涵盖合成数据与真实数据的质量评估标准,构建数据价值挖掘的量化指标体系

任职要求

  • 计算机/人工智能相关专业硕士及以上学历,3年以上大数据研发经验,有LLM/VLM等大模型数据工程经验者优先
  • 精通大模型数据全生命周期管理,熟悉分布式数据湖架构,具备Hadoop/Spark/Flink等生态深度开发能力,熟练掌握PySpark/Pandas等数据处理工具链
  • 具备强化学习实战经验,熟悉fasttext等算法在数据选择中的应用,掌握数据合成技术(文本合成方向)
  • 精通多模态数据处理技术,具备以下至少两个领域经验:ASR语音数据清洗、CV数据增强、跨模态对齐(图文/音视频对齐)者优先
  • 熟悉大模型训练数据标准,有构建Instruction Tuning数据或RLHF奖励模型数据经验者优先
  • 具备数据质量量化评估能力,熟练掌握数据可视化分析工具,能设计数据质量与模型性能的关联性分析框架

加分项

  • 参与过千亿token级大模型数据工程
  • 熟悉DPO等新一代对齐算法数据需求
  • 发表过数据增强/合成相关论文
  • 林先生 半年前活跃

工作地址

北京海淀区科建大厦6层