数据工程师
岗位摘要
负责构建面向大模型训练的高质量数据体系,主导语音、视觉、多模态数据的采集、存储、清洗及特征工程;探索基于生成式模型的合成数据构建,包括数据增强、对抗生成等技术;设计与实施数据质量评估体系,开发高质量、高知识密度的数据筛选机制
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责构建面向大模型训练的高质量数据体系,主导语音、视觉、多模态数据的采集、存储、清洗及特征工程
- 探索基于生成式模型的合成数据构建,包括数据增强、对抗生成等技术
- 设计与实施数据质量评估体系,开发高质量、高知识密度的数据筛选机制
- 构建数据质量-模型表现的闭环验证系统
- 研发智能化的数据处理pipeline,实现多模态数据的自动化对齐与标注
- 支持百亿级token的高效处理与版本化管理
- 深入理解大模型训练需求,与算法团队协同设计数据混合策略
- 开发基于强化学习的数据采样与课程学习方案
- 主导数据治理体系的搭建,建立涵盖合成数据与真实数据的质量评估标准
- 构建数据价值挖掘的量化指标体系
任职要求
- 计算机/人工智能相关专业硕士及以上学历,3年以上大数据研发经验
- 有LLM/VLM等大模型数据工程经验者优先
- 精通大模型数据全生命周期管理,熟悉分布式数据湖架构
- 具备Hadoop/Spark/Flink等生态深度开发能力
- 熟练掌握PySpark/Pandas等数据处理工具链
- 具备强化学习实战经验,熟悉fasttext等算法在数据选择中的应用
- 掌握数据合成技术(文本合成方向)
- 精通多模态数据处理技术,具备ASR语音数据清洗、CV数据增强、跨模态对齐中至少两个领域经验者优先
- 熟悉大模型训练数据标准,有构建Instruction Tuning数据或RLHF奖励模型数据经验者优先
- 具备数据质量量化评估能力,熟练掌握数据可视化分析工具
- 能设计数据质量与模型性能的关联性分析框架
- 参与过千亿token级大模型数据工程者优先
- 熟悉DPO等新一代对齐算法数据需求者优先
- 有开源大模型数据集构建经验者优先
- 发表过数据增强/合成相关论文者优先
加分项
- 参与过千亿token级大模型数据工程
- 熟悉DPO等新一代对齐算法数据需求
- 发表过数据增强/合成相关论文
- 张学仁 本月活跃
- 面壁智能 · 数据工程师
福利待遇
- 月薪30-60K,14薪
- 非外包岗位,正式员工编制
工作地址
北京海淀区科建大厦6层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。