大模型算法工程师-数据方向
岗位摘要
负责构建面向大模型训练的高质量数据体系,主导语音、视觉、多模态数据的采集、存储、清洗及特征工程,探索基于生成式模型的合成数据构建(如数据增强、对抗生成等);设计与实施数据质量评估体系,开发高质量、高知识密度的数据筛选机制,构建数据质量-模型表现的闭环验证系统
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责构建面向大模型训练的高质量数据体系,主导语音、视觉、多模态数据的采集、存储、清洗及特征工程,探索基于生成式模型的合成数据构建(如数据增强、对抗生成等)
- 设计与实施数据质量评估体系,开发高质量、高知识密度的数据筛选机制,构建数据质量-模型表现的闭环验证系统
- 研发智能化的数据处理pipeline,实现多模态数据的自动化对齐与标注,支持百亿级token的高效处理与版本化管理
- 深入理解大模型训练需求,与算法团队协同设计数据混合策略,开发基于强化学习的数据采样与课程学习方案
- 主导数据治理体系的搭建,建立涵盖合成数据与真实数据的质量评估标准,构建数据价值挖掘的量化指标体系
任职要求
- 计算机/人工智能相关专业硕士及以上学历,3年以上大数据研发经验,有LLM/VLM等大模型数据工程经验者优先
- 精通大模型数据全生命周期管理,熟悉分布式数据湖架构,具备Hadoop/Spark/Flink等生态深度开发能力,熟练掌握PySpark/Pandas等数据处理工具链
- 具备强化学习实战经验,熟悉fasttext等算法在数据选择中的应用,掌握数据合成技术(文本合成方向)
- 精通多模态数据处理技术,具备以下至少两个领域经验:ASR语音数据清洗、CV数据增强、跨模态对齐(图文/音视频对齐)者优先
- 熟悉大模型训练数据标准,有构建Instruction Tuning数据或RLHF奖励模型数据经验者优先
- 具备数据质量量化评估能力,熟练掌握数据可视化分析工具,能设计数据质量与模型性能的关联性分析框架
加分项
- 参与过千亿token级大模型数据工程
- 熟悉DPO等新一代对齐算法数据需求
- 发表过数据增强/合成相关论文
- 林先生 半年前活跃
工作地址
北京海淀区科建大厦6层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。