预训练数据算法工程师
岗位摘要
负责从互联网及多源文本中构建高质量语料库,主导大模型预训练数据体系的规划与建设;设计并实现大规模文本数据的采集、清洗、去重与质量评估流程;制定并迭代语料策略,主导数据消融实验,深度分析不同数据方案对模型能力(知识、推理、表达等)的影响
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责从互联网及多源文本中构建高质量语料库,主导大模型预训练数据体系的规划与建设
- 设计并实现大规模文本数据的采集、清洗、去重与质量评估流程
- 制定并迭代语料策略,主导数据消融实验,深度分析不同数据方案对模型能力(知识、推理、表达等)的影响
- 搭建高效可扩展的数据处理管线,支撑PB级语料规模的构建与持续优化
任职要求
- 计算机、数学、数据科学等相关专业,本科及以上学历,CS/Coding功底扎实
- 熟练掌握Python,熟悉Spark/Ray/PyTorch等分布式计算与深度学习框架,具备PB级大规模数据处理与分析经验
- 具备出色的数据sense,对数据高度敏感,能从大规模数据分析与实验中识别影响模型表现的关键信号
- 具备强烈的好奇心与自驱力,对AI数据体系建设与模型优化充满热情
- 有参与公开的开源/闭源LLM预训练数据经验者优先(如参与过其数据配比、构建流程等)
加分项
- )有过参与公开的开源/闭源 LLM 预训练数据经验者(如参与过其数据配比、构建流程等)优先
- 完整的大模型数据和预训练流水线,能接触工业级的大模型迭代
- 与顶尖的算法/研究团队紧密合作,在高速迭代的环境中共同推进 SOTA 模型的研发
- 韩先生 刚刚活跃
福利待遇
- 完整的大模型数据和预训练流水线,能接触工业级的大模型迭代
- 与顶尖的算法/研究团队紧密合作,在高速迭代的环境中共同推进SOTA模型的研发
工作地址
北京海淀区大恒科技大厦南座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。