LLM 预训练数据算法工程师(实习)
岗位摘要
从 Web、Book、Code 等多源数据中进行数据挖掘与质量分析,直接贡献到万亿级别 token 的高质量语料库;利用大规模 CPU/GPU 集群优化数据管线,支撑 PB 级数据的处理与持续迭代
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 从 Web、Book、Code 等多源数据中进行数据挖掘与质量分析,直接贡献到万亿级别 token 的高质量语料库
- 利用大规模 CPU/GPU 集群优化数据管线,支撑 PB 级数据的处理与持续迭代
- 参与数据策略制定与消融实验设计,深度分析不同数据方案对模型能力(知识、推理、表达等)的影响
任职要求
- 计算机、数学、数据科学等相关专业,本科及以上学历
- CS/Coding 功底扎实,熟悉 Python,具备深度学习/强化学习基础知识
- 对数据科学有兴趣,有较好的数据 sense,能从大规模数据分析与实验中识别影响模型表现的关键信号
- 具备强烈的好奇心与自驱力,对 AI 数据体系建设与模型优化充满热情
- 有参与 LLM 预训练数据相关工作的经验(如开源数据集构建、评测集设计、数据清洗 pipeline 等)优先
- 每周不少于4天到岗,且能实习3个月以上
加分项
- ) 有参与 LLM 预训练数据相关工作的经验(如开源数据集构建、评测集设计、数据清洗 pipeline 等)优先
- 每周不少于4天到岗,且能实习3个月以上
福利待遇
- 300-400元/天实习薪资
- 参与工业级大模型预训练数据体系建设
- 接触万亿级别 token 的高质量语料库处理
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。