LLM预训练代码数据研究员
岗位摘要
负责代码大模型预训练数据体系的建设与迭代,包括代码语料清洗、质量评估、去重、去污染、数据配比、课程学习与数据飞轮设计,持续提升模型代码、数学、推理与工具使用能力;负责Agentic Pretrain Data的研究与构建,探索基于真实开发流程、代码仓库、测试反馈、工具调用、执行轨迹、Issue/P…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责代码大模型预训练数据体系的建设与迭代,包括代码语料清洗、质量评估、去重、去污染、数据配比、课程学习与数据飞轮设计,持续提升模型代码、数学、推理与工具使用能力
- 负责Agentic Pretrain Data的研究与构建,探索基于真实开发流程、代码仓库、测试反馈、工具调用、执行轨迹、Issue/PR/Commit等信号的数据生成与训练范式,提升模型在复杂工程任务中的自主规划、调试、修改和验证能力
- 负责下一代代码预训练范式的研究,包括repo-level pretraining、execution-aware pretraining、test-driven data、synthetic code data、tool-use trajectory data、multi-turn coding task data等方向,推动相关技术规模化扩展
- 从算法和数据两个角度提升代码基座模型能力,系统性优化模型在代码生成、代码理解、代码补全、代码修复、单测生成、仓库级任务、Agentic Coding等场景下的表现
- 参与代码模型训练全流程,包括数据构建、训练目标设计、实验分析、评测体系搭建和模型迭代,形成从数据、训练到评测的闭环优化机制
- 跟踪并探索前沿代码大模型与Agentic AI技术方向,推动新型数据合成、自动标注、执行验证、模型自改进等方法在预训练阶段的落地
任职要求
- 具备扎实的机器学习、深度学习或大模型基础,有独立研究能力,曾发表机器学习、NLP、代码智能、程序分析或相关方向论文者优先
- 具备优秀的编程能力和工程实现能力,熟悉Python/C++/Go/Java/JavaScript等至少一种主流编程语言,能够独立完成数据处理、训练实验、评测分析和系统构建
- 熟悉大模型预训练流程,对数据质量、数据配比、tokenizer、训练目标、scaling law、评测体系等问题有实践经验或深入理解
- 有代码大模型、代码智能、程序分析、自动化测试、代码生成、Agentic Coding、工具调用、多轮任务数据构建等相关经验者优先
- 熟悉代码数据处理链路者优先,包括GitHub语料处理、repo级数据构建、代码去重、许可证过滤、执行环境构建、单测验证、benchmark contamination检测等
- 具备良好的问题抽象能力、实验分析能力和团队协作能力,能够在开放性研究问题中持续推进技术落地
福利待遇
- 薪资范围:500-1000元/天
- 实习周期:4天/周,3个月
- 工作地点:北京海淀区大恒科技大厦12F
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。