返回岗位列表

阶跃星辰

LLM预训练代码数据研究员

地点:北京 薪资:500-1000元/天 日期:2026-06-26

岗位摘要

负责代码大模型预训练数据体系的建设与迭代,包括代码语料清洗、质量评估、去重、去污染、数据配比、课程学习与数据飞轮设计,持续提升模型代码、数学、推理与工具使用能力;负责Agentic Pretrain Data的研究与构建,探索基于真实开发流程、代码仓库、测试反馈、工具调用、执行轨迹、Issue/P…

岗位职责

  • 负责代码大模型预训练数据体系的建设与迭代,包括代码语料清洗、质量评估、去重、去污染、数据配比、课程学习与数据飞轮设计,持续提升模型代码、数学、推理与工具使用能力
  • 负责Agentic Pretrain Data的研究与构建,探索基于真实开发流程、代码仓库、测试反馈、工具调用、执行轨迹、Issue/PR/Commit等信号的数据生成与训练范式,提升模型在复杂工程任务中的自主规划、调试、修改和验证能力
  • 负责下一代代码预训练范式的研究,包括repo-level pretraining、execution-aware pretraining、test-driven data、synthetic code data、tool-use trajectory data、multi-turn coding task data等方向,推动相关技术规模化扩展
  • 从算法和数据两个角度提升代码基座模型能力,系统性优化模型在代码生成、代码理解、代码补全、代码修复、单测生成、仓库级任务、Agentic Coding等场景下的表现
  • 参与代码模型训练全流程,包括数据构建、训练目标设计、实验分析、评测体系搭建和模型迭代,形成从数据、训练到评测的闭环优化机制
  • 跟踪并探索前沿代码大模型与Agentic AI技术方向,推动新型数据合成、自动标注、执行验证、模型自改进等方法在预训练阶段的落地

任职要求

  • 具备扎实的机器学习、深度学习或大模型基础,有独立研究能力,曾发表机器学习、NLP、代码智能、程序分析或相关方向论文者优先
  • 具备优秀的编程能力和工程实现能力,熟悉Python/C++/Go/Java/JavaScript等至少一种主流编程语言,能够独立完成数据处理、训练实验、评测分析和系统构建
  • 熟悉大模型预训练流程,对数据质量、数据配比、tokenizer、训练目标、scaling law、评测体系等问题有实践经验或深入理解
  • 有代码大模型、代码智能、程序分析、自动化测试、代码生成、Agentic Coding、工具调用、多轮任务数据构建等相关经验者优先
  • 熟悉代码数据处理链路者优先,包括GitHub语料处理、repo级数据构建、代码去重、许可证过滤、执行环境构建、单测验证、benchmark contamination检测等
  • 具备良好的问题抽象能力、实验分析能力和团队协作能力,能够在开放性研究问题中持续推进技术落地

福利待遇

  • 薪资范围:500-1000元/天
  • 实习周期:4天/周,3个月
  • 工作地点:北京海淀区大恒科技大厦12F

工作地址

北京海淀区大恒科技大厦12F