大模型算法工程师(2026届校招)
岗位摘要
设计和优化PB级文本训练数据的筛选、去重、清洗体系;基于LLM模型的语义级去重算法、质量筛选算法优化;制定领域特定数据筛选策略,支持代码、数学、科学等专业领域;构建基于大模型的数据质量自动评估系统
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和优化PB级文本训练数据的筛选、去重、清洗体系
- 基于LLM模型的语义级去重算法、质量筛选算法优化
- 制定领域特定数据筛选策略,支持代码、数学、科学等专业领域
- 构建基于大模型的数据质量自动评估系统
- 设计数据多样性、复杂度、有用性等多维度评估指标
- 优化数据配比策略,包括领域权重、语言分布、质量分层
- 构建数据污染检测算法,识别测试数据泄露
任职要求
- 统招硕士及以上学历,计算机、AI相关专业
- 具备大模型预训练项目经验,深度参与过大模型预训练数据处理
- 有处理TB级以上训练数据的实际项目经验
- 精通分布式计算框架(Spark、Ray、Maxcompute等)
- 掌握高性能文本处理算法(LSH、SimHash等)
- 熟悉云原生数据处理架构
- 熟悉数据质量评估指标和方法
- 有开源大模型项目数据相关的贡献经验者优先
- 发表过大模型数据相关的顶会论文者优先
- 熟悉AI伦理与安全合规的数据处理流程者优先
加分项
- 有开源大模型项目数据相关的贡献经验
- 发表过大模型数据相关的顶会论文
- 熟悉 AI 伦理与安全合规的数据处理流程
- 智谱华章 · 高级HRBP
工作地址
北京海淀区搜狐网络大厦11层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。