预训练数据工程师
岗位摘要
设计与优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖范围;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计与优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖范围
- 建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率
- 主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
- 建立数据质量评估闭环,实现从域名到页面的多层级质量管控
- 优化大规模数据处理管线的性能和稳定性
- 参与大模型预训练语料的采集与清洗工作
任职要求
- 具备大规模搜索引擎或Web爬虫系统实战经验,有百亿级以上URL池全链路经验
- 深入理解全网URL发现的多种技术手段
- 熟悉主流反爬机制及对抗方案
- 具备扎实的分布式数据处理能力,熟悉Spark或Flink等框架
- 有大模型预训练语料采集和清洗经验者优先
福利待遇
- 具有竞争力的薪酬待遇(25-50K·16薪)
- 加入月之暗面优秀团队,与行业精英共事
- 参与前沿AI大模型预训练项目
- 完善的职业发展通道与培训体系
- 位于北京海淀京东科技大厦,地理位置优越
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。