预训练数据工程师
岗位摘要
设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面;建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率;主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和优化大规模Web爬虫的URL发现与调度系统,持续扩大数据覆盖面
- 建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率
- 主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
- 建立数据质量评估闭环,从域名到页面的多层级质量管控
- 优化大规模数据处理管线的性能和稳定性
任职要求
- 大规模搜索引擎或Web爬虫系统实战经验,做过百亿级以上URL池的全链路
- 深入理解全网URL发现的多种手段
- 熟悉主流反爬机制及对抗方案
- 扎实的分布式数据处理能力(Spark / Flink等)
- 有大模型预训练语料采集和清洗经验者强烈加分
福利待遇
- 薪资范围25-50K·16薪
- 工作地点在北京海淀区京东科技大厦
- 硕士学历要求
- 3-5年相关经验
工作地址
北京海淀区京东科技大厦13层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。