分布式爬虫系统开发工程师
岗位摘要
参与分布式爬虫系统的建设,优化数据调度、抓取、解析、存储全栈流程;协助开发定向抓取流程,提升数据覆盖率,构建完善的专业领域的知识库;熟悉LLM、了解RAG全流程,参与搜索内容理解、召回、排序算法开发,提升RAG系统效果
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与分布式爬虫系统的建设,优化数据调度、抓取、解析、存储全栈流程
- 协助开发定向抓取流程,提升数据覆盖率,构建完善的专业领域的知识库
- 熟悉LLM、了解RAG全流程,参与搜索内容理解、召回、排序算法开发,提升RAG系统效果
- 参与数据的清洗、处理、分析,提升从抓取到模型全链路数据的稳定性和时效性
任职要求
- 本科及以上学历,2年以上爬虫或大数据处理相关工作经验
- 熟悉http/tcp等网络协议,熟悉主流盘虫技术,熟练使用相关工具如fiddler、scrapy
- 熟悉大数据生态,熟练使用Hadoop、Spark、hive、hbase等开源框架,具备海量数据处理能力
- 熟悉Python/Java/Go其中一种语言,具备扎实的编码能力
- 熟悉爬虫对抗技术,了解Android程序apk解包/逆向,有apk/小程序抓取经验者优先
- 熟悉PyTorch/TensorFlow等深度学习框架,具备深度学习、机器学习、自然语言处理等领域的基础知识者优先
- 熟悉大数据框架底层原理,能够独立定位和优化数据处理瓶颈,具备一定大数据组件自运维能力者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。