数据采集与搜索实习生
岗位摘要
参与互联网公开数据的采集、清洗、解析和结构化处理,建设高质量知识库与训练数据集;负责网页、文档、PDF等多种数据源的数据抓取与解析,持续提升数据覆盖率与更新时效;参与分布式爬虫系统建设,优化采集链路的稳定性、扩展性和运行效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与互联网公开数据的采集、清洗、解析和结构化处理,建设高质量知识库与训练数据集
- 负责网页、文档、PDF等多种数据源的数据抓取与解析,持续提升数据覆盖率与更新时效
- 参与分布式爬虫系统建设,优化采集链路的稳定性、扩展性和运行效率
- 参与网站反爬机制分析与采集策略优化,包括动态页面解析、请求特征分析、访问频率控制等
- 参与代理池、任务调度、异常监控等基础能力建设,提升大规模数据采集成功率
- 参与搜索检索系统建设,包括索引构建、检索优化、数据更新等工作
- 参与大模型RAG(检索增强生成)系统的数据建设与效果优化
- 协助开展搜索质量评估、数据标注和效果分析工作,持续提升知识检索质量
任职要求
- 本科及以上学历在读,计算机、软件工程、人工智能等相关专业
- 熟练掌握 Python,具备良好的编码能力和工程实践能力
- 熟悉 HTTP/HTTPS、Cookie、Session、Ajax、REST API 等网络基础知识
- 熟悉 HTML、XPath、CSS Selector、正则表达式等网页解析技术
- 熟悉 Linux 环境和常用开发工具
- 了解搜索引擎、知识库、大模型应用等相关技术
- 具备较强的问题分析能力和自主学习能力
- 加分项:熟悉 Scrapy、Playwright、Selenium、BeautifulSoup 等采集框架;有反爬对抗、动态网页采集、分布式爬虫等项目经验;熟悉 Elasticsearch、OpenSearch 等搜索引擎;了解向量检索、Embedding、Milvus、Faiss等技术;熟悉 Redis、Kafka、MySQL、MongoDB 等中间件或数据库;有开源项目贡献、技术博客或竞赛经历
加分项
- 熟悉 Scrapy、Playwright、Selenium、BeautifulSoup 等采集框架
- 有反爬对抗、动态网页采集、分布式爬虫等项目经验
- 熟悉 Elasticsearch、OpenSearch 等搜索引擎
- 了解向量检索、Embedding、Milvus、Faiss等技术
- 熟悉 Redis、Kafka、MySQL、MongoDB 等中间件或数据库
- 有开源项目贡献、技术博客或竞赛经历
- Scrapy
- Playwright
- Selenium
- Elasticsearch
- 参与大模型核心知识库与搜索系统建设
- 接触海量互联网数据采集与搜索技术实践
- 学习RAG、知识库、向量检索等前沿AI技术
- 与搜索、数据、算法团队深度协作,了解大模型产品研发全流程
福利待遇
- 参与大模型核心知识库与搜索系统建设
- 接触海量互联网数据采集与搜索技术实践
- 学习RAG、知识库、向量检索等前沿AI技术
- 与搜索、数据、算法团队深度协作,了解大模型产品研发全流程
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。