基础设施工程师 - 数据采集与爬取
岗位摘要
独立设计、实现并维护针对多样化、不稳定外部数据源的爬虫系统;构建并维护具备重试、去重、容错与监控特性的数据采集管道;在Kubernetes和云基础设施上部署并管理大规模分布式爬取系统;在采集管道中合理使用Postgres、Redis等中间件,确保可靠性并规避常见使用误区
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 独立设计、实现并维护针对多样化、不稳定外部数据源的爬虫系统
- 构建并维护具备重试、去重、容错与监控特性的数据采集管道
- 在Kubernetes和云基础设施上部署并管理大规模分布式爬取系统
- 在采集管道中合理使用Postgres、Redis等中间件,确保可靠性并规避常见使用误区
- 与高级工程师及跨职能团队紧密合作,持续改进数据采集系统的设计与实现
- 编写清晰、可维护且有良好文档支持的代码
- 主动利用AI辅助开发工具,在保证质量和安全的前提下提升研发效率
任职要求
- 熟练使用Linux命令行,能够编写Bash、Python等自动化脚本
- 精通C/C++,并至少掌握Rust、Go或Haskell中的一种现代系统编程语言
- 深入理解TCP/IP、HTTP、gRPC等网络协议,掌握超时、重试、限流等健壮性处理机制
- 具备Postgres、Redis等中间件系统的实际使用经验,了解性能取舍、潜在故障模式及常见陷阱
- 能够熟练阅读和使用全英文代码库及技术文档
- 有Kubernetes使用经验,熟悉AWS、GCP或Azure等至少一家主流云服务
- 能够快速适应AI辅助编程范式,如Copilot、ChatGPT或内部大模型工具
- 在面对模糊或不稳定环境时具备较强的问题解决能力
- 加分项:中间件调优与扩展经验、熟悉Prometheus/Grafana/ELK等监控日志系统、了解分布式系统概念、有对抗性或大规模爬取环境经验
加分项
- 有中间件在采集场景下的调优与扩展经验(如连接池、主从复制、缓存策略)
- 熟悉监控与日志系统(Prometheus、Grafana、ELK 等)
- 了解分布式系统相关概念(如消息队列、一致性协议、缓存机制)
- 有应对 对抗性或大规模爬取环境 的工作经验
- 参与构建公司 数据平台核心采集层 的机会
- 明确的职业成长路径,可向 大模型数据基础设施负责人 或 数据平台专家 方向发展
- 技术氛围浓厚、协作友好的团队环境
- 自由尝试并采用 现代 AI 辅助开发工作流 的空间
- 薛明畅 刚刚活跃
福利待遇
- 参与构建公司数据平台核心采集层的重要机会
- 明确的职业成长路径,可向大模型数据基础设施负责人或数据平台专家方向发展
- 技术氛围浓厚、协作友好的团队工作环境
- 自由尝试并采用现代AI辅助开发工作流的空间
工作地址
北京海淀区科建大厦301
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。