数据采集与网络爬虫软件工程师
岗位摘要
构建和管理处理数百PB至EB级数据的高吞吐量PB级数据处理系统;设计和运营处理每秒数十万至数百万次操作的大规模分布式系统和流水线;管理大型云计算集群上的工作负载;为AI训练预处理数据集;构建和运营大规模爬虫,清晰、简洁地收集和传达需求
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建和管理处理数百PB至EB级数据的高吞吐量PB级数据处理系统
- 设计和运营处理每秒数十万至数百万次操作的大规模分布式系统和流水线
- 管理大型云计算集群上的工作负载
- 为AI训练预处理数据集
- 构建和运营大规模爬虫,清晰、简洁地收集和传达需求
任职要求
- 具备强大的工程技能,热衷于提升数据和模型性能的各个方面
- 精通至少一种编译语言:Rust、Go、C++ 或 Java
- 在文本之外的一个或多个模态领域有工作经验并表现出色
- 具备从零开始构建定制数据处理库的能力
- 具备使用Rust设计和实现分布式系统的能力
- 了解并跟进AI训练数据准备的最新技术
- 有大系统性能优化经验者优先
- 具备跨多个云平台、多种模态和多个来源的数据组织和精细簿记能力
- 有SQL/NoSQL数据库(尤其是列式数据库)经验者优先
- 必须具备出色的调试技能
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。