机器学习基础设施工程师
岗位摘要
设计和构建可扩展的机器学习基础设施,以支持我们整个模型生态系统中的实时和批量分类器及安全评估;构建监控和可观测性工具,以跟踪安全关键应用的模型性能、数据质量和系统健康状况;与研究团队合作,将安全研究成果投入生产,将实验性的安全技术转化为稳健、可扩展的系统
岗位职责
- 设计和构建可扩展的机器学习基础设施,以支持我们整个模型生态系统中的实时和批量分类器及安全评估
- 构建监控和可观测性工具,以跟踪安全关键应用的模型性能、数据质量和系统健康状况
- 与研究团队合作,将安全研究成果投入生产,将实验性的安全技术转化为稳健、可扩展的系统
- 优化实时安全评估的推理延迟和吞吐量,同时保持高可靠性标准
- 为生产安全应用中的机器学习模型实施自动化测试、部署和回滚系统
- 与安全保障、安全和对齐团队合作,了解需求并提供满足安全和生产需求的基础设施
- 为内部工具和框架的开发做出贡献,以加速安全研究和部署
任职要求
- 拥有5年以上构建生产级机器学习基础设施的经验,最好是在欺诈检测、内容审核或风险评估等安全关键领域
- 精通Python,并具有使用PyTorch、TensorFlow或JAX等机器学习框架的经验
- 具有云平台(AWS、GCP)和容器编排(Kubernetes)的实践经验
- 理解分布式系统原理,并构建过处理高吞吐量、低延迟工作负载的系统
- 具有数据工程工具和构建稳健数据管道(例如Spark、Airflow、流式系统)的经验
- 以结果为导向,在安全关键系统中偏向于可靠性和影响力
- 喜欢与研究人员合作,并将前沿研究成果转化为生产系统
- 深切关注AI安全及其工作的社会影响