云端推理服务平台架构师
岗位摘要
设计并构建面向多模态交互(语音、视觉、语言、上下文融合)的云端推理服务平台,支持Omni/Speech/VL等大模型的在线/近线推理;主导端云协同架构中云端服务模块的技术方案,包括模型服务化、动态批处理、请求调度、弹性扩缩容、负载均衡等关键能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并构建面向多模态交互(语音、视觉、语言、上下文融合)的云端推理服务平台,支持Omni/Speech/VL等大模型的在线/近线推理
- 主导端云协同架构中云端服务模块的技术方案,包括模型服务化、动态批处理、请求调度、弹性扩缩容、负载均衡等关键能力
- 优化云端推理链路的延迟、吞吐与资源利用率,针对ToB客户对SLA的高要求提供可靠保障
- 构建统一的服务治理框架,集成监控告警、日志追踪、AB测试、灰度发布、故障自愈等运维能力
- 与算法团队紧密协作,推动模型结构适配、量化部署、缓存策略等端云联合优化方案落地
任职要求
- 计算机科学、软件工程或相关专业硕士及以上学历,3年以上后端/云服务/推理平台开发经验
- 精通Go/Python/C++至少一种语言,具备扎实的系统编程和高并发服务开发能力
- 熟悉主流推理框架(如Triton Inference Server、vLLM、TensorRT-LLM、ONNX Runtime)及模型服务化最佳实践
- 有大规模AI服务部署经验,熟悉GPU资源调度、模型版本管理、冷启动优化、长尾请求处理等典型问题
- 有ToB项目交付经验,能理解客户需求并转化为可靠、可运维的技术方案
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。