语音智能体推理平台实习生
岗位摘要
负责SGLang与vLLM双引擎及AWQ INT4量化栈的部署、监控与调优,推动单节点吞吐与P99首token延迟持续达标;主导网关层JWT身份层、多租户路由、隐私分级模块的设计、实现与故障演练
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责SGLang与vLLM双引擎及AWQ INT4量化栈的部署、监控与调优,推动单节点吞吐与P99首token延迟持续达标
- 主导网关层JWT身份层、多租户路由、隐私分级模块的设计、实现与故障演练
- 负责生产事件的根因分析、修复落地与文档归档,提炼可复用的告警规则
- 设计可复用的Docker/K8s部署模板、冷启动及容量规划脚本
- 独立负责一个子方向探索,包括量化方案评估、多租户调度策略、可观测性栈标准化或HTT极限压测等
任职要求
- 计算机、软件工程、通信、自动化等理工科背景
- 具备后端/系统/平台工程经验,对Linux、容器、网络栈及Python/Go/Rust至少其一有扎实掌握
- 在生产环境部署或维护过LLM推理服务(vLLM、SGLang、TGI、TensorRT-LLM任一),能处理GPU OOM、batch调度异常、量化精度漂移等典型问题
- 具备指标—假设—实验—决策的闭环工作习惯,能通过logs/trace/metrics自主定位线上问题
- 良好的工程文档习惯
加分项
- (满足其一即可)
- 在 vLLM、SGLang、TensorRT
- LLM、llama.
- cpp 任一项目中有 PR 被 merge,或读过其核心调度路径
- 熟悉 tensor
- parallel / pipeline
- parallel 的工程实现细节
- 有 K8s + GPU operator + node
- feature
- discovery + Prometheus exporter 的产线经验
- 在多租户 SaaS / PaaS 平台做过身份、配额、计费等模块
- 接触过实时音频处理(OPUS、PCM、AEC、采样率适配)或 gRPC / WebSocket streaming 链路
- GitHub 上有可被查看的代码仓库 —— 不限方向
- 王雅薇 刚刚活跃
福利待遇
- 日薪250-350元,竞争力强的实习薪酬
- 深度参与大模型推理平台核心工程,积累生产环境实战经验
- 独立课题探索机会,可根据兴趣选择前沿技术方向
- 团队技术氛围浓厚,与行业专家合作学习
- 工作地点位于北京海淀区科建大厦,交通便利
工作地址
北京海淀区科建大厦4层401
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。