返回岗位列表

Cohere

模型效率工程师

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

在推理技术栈上工作,通过深入分析模型执行、识别瓶颈并开发创新优化方案,提升核心性能指标;与建模和系统团队紧密合作,进行实验、测量并交付能显著加速推理的改进;随着团队发展,有机会在高级性能技术方面建立专业知识,包括GPU/CUDA优化、内核级改进以及针对MoE和大规模架构的模型执行策略

岗位职责

  • 在推理技术栈上工作,通过深入分析模型执行、识别瓶颈并开发创新优化方案,提升核心性能指标
  • 与建模和系统团队紧密合作,进行实验、测量并交付能显著加速推理的改进
  • 随着团队发展,有机会在高级性能技术方面建立专业知识,包括GPU/CUDA优化、内核级改进以及针对MoE和大规模架构的模型执行策略

任职要求

  • 拥有5年以上编写高性能、生产级代码的经验
  • 具备强大的C++或Python编程技能(也欢迎Rust/Go)
  • 具有大型语言模型工作经验,并熟悉LLM推理生态系统(例如vLLM、SGLang等)
  • 具备诊断和解决模型执行栈中性能瓶颈的能力
  • 具备强烈的行动偏向——快速交付、衡量影响并迭代