全模态全双工模型评测工程师
岗位摘要
负责MiniCPM-o全模态全双工模型的评测系统建设,覆盖ASR、VoiceBench、OmniBenchmark、FullDuplex Bench、LiveSports等任务;建设自动化评测流水线和评测框架的设计、维护与重构,维护评测可用性、结果可视化工具和badcase分析工具
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责MiniCPM-o全模态全双工模型的评测系统建设,覆盖ASR、VoiceBench、OmniBenchmark、FullDuplex Bench、LiveSports等任务
- 建设自动化评测流水线和评测框架的设计、维护与重构,维护评测可用性、结果可视化工具和badcase分析工具
- 与算法同学协作,基于评测结果定位模型问题,推动训练数据、训练策略和模型能力迭代
- 参与设计全双工模型专项评测,包括说话时机、打断、多说话人、主动提醒、延迟、多轮上下文记忆、工具调用等
任职要求
- 软件工程能力强,熟练使用Python,熟悉Linux/Shell/Git,能够维护复杂代码仓库
- 熟悉大模型或多模态模型推理流程,有相关开源或闭源项目经验
- 对模型效果评估有基本理解,能结合case、指标和日志产出清晰的评测报告
- 加分项:熟悉ASR/TTS/语音对话/视频理解评测/全双工其中之一领域评测经验
- 加分项:有LLM-as-judge、评测框架、可视化经验其中之一
- 加分项:有集群任务系统、Docker、K8s、CI/CD、并行计算项目经验优先
加分项
- 熟悉 ASR / TTS / 语音对话 / 视频理解评测 / 全双工其中之一领域评测经验
- 有 LLM-as-judge、评测框架、可视化经验其中之一
- 有集群任务系统、Docker、K8s、CI/CD、并行计算项目经验优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。