AI评测工程师(大模型/智能体方向)
岗位摘要
负责大语言模型、多模态模型、智能体和行业AI应用的评测方案设计,明确任务、数据、指标、基线和验收标准;建设覆盖能力、可靠性、安全性、可解释性和工程性能的评测集,支持问答、长文档、RAG、工具调用、报告生成、视觉理解等任务
岗位职责
- 负责大语言模型、多模态模型、智能体和行业AI应用的评测方案设计,明确任务、数据、指标、基线和验收标准
- 建设覆盖能力、可靠性、安全性、可解释性和工程性能的评测集,支持问答、长文档、RAG、工具调用、报告生成、视觉理解等任务
- 设计人工评测、自动评测、模型评审、规则校验和抽样复核流程,提升评测结果的稳定性、一致性和可复现性
- 建立智能体任务环境和轨迹分析方法,评估任务完成率、步骤有效性、工具调用正确率、证据引用、错误恢复和长程执行能力
- 负责准确率、召回率、事实一致性、引用可追溯性、幻觉率、响应时延、吞吐、显存及成本等指标分析
- 建设回归评测、版本对比、难例挖掘和线上质量监控机制
- 与算法、研发和产品团队协作定位问题根因,提出模型、数据、提示词、流程或系统优化建议
- 面向客户项目输出评测报告和验收材料
任职要求
- 本科及以上学历,计算机、人工智能、数学、统计学、语言学等相关专业优先
- 理解大语言模型、RAG、智能体、多模态模型或传统机器学习中的至少一个方向
- 具备较强的数据分析和实验设计能力,能够使用Python、SQL或其他工具完成数据处理和结果分析
- 能够设计清晰的评测任务、指标和实验对照,具备严谨的记录、复盘和复现习惯
- 对模型输出中的事实错误、逻辑漏洞、边界问题和业务风险保持敏感
- 具备良好的沟通能力,能与算法、工程、产品和业务人员共同定义质量标准
- 【加分项】有大模型评测、Benchmark、Agent评测、自动化测试或模型安全评测经验
- 【加分项】熟悉DeepEval、OpenCompass、lm-evaluation-harness或类似评测工具和框架
- 【加分项】有政企知识库、公文审查、情报研判、工业质检、医疗、法律或科研场景经验
加分项
- 有大模型评测、Benchmark、Agent 评测、自动化测试或模型安全评测经验
- 熟悉 DeepEval、OpenCompass、lm-evaluation-harness 或类似评测工具和框架
- 有政企知识库、公文审查、情报研判、工业质检、医疗、法律或科研场景经验