高级研究工程师,LLM评估与行为分析
岗位摘要
构建并迭代评估框架,以衡量模型在指令遵循、函数调用、长上下文推理、多轮对话、安全性和智能体行为等方面的性能;为函数调用开发专门的评估套件,包括参数正确性、模式遵循、工具选择、多函数规划和错误恢复
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建并迭代评估框架,以衡量模型在指令遵循、函数调用、长上下文推理、多轮对话、安全性和智能体行为等方面的性能
- 为函数调用开发专门的评估套件,包括参数正确性、模式遵循、工具选择、多函数规划和错误恢复
- 为智能体工作流开发评估套件,包括任务分解、多步骤规划、自我纠正和自主工具使用序列
- 为工具增强交互开发评估套件,包括搜索、检索、代码执行和API驱动的操作
- 创建用于A/B比较、回归检测、行为漂移监控和对抗性探测的CI/CD自动化流水线
- 设计和策划高质量的评估数据集,特别是跨领域的细微或具有挑战性的案例
- 与研究人员和工程师合作,诊断故障、处理回归问题,并指导数据选择、策略制定、目标设计和系统改进
- 与工程团队合作,构建仪表板、报告和内部工具,以帮助可视化不同版本间的行为变化
- 在快节奏、高影响力的环境中工作,拥有深厚的技术所有权,并与世界一流的模型研究人员和基础设施工程师紧密合作
任职要求
- 具备扎实的工程技能,熟悉Python、评估工具和分布式工作流
- 具有在LLM或基于Transformer的模型方面的工作经验,特别是在模型评估、测试或红队测试方面
- 能够清晰地推理定性行为、边缘情况和模型故障模式
- 具有设计实验、构建数据集和解释嘈杂行为信号的经验
- 理解函数调用和结构化输出格式
- 熟悉GPU或分布式计算环境
- 具有评估函数调用模型、智能体系统或工具增强的LLM流水线的实践经验
- 具有多步骤交互或复杂工作流评估的经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。