模型-Harness协同进化研究员
岗位摘要
研究Model-Harness协同进化,探索模型能力如何改变Harness设计,包括自生成工具、自动选择上下文、动态规划子任务、主动请求观测、错误恢复策略及多轮任务中的稳定工作习惯
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 研究Model-Harness协同进化,探索模型能力如何改变Harness设计,包括自生成工具、自动选择上下文、动态规划子任务、主动请求观测、错误恢复策略及多轮任务中的稳定工作习惯
- 构建面向研究的Harness实验平台,围绕prompt、tool schema、memory、context policy、planner/executor、multi-agent、reflection、self-debugging、human feedback等变量进行系统化消融实验,衡量其对长程任务完成率、稳定性、可恢复性和成本的影响
- 打通Harness与模型训练/post-training的反馈链路,从Kimi Work/Kimi Agent真实任务中提炼失败模式、偏好信号、工具使用轨迹、环境交互数据、grader/reward信号,转化为可用于模型改进的数据、评估和研究假设
- 跟踪并复现前沿Agent研究与系统,包括autoharness、meta-harness、dynamic workflow等,将有效机制转化为Kimi Agent与Kimi Work的实验原型和产品化路径
任职要求
- 兼具强研究品味和工程实践能力,能从复杂、嘈杂、非结构化的Agent失败中抽象出可验证假设,设计实验,控制变量,分析结果,并判断问题是模型能力、Harness设计、数据还是评测问题
- 能亲手搭建实验系统、编写Harness原型、运行基准测试、分析trace、构造评估、接入工具环境,而非仅停留在论文阅读或概念讨论
- 熟悉LLM、Harness及评估核心概念,包括Agent Loop、Tool Use、Context Engineering、Memory、Multi-Agent、Evals、Graders、Reward Modeling、Trace Analysis等
- 是顶级的Agent Hacker,深度使用过Claude Code、Codex、Devin、Cursor、Pi等Agent/Assistant产品,擅长通过工程与Prompt Engineering手段深入研究其实现方式并获得一手洞察
- 加分项:在开源社区有Agent研究、评估Harness或自动化实验平台相关作品,或发表过相关论文/技术报告
加分项
- 在开源社区有 Agent research、eval harness 或自动化实验平台相关作品,或发表过相关论文 / 技术报告
- 为 Model 提供了与真实世界交互的能力,但下一阶段的问题不只是“如何把模型包成 Agent”,而是:Harness 是否能成为模型训练、评测、反馈和自我改进的一部分?Agent 是否能理解自己的执行轨迹,发现 harness 的瓶颈,并参与改造让自己更强的系统?
- 你将亲手打造
- 研究 Model-Harness co-evolution:探索模型能力如何反过来改变 harness 设计,例如模型自生成工具、自动选择上下文、动态规划子任务、主动请求观测、学习错误恢复策略,以及在多轮任务中形成稳定的工作习惯
- 构建面向研究的 harness 实验平台:围绕 prompt、tool schema、memory、context policy、planner / executor、multi-agent、reflection、self-debugging、human feedback 等变量做系统化 ablation,衡量它们对长程任务完成率、稳定性、可恢复性和成本的影响
- 打通 harness 与模型训练 / post-training 的反馈链路:从 Kimi Work / Kimi Agent 的真实任务中提炼失败模式、偏好信号、工具使用轨迹、环境交互数据、grader / reward 信号,转化为可用于模型改进的数据、eval 和研究假设
- 跟踪并复现前沿 Agent 研究与系统:包括 autoharness, meta-harness,dynamic workflow 等,将其中真正有效的机制转化为 Kimi Agent 与 Kimi Work 的实验原型和产品化路径
- 允许6个月内投递3个职位,请选择适合的职位进行投递
福利待遇
- 参与前沿AI Agent研究,推动模型与系统协同进化
- 与顶尖研究团队合作,接触最新技术和方法
- 提供丰富的计算资源和实验平台支持
- 开放的工作环境,鼓励创新和自主探索
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。