Agent算法工程师
岗位摘要
负责多模态大模型驱动的App-Agent系统架构设计与实现,重点解决手机或其他终端APP操作中的视觉理解(如屏幕内容识别)、动作规划(如点击/滑动决策)、多轮交互等核心问题;构建跨设备协同能力,支持通过Agent自动化执行复杂手机任务(如导航、支付、信息检索),提升用户移动端体验与效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责多模态大模型驱动的App-Agent系统架构设计与实现,重点解决手机或其他终端APP操作中的视觉理解(如屏幕内容识别)、动作规划(如点击/滑动决策)、多轮交互等核心问题
- 构建跨设备协同能力,支持通过Agent自动化执行复杂手机任务(如导航、支付、信息检索),提升用户移动端体验与效率
- 研究适用于终端的轻量化大模型推理技术(如量化压缩、知识蒸馏),优化App-Agent在低算力环境下的响应速度与精度
- 探索基于手机场景的新型交互范式(如语音指令+视觉反馈闭环)
- 建立面向手机APP的领域知识库,整合APP功能文档、UI组件信息、用户操作日志等数据,实现基于RAG的APP功能推理
- 设计移动端长短期记忆存储方案,通过MemGPT等框架管理跨APP操作的上下文连贯性,支持App-Agent在不同应用间的状态迁移与任务延续
- 针对终端操作特点(如小屏交互、高频短时任务),优化大模型微调策略(如LoRA/QLora),增强模型对手机UI元素的理解能力
- 构建手机操作模拟环境,通过强化学习(GRPO/DPO)训练Agent在复杂APP场景下的决策能力,提升操作成功率与用户满意度
任职要求
- 计算机科学、人工智能、数学、统计学等相关专业本科及以上学历,硕士及以上学历优先
- 需具备扎实的编程基础,熟练掌握Python,熟悉PyTorch、TensorFlow等深度学习框架及NumPy、Pandas等数据处理库
- 熟悉大模型、多模态领域,了解深度学习、计算机视觉、LLM模型基本原理
- 掌握大模型后训练(Post-Training)、微调(如LoRA/QLora、SFT)及偏好对齐(RLHF/DPO/GRPO等)技术
- 了解检索增强生成(RAG)与Agent上下文管理技术
- 有大模型、多模态相关项目经验,或App Agent系统开发(如任务规划、工具调用)、大模型增量训练/微调、自然语言处理等项目经验者优先
- 具备大型项目/系统负责经验,熟悉App-Agent开发全流程且有实际落地经验者优先
- 具备较强的动手能力与问题解决能力,细致耐心以保证数据处理质量
- 对人工智能技术有持续学习热情,能跟踪行业前沿动态,主动探索新技术
- 具备良好的沟通协作能力、有韧性和抗压能力,能推动技术与业务场景结合及创新
工作地址
北京海淀区阶跃星辰公司大恒科技大厦南座12楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。