返回岗位列表

小米

多模态感知算法工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

参与多模态感知模型的训练与微调,并将其应用于实际屏幕行为和用户交互场景;探索主动响应的感知技术,通过分析用户屏幕使用轨迹和行为数据,实现对用户意图的实时推断;融合视觉、屏幕和系统事件等多模态数据,研究具备自主环境感知和交互响应能力的感知大模型

岗位职责

  • 参与多模态感知模型的训练与微调,并将其应用于实际屏幕行为和用户交互场景
  • 探索主动响应的感知技术,通过分析用户屏幕使用轨迹和行为数据,实现对用户意图的实时推断
  • 融合视觉、屏幕和系统事件等多模态数据,研究具备自主环境感知和交互响应能力的感知大模型
  • 搭建端侧屏幕理解能力,实现泛场景的GUI事件感知与自动化响应
  • 关注机器学习与感知领域前沿技术,探索跨领域技术融合,并参与撰写论文或专利
  • 参与OSAgent感知能力预研,包括记忆、决策与主动响应机制

任职要求

  • 硕士及以上学历,人工智能、计算机科学、电子、信息工程、机器人等专业,有C++/Python开发经验
  • 熟练掌握至少一种深度学习框架,如Tensorflow、PyTorch等
  • 对深度学习有深刻认识,熟悉各种神经网络及背后数学原理
  • 对大模型有设计应用经验者优先
  • 对声音、图像、视频、各类传感器的通用融合感知算法有实际经验的优先
  • 在AI或NLP相关顶级会议或者刊物,如ICML、NeurIPS、AAAI、ACL等发表论文者优先