AI资讯 / Agent

Agent / 官方

仅凭截图实现精准界面元素定位的原生 UI 智能体

inclusionAI GitHub

inclusionAI 在 GitHub 上发布了开源项目 UI-Venus,这是一款专为图形用户界面操作设计的原生 UI 智能体。UI-Venus 的核心能力在于仅以截图作为输入,无需访问页面源代码或辅助功能树,即可精准定位界面元素并完成有效的界面导航。该项目融合了强化学习与多模态大语言模型技术,旨在让 AI 智能体像人类用户一样「看懂」屏幕并执行操作。UI-Venus 使用 Python 开发,面向需要构建自动化 UI 测试、RPA 流程或通用计算机操作智能体的开发者与研究者。随着多模态模型能力的持续提升,纯视觉驱动的 UI 自动化正成为智能体领域的重要研究方向,UI-Venus 的发布为该方向提供了一个可复现的开源基线。

UI-Venus 是 inclusionAI 团队推出的一款原生 UI 智能体,其最大特点是以截图作为唯一输入来源。与传统 UI 自动化工具依赖 DOM 树、辅助功能 API 或页面源代码不同,UI-Venus 完全通过视觉信息理解当前界面状态,从而实现对 GUI 元素的精准定位(Grounding)和连续导航操作。这种纯视觉驱动的方式使其具备更强的跨平台、跨应用泛化能力。

在技术架构上,UI-Venus 将强化学习与多模态大语言模型相结合。多模态大语言模型负责理解截图内容,识别按钮、输入框、图标等界面元素的位置与语义;强化学习则用于优化智能体的决策策略,使其能够在复杂的多步骤任务中持续改进导航效率与操作准确率。两者的结合使 UI-Venus 在动态界面环境下表现出较强的适应性。

GUI 元素定位(Grounding)是 UI 自动化中的核心难题之一,要求模型不仅能识别元素类型,还需精确输出其在屏幕上的坐标或区域。UI-Venus 专门针对这一任务进行了优化设计,力求在不同分辨率、不同操作系统界面风格下均能稳定输出可执行的定位结果,为后续的点击、输入、滚动等操作提供可靠基础。

从应用场景来看,UI-Venus 适用于多种实际需求:自动化 UI 测试可借助其替代人工回归测试;RPA(机器人流程自动化)场景可利用其操控无 API 接口的遗留系统;通用计算机操作智能体研究则可将其作为视觉感知模块的基线方案。项目以 Python 编写,便于与现有 AI 工程生态集成。

UI-Venus 的开源发布,为学术界和工业界提供了一个可复现的纯视觉 UI 智能体研究基线。随着 GPT-4o、Gemini 等多模态模型在视觉理解能力上的持续突破,以截图为输入的 UI 自动化路线正获得越来越多的关注。UI-Venus 的出现有望推动该领域在标准化评测、数据集建设和模型优化等方面的进一步发展。

要点

  • UI-Venus 仅依赖截图作为输入,无需 DOM 或辅助功能 API,具备更强的跨平台泛化能力。
  • 项目融合强化学习与多模态大语言模型,同时优化界面元素定位精度与多步骤导航策略。
  • 适用于 UI 自动化测试、RPA 流程自动化及通用计算机操作智能体等多类实际场景。
  • 以 Python 开发并在 GitHub 开源,为纯视觉驱动 UI 智能体研究提供可复现的基线参考。
查看原始来源

原始标题:inclusionAI/UI-Venus — UI-Venus is a native UI agent designed to perform precise GUI element grounding and effective navigation using only screenshots as input.

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。