输入关键词搜索 AI 工具、分类,或直接跳转页面
Aria-UI是聚焦GUI指令视觉定位方向的大规模多模态模型展示与应用平台,核心面向UI交互自动化、智能代理研发等领域的开发者与研究人员,提供模型能力演示、技术文档、基准测试结果查询等功能。平台支持纯视觉模式下的界面元素定位,无需依赖AXTree等辅助输入,可适配PC端软件、移动端APP、网页等多种界面的交互指令识别需求,可应用于智能助手研发、UI自动化测试、无障碍交互工具开发等场景,帮助相关从业者降低GUI交互智能模型的研发与落地门槛。
访问Aria-UI官方网站https://ariaui.github.io,在首页了解模型的核心定位与基础能力介绍,确认是否符合自身的使用需求。
点击导航栏的“演示”板块,上传需要识别的GUI界面截图,支持常见的PNG、JPG等图片格式,大小不超过平台规定上限。
在指令输入框中输入需要执行的自然语言指令,明确表述要定位的界面元素或要完成的操作需求,比如“找到页面顶部的搜索框”。
点击“运行识别”按钮,等待模型处理,处理完成后即可在截图上查看识别到的元素边界框,以及对应的坐标和置信度信息。
若需要接入模型到自有项目,可进入“文档”板块查看接口调用说明,按照指引申请调用权限,完成接口对接与测试。
看完教程,直接上手试试
访问 Aria-UI 官网