UI-TARS:让 7B 视觉模型替你操作 GUI 的开源方案

📅 发布时间:2026/9/15 15:44:43
UI-TARS:让 7B 视觉模型替你操作 GUI 的开源方案
UI-TARS让 7B 视觉模型替你操作 GUI 的开源方案【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARSUI-TARS 是一个开源的 GUI 自动化智能体给一张截图加一句自然语言指令它会先输出思考再给出可执行的点击动作。本文整理它的 4 个核心能力、三步上手指引以及与商业模型对比后的选型建议适合 QA 和自动化方向的工程师。一个场景过去要跑两天的回归测试测试工程师在 App 新版本上线前需要在多台设备、多种分辨率上验证改设置、存文件、导出数据等核心流程。用元素树工具做这件事第一份工作就是维护大量定位器界面一改脚本一半失效。UI-TARS 的路子不同把当前截图和把图片颜色模式改成灰度这样的句子给它模型先输出 Thought 说明判断依据再输出动作。官方部署文档里有一条真实响应Thought: 我看到 Preferences 窗口已经打开了但这里显示的都是系统资源相关的设置……让我点击它看看里面有什么选项。Action: click(start_box(177,549))。整个过程不依赖任何元素 ID 或 XPath。UI-TARS-1.5 的四个核心能力先思考后行动模型经强化学习训练每次动作前必须输出 Thought。官方数据显示Minecraft 200 任务平均得分带思考版本为 0.42不带思考为 0.35。统一动作空间、三套提示词模板codes/ui_tars/prompt.py提供 COMPUTER_USE桌面覆盖单击/双击/右键、拖拽、快捷键、MOBILE_USE移动端含open_app、long_press、press_back等移动专属动作、GROUNDING只输出动作不带思考用于评测三套模板。坐标换算工具链底层 Qwen2.5-VL 使用绝对坐标模型输出的坐标要映射回原图分辨率。action_parser.py里实现了 smart_resize边长取 28 的倍数和parse_action_to_structure_output仓库自带示例图data/coordinate_process_image.png及红点定位结果可直接对照调试。官方基准成绩README 显示 Android World 64.2此前最佳 59.5、OSWorld 42.5100 步此前最佳 38.1 为 200 步、ScreenSpotPro 61.6此前最佳 43.6。UI-TARS 快速上手从安装到解析动作的 3 步第 1 步部署模型。官方 README_deploy.md 采用 HuggingFace Inference Endpoints导入 UI-TARS-1.5-7BGPU 建议 L40S 48GL4 或 A100 亦可环境变量加CUDA_GRAPHS0避免部署失败和PAYLOAD_LIMIT8000000防止大图请求失败。第 2 步装后处理库。执行pip install ui-tars或uv pip install ui-tars。第 3 步把模型输出解析成可执行动作。下面示例使用官方 README 中的样例响应from ui_tars.action_parser import parse_action_to_structure_output response Thought: Click the button\nAction: click(start_box(100,200)) parsed parse_action_to_structure_output( response, factor1000, origin_resized_height1080, origin_resized_width1920, model_typeqwen25vl, ) print(parsed)解析得到结构化字典后再交给parsing_response_to_pyautogui_code即可生成能直接跑的 pyautogui 脚本细节见codes/ui_tars/action_parser.py。UI-TARS 和商业 GUI 智能体怎么选下表分数来自官方 README基准测试场景UI-TARS-1.5OpenAI CUAClaude 3.7Android World移动端64.2--OSWorld 100 步桌面端42.536.428ScreenSpotPro元素定位61.623.427.7WebVoyager网页端84.88784.1桌面与移动操作是 UI-TARS-1.5 的优势区间元素定位得分超过商业模型一倍以上网页浏览大体持平WebVoyager 上 CUA 略高。开源方案与商业方案的差距主要体现在本地设备操作这一侧。适合用在哪不适合用在哪适合界面经常变动、跨分辨率的回归测试视觉理解不依赖元素树界面改动后脚本维护成本低定位能力评测官方 ScreenSpot-V2 得分 94.2ScreenSpotPro 61.6桌面或移动端的本地自动化README 同时列出了 UI-TARS-desktop 与 Midscene 浏览器自动化两条衔接路径不适合大规模、低延迟的在线生产任务官方 README 明确仍需大量计算资源推理成本随任务时长线性增长用 7B 版本打游戏官方说明 UI-TARS-1.5-7B 未针对游戏场景专门优化纯确定性脚本任务流程固定、元素树稳定时传统脚本更可预测集成前的 3 条建议先调坐标再谈任务按 README_coordinates.md 的示例跑一遍确认点击坐标在 smart_resize 映射后落在正确位置坐标错位是集成时的第一坑。先用 7B 在 L4/A100/L40S 等硬件上验证流程再考虑更大模型官方 7B 的 OSWorld 得分为 27.5够做流程验证UI-TARS-1.5 为 42.5。调用时固定 temperature0.0部署文档示例代码即采用该值避免动作输出在多次运行间漂移。UI-TARS 把看图操作变成了可部署的开源方案。下一步建议clone 仓库把 README 里的样例响应跑通一遍。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考