{"repo":"Raidriar7170/browser-use-vision","free":true,"listed":false,"github":"https://github.com/Raidriar7170/browser-use-vision","clone":"git clone https://github.com/Raidriar7170/browser-use-vision.git","description":"Vision-grounding plugin for browser-use agents with SoM, Florence-2, Vision–DOM alignment, adaptive visual context, and objective evaluation.","language":"Python","stars":64,"topics":["ai-agent","browser-agent","browser-use","florence-2","multimodal-agent","playwright","som","visual-grounding","web-automation"],"license":"MIT","category":"ai-agents","readme_excerpt":"中文 English 🔍 Browser-Use 视觉增强 为热门开源 browser-use 浏览器 Agent 框架提供视觉 Grounding 增强插件——让 Agent 不仅能读 DOM，还能\"看见\"页面。 --- ⚡ 一句话总结 在 DOM 完全无法解析的纯图标 UI 上，加入视觉管线后 gpt-4o 浏览器 Agent 从 0/4 → 3/4 ，整体客观成功率从 69% → 94% （+25%）。 94% 客观成功率 · 比纯 DOM +25% · 纯图标 UI 0/4 → 3/4 ——所有数字来自 客观校验 （DOM 状态 / URL / 实时 API），绝非 Agent 自我评分。 左：纯图标音乐播放器——每个控件都是无文本/aria-label 的 ，DOM 无法解析。 右：Set-of-Mark 为 VLM 提供每个可点击元素的编号句柄。 同一套 SoM + Florence 管线，唯一变量是驱动 LLM。弱 VLM (gpt-4o-mini) 几乎无法利用 grounded boxes；gpt-4o 将其转化为 +25% 增益。 瓶颈是 VLM，不是管线。 --- 🎯 为什么需要这个项目 现代浏览器 Agent 依赖 DOM 解析理解页面。但以下场景 DOM 无能为力： 场景 纯 DOM Agent 视觉增强 Agent ------ :-: :-: 纯图标按钮（无文本/aria 标签） ❌ 无法区分 ✅ 通过视觉形状识别 颜色选择器 / 视觉选择器 ❌ 无颜色感知 ✅ 通过外观识别 Canvas / SVG 渲染内容 ❌ DOM 不可见 ✅ OCR + 区域检测 动态 SPA（懒加载内容） ⚠️ 可能提前行动 ✅ 视觉确认内容就绪 --- ✨ 核心结果 以下所有成功率均来自客观校验 ——Agent 完成后检查真实 DOM 状态、页面 URL 或 实时 ground-truth API。成功 绝非 Agent 自报 done() 。 最佳结果 (gpt-4o)：视觉救回纯图标 UI 指标 基线 (纯 DOM) + 全视觉 --- :-: :-: 总体 (16 任务) 11/16 (69%) 15/16 (94%) icon-heavy (4 任务) 0/4 (0%) 3/4 (75%) mixed (5 任务) 4/5 (80%) 5/5 (100%) dom-rich (7 任务) 7/7 (100%) 7/7 (100%) 整体 +25% ，完全由 icon-heavy 类别驱动——像素胜过 DOM 的精确场景。 核心发现：视觉的价值随 VLM 能力扩展 同一套消融实验（6 条件、同一 SoM + Florence + 视觉→DOM 桥、相同任务和校验器）， gpt-4o-mini vs gpt-4o ： 指标 gpt-4o-mini（成本默认） gpt-4o（最佳） --- :-: :-: 基线 (纯 DOM) 11/16 (69%) 11/16 (69%) 全视觉 (最强条件) 12/16 (75%) 15/16 (94%) 全视觉增益 +6% +25% icon-heavy : 基线 → 全视觉 1/4 → 2/4 0/4 → 3/4 自适应 (E) 视觉调用 vs 全量 15 vs 35 20 vs 37 两个模型共享 相同的 69% 纯 DOM 基线 ——+25% 的差距完全来自强 VLM 利用 了弱 VLM 忽略的 grounded boxes。 gpt-4o-mini 作为低成本默认 代码和示例默认使用","default_branch":null,"files":null,"tree":[],"storefront":"/r/Raidriar7170","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/Raidriar7170/browser-use-vision/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}