Unverified50% confidenceFactExact time
学术界将 GUI Agent 的感知方式分为视觉感知派(借助多模态大模型如 GPT-4V、Claude 3 进行像素级理解)和结构感知派(解析 DOM 树或 Accessibility Tree)两大流派
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
阿里开源Page-Agent:自然语言操控网页的Web智能体
githubGitHub Trending7/5/2026
Related Claims
UnverifiedGUI Agent的感知方式分为视觉感知派(以截图为输入借助多模态大模型)和结构感知派(解析DOM树或Accessibility Tree),前者泛化能力强但延迟高,后者速度快定位精准但依赖页面语义标注质量84% similarUnverified三维表示天然具备视角不变性,能将在某一角度演示的技能泛化到从另一角度执行的场景64% similarUnverified思维可视化的常见呈现形式包括树状结构、时间轴流程图和节点关系图61% similarUnverified建议的三步学习路径为:用可视化建立直觉、回到伪代码与源码理解细节、动手编码实现60% similarUnverified该方法通过视觉示例而非文本描述来定义目标类别,与OWL-ViT、Grounding DINO等通过视觉-语言对齐实现开放词汇能力的方法不同60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/115642API
curl https://kongchang.com/api/v1/knowledge/claims/115642MCP
get_claim(id=115642)