Unverified50% confidenceTradeoffExact time
GUI Agent的感知方式分为视觉感知派(以截图为输入借助多模态大模型)和结构感知派(解析DOM树或Accessibility Tree),前者泛化能力强但延迟高,后者速度快定位精准但依赖页面语义标注质量
1
Sources
50%
Confidence
Long-term
Relevance
7/7/2026
First Seen
Sources
阿里开源Page-Agent:自然语言操控网页的Web智能体
githubGitHub Trending7/5/2026
Related Claims
Unverified学术界将 GUI Agent 的感知方式分为视觉感知派(借助多模态大模型如 GPT-4V、Claude 3 进行像素级理解)和结构感知派(解析 DOM 树或 Accessibility Tree)两大流派84% similarUnverified将界面截图与文字描述一并输入支持图文理解的大模型进行「多模态调试」,效率往往高于搜索引擎翻文档71% similarUnverified纯视觉方案具有更强的通用性(任何能截图的界面都可处理),但精度依赖模型视觉能力且推理成本更高68% similarUnverified解决细粒度视觉识别近邻歧义的主流技术路径包括注意力机制、部件检测网络和度量学习64% similarUnverified感知智能以ImageNet竞赛催生的卷积神经网络为代表,包括图像识别和语音识别64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/129563API
curl https://kongchang.com/api/v1/knowledge/claims/129563MCP
get_claim(id=129563)