Qwen3.8-27B仅6次点击通关维基百科跳转游戏:AI代理能力实测

开发者用Qwen3-27B完成维基百科6步跳转挑战,验证了开源大模型在路径规划与工具调用上的代理能力。
一位开发者借助Playwright浏览器自动化工具和Opencode平台,测试了Qwen3.8-27B在维基百科跳转游戏中的表现。该游戏要求仅通过点击页面内链接,在10步以内从一个词条导航至完全无关的目标词条,且禁止回退和搜索。Qwen3.8-27B最终以6次点击完成任务,展现了知识图谱理解、多步路径规划、状态跟踪和工具调用精确性等关键代理能力。开发者认为这个"小游戏"实际上是一个轻量、可验证、零成本且难度可调的AI代理基准测试,代表了从静态问答走向动态交互的评估新趋势,也证明当前开源大模型已具备一定的实用化代理水平。
AI代理能力的新测试:维基百科跳转游戏
一位开发者使用Qwen3.8-27B模型完成了一项有趣的代理能力测试——维基百科跳转游戏。这个看似简单的小游戏,实际上深度考验了AI模型的路径规划、知识关联和工具使用能力。
维基百科跳转游戏的规则简单但富有挑战性:从一个起始词条出发,仅通过点击页面内的超链接,在10次点击内到达一个完全不相关的目标词条。整个过程不允许回退、不能使用搜索栏、不能点击外部链接。这意味着AI必须具备前瞻性的路径规划能力,并深刻理解词条之间的语义关联。

Qwen3.8-27B的实现方案与技术架构
开发者使用Opencode平台搭建了这个测试环境,核心实现依赖Playwright浏览器自动化工具。整个任务提示词简洁明确,要求模型在维基百科内通过超链接导航,找到从起始词条到目标词条的最短路径。
关键约束条件包括:
- 只能点击维基百科内部超链接
- 禁止使用搜索功能或外部链接
- 不允许回退到已访问页面
- 必须在10次点击内完成任务
这些限制精准模拟了真实的代理任务场景:资源受限、不可逆操作、需要一次性规划正确路径。
6次点击通关背后的核心能力解析
Qwen3.8-27B最终在6次点击内完成了挑战,这个结果验证了几个关键能力:
知识图谱理解
模型需要理解维基百科词条之间的关联网络,识别哪些词条可以作为「桥梁」连接看似无关的主题。例如,从科技词条跳转到历史事件,可能需要经过「地理位置」或「时间线」等中间节点。
多步路径规划
在没有回退机会的情况下,模型必须评估每个链接的「战略价值」,避免陷入死胡同。这类似于围棋中的「大局观」——不是贪婪地选择表面上最接近目标的链接,而是构建多步骤的全局路径。
工具调用精确性
使用Playwright点击链接需要准确的DOM元素定位和操作序列。模型必须正确解析页面结构,从众多超链接中选择正确的目标进行交互。
开发者特别提到「以为它会陷入循环」,但Qwen3.8-27B成功避免了这个常见陷阱。这说明模型具备了可靠的状态跟踪能力,能够记住已访问的路径并主动规避重复。
维基百科游戏:一个轻量但有效的AI代理基准测试
虽然开发者自称这是"a dumb minigame"(一个愚蠢的小游戏),但它实际上提供了一个极具价值的轻量级代理能力基准测试。与复杂的编码任务或多步骤工作流相比,维基百科跳转游戏具有几个显著优势:
- 可验证性:导航路径可以人工验证,结果是否成功一目了然
- 零成本:无需专门的数据集或人工标注,维基百科完全免费开放
- 难度可调:通过调整起点和终点的语义距离,灵活控制挑战难度
- 通用性:不依赖特定领域知识,测试的是模型的通用推理与规划能力
这种测试方法也反映了AI代理评估的新趋势:从静态问答转向动态交互任务,从单一模态转向工具使用场景。Qwen3.8-27B在这个测试中的表现,展示了当前开源大模型在代理任务上已达到的实用化水平。
对于开发者社区而言,这个案例提供了一个易于复现的测试框架。任何具备浏览器MCP能力的模型都可以参与这个挑战,形成一个非正式但颇具参考价值的AI代理benchmark。
相关推荐

Vercel AI SDK 发布 Vue 3.0.282 补丁更新
Vercel AI SDK 发布 @ai-sdk/vue@3.0.282 补丁更新,同步核心包 ai@6.0.282。本文解析该 Vue 生态 AI 开发工具的更新内容、版本节奏与开发者升级建议。

Vercel AI SDK 沙箱组件发布补丁更新
Vercel AI SDK 发布 sandbox-vercel@1.0.109 补丁更新,同步 harness 依赖至同版本。本文解读这次维护更新的内容及其对 AI 应用开发者的意义。

Claude的承重词汇:哪些关键词真正影响AI行为输出
探索Claude大语言模型中的承重词汇概念,解析特定关键词如何以超额权重影响AI行为输出,以及这一发现对提示工程优化、AI对齐研究和模型安全的实践启示。