[控场AI]
· 5 分钟阅读· 2,504 字

Fledge Alpha 实测:六道硬核任务揭示真实水平

Fledge Alpha 实测:六道硬核任务揭示真实水平

Fledge Alpha功能逻辑尚可但视觉审美与交互细节严重拖后腿,适合原型开发而非成品交付。

OpenCode平台上的神秘模型Fledge Alpha经过六道递进难题的压力测试,展现出明显的能力分化:核心逻辑与功能实现较为可靠,SVG简单动画和游戏基础操控均能跑通;但在强约束指令遵循(数字结尾句子全军覆没)、视觉审美(UI简陋、游戏画面粗糙)和交互细节(看板多处反直觉设计)三个维度上均表现欠佳。复杂多部件SVG场景(射箭)也暴露出空间推理的逻辑崩坏问题。整体呈现「工程师思维强、产品/设计思维弱」的能力画像,快速搭建功能原型够用,但打磨至可交付成品仍需大量人工介入。

OpenCode 上出现了一个代号神秘的模型 Fledge Alpha,社区对它的实际能力众说纷纭。有 B 站 UP 主将思考模式拉到最高档,用六道难度递进的任务对它进行了压力测试,涵盖指令遵循、SVG 图形生成、复杂前端应用和游戏实现。实测结果有亮点也有短板,下面逐项拆解。

指令遵循:句子生成全军覆没

第一题考验的是严格的指令遵循能力——要求生成一组句子,结尾分别是从 1 到 10 的数字,并且句子要通顺。

结果并不理想。UP 主逐句检查后发现,没有一个句子是真正通顺的,模型基本都是在句子末尾硬生生凑出一个数字结尾,甚至缺少必要的量词单位。这暴露出模型在「强约束 + 自然语言流畅度」双重要求下的协调能力不足:它能完成数字这个硬性约束,却牺牲了语义通顺这个软性目标。对于需要精确遵循格式又兼顾表达质量的场景,这是个值得警惕的信号。

SVG 图形生成:有惊喜也有翻车

第二题是让模型用 SVG 画出「提虎(Tiger)骑自行车经过土星环」的动态场景。这一题完成度相当高——整个转弯动作连贯顺畅,没有明显的穿帮或断裂。唯一的瑕疵是提虎的手并没有真正扶在自行车上,属于细节层面的小问题。

唯一的问题是提虎没有扶着自行车

第三题同样是 SVG,内容换成「复合弓射箭」,难度明显上升,模型也随之翻车。UP 主吐槽弓箭手「没有脖子」显得猥琐,更离谱的是拉弓动作——弓箭手的手根本没碰到箭就能把弓拉开,物理逻辑完全错误。对比两道 SVG 题可以看出,模型对结构相对简单、动作单一的场景驾驭较好,一旦涉及多部件协同(人、弓、箭的空间关系),就容易出现逻辑崩坏。

SVG(Scalable Vector Graphics)是一种基于 XML 的矢量图形格式,通过数学坐标描述形状、路径和动画,而非像素点阵。用 SVG 生成复杂场景对语言模型是一项非常特殊的挑战:模型必须在纯文本层面精确计算各元素的坐标、尺寸和空间关系,同时保证生成的 XML 语法合法可渲染。当场景中存在多个相互约束的部件(如人体关节、持握关系、弓弦拉力方向)时,模型需要同时维护多组坐标之间的几何一致性,这对空间推理能力要求极高。当前大多数语言模型在生成 SVG 时,倾向于「各元素分别合理、整体关系不自洽」的错误模式,射箭场景中手未触箭即能拉弓正是这一模式的典型体现。

浏览器操作系统:功能在线,UI 简陋

第四题要求实现一个「精美的浏览器操作系统」。实测下来,整体 UI 只能算一般,桌面背景单调,右上角的弹窗系统也很单薄——只有一个 WiFi 相关弹窗,点击日期没有任何响应,而仅有的弹窗也做得相当简陋。

这整个UI看上去一般

Dock 栏应用在功能层面没有大问题,主要还是卡在视觉呈现上。这一题反映出模型的典型特征:功能逻辑能跑通,但审美和精细度严重欠缺,离「精美」二字差距明显。

游戏实现:能玩,但寒酸

第四题的压轴部分是太空射击游戏。上下左右的操控逻辑没有问题,但 UP 主直言游戏「用几个三角形来糊弄人」,视觉表现极其粗糙。

搞几个三角形就来糊弄人了

第五题的 3D 赛车游戏同样如此。赛车和障碍物的建模都显得寒酸,左右换道时车辆的侧移幅度过大、手感突兀,不过核心玩法逻辑依旧能够正常运行。两款游戏共同印证了前面的判断——模型能把「能跑的 Demo」做出来,但在视觉打磨和交互手感上明显力不从心。

看板应用:交互细节是硬伤

最后一题是不借助第三方库,实现一个高颜值的 Kanban 看板。UI 本身中规中矩,真正的问题集中在交互细节上,而这恰恰是前端产品体验的核心。

现在还需要我手动重新点击选中进行编辑

实测暴露出多处交互缺陷:

  • 新建列表后不会自动进入编辑状态,需要手动再点一次选中才能编辑,也没有自动 focus;
  • 输入待办标题后回车无反应,必须手动点击「添加」按钮;
  • 选中标签后竟然显示一个 16 进制颜色设置项——普通用户根本不关心这种底层细节;
  • 「添加任务」几个字被竖排显示,排版糟糕;
  • 删除按钮做成灰色置灰样式,给人一种「不可点击」的错觉。

这些问题单看都不致命,但叠加起来会严重拖累使用体验。它说明模型对「人类直觉化的交互预期」缺乏理解——知道要有哪些功能,却不懂这些功能应该如何自然地衔接。

Kanban(看板)起源于丰田生产管理体系,后被软件工程领域广泛采用,核心是以卡片列表的形式可视化任务流转状态(如「待办→进行中→已完成」)。在前端实现层面,一个「高颜值」看板不仅要求视觉样式精良,更需要符合用户心智模型的交互设计——例如新建项目后自动 focus 输入框、回车提交、拖拽排序等。这些细节在成熟产品(如 Trello、Linear)中已被反复打磨为行业默认范式,用户对其存在近乎无意识的预期。当模型缺乏对这套「约定俗成的交互契约」的内化时,功能上看似完整的实现,在用户操作时会不断制造摩擦感,本次实测暴露的多处缺陷均属此类。

综合评价

从六道题的整体表现来看,Fledge Alpha 呈现出一个清晰的能力画像:

  • 逻辑与功能实现是强项:无论是 SVG 动画还是游戏操控,核心逻辑大多能跑通;
  • 指令的精确遵循是短板:强约束下的句子生成全面失败;
  • 视觉审美与交互细节是最大软肋:UI 简陋、游戏寒酸、看板交互反直觉。

换句话说,这是一个「工程师思维」明显强于「产品/设计思维」的模型。对于快速搭建功能原型它够用,但要交付真正打磨到位的成品,还需要大量人工介入。这个模型究竟能不能打,很大程度上取决于你的使用场景——跑通逻辑够用,追求精致则力有不逮。

分享:

相关推荐