AI时代HTML为何重新爆火?硅谷大佬集体站台的背后逻辑

硅谷大佬集体为HTML站台
上个月,Claude Code团队发了一篇博客,标题翻译过来叫「Claude Code写HTML不讲道理的高效」(Unreasonable Effectiveness)。这个说法实际上致敬了物理学家尤金·维格纳1960年的经典论文《数学在自然科学中不讲道理的有效性》——维格纳提出了一个深刻的哲学问题:为什么数学这种纯粹的抽象思维产物,能如此精确地描述物理世界?这篇论文被认为是20世纪科学哲学最重要的文献之一,他的核心困惑是:数学家出于纯粹的美学动机发展出的抽象理论(如群论、黎曼几何),往往在几十年后被物理学家发现恰好能描述自然现象。Claude团队借用这个标题,暗示HTML在AI时代的表现力远超人们对一门「老技术」的预期——HTML最初只是为了在学术机构之间共享文档而设计的标记语言,没有人预见到它会成为AI时代人机协作的最佳界面。这种「设计初衷与最终用途之间的巨大落差」,正是「不讲道理的有效性」的精髓。
紧接着推特上一群硅谷大佬集体转发点赞,连前OpenAI联合创始人Karpathy都出来站台。Karpathy是深度学习领域最具影响力的人物之一,曾担任特斯拉AI总监负责Autopilot视觉系统,他在斯坦福开设的CS231n课程被认为是深度学习入门的黄金标准。他近年来多次强调「vibe coding」(氛围编程)的概念——即非专业程序员通过自然语言与AI协作来完成编程任务,而HTML正是这一理念的最佳载体。他的公开站台,往往被视为某项技术即将进入主流的信号。最近Slack等一众国外应用也纷纷快速支持了HTML的渲染。Slack在2024-2025年间快速支持了HTML内容的内联渲染,这意味着用户可以在聊天窗口中直接预览AI生成的HTML界面,而不需要复制代码到本地文件再用浏览器打开。这一变化的背后是整个协作工具行业的共识:当AI成为团队的「虚拟成员」时,它输出的内容需要被即时可视化。类似的趋势也出现在Notion、飞书等产品中,HTML正在从「开发者的输出格式」变成「所有人的沟通格式」。
AI已经可以帮你做产品、写代码、甚至剪视频,这群站在AI最前沿的人,怎么突然集体讨论一个90年代就有的老技术?
答案是:HTML不是过去的技术,它恰恰是AI时代你必须懂的一门语言。
HTML从未离开:30年进化史
HTML诞生于1990年,到今天已经30多岁了。但它从来没有停止进化:
90年代:新浪、搜狐、雅虎、Facebook、亚马逊,全是HTML。那时候它干的事情比较简单——展示内容,以及简单的交互。
2010年代:HTML升级到HTML5,跟着移动互联网一起爆发。2014年正式定稿的HTML5标准带来了革命性的变化:Canvas元素让浏览器能绘制2D图形和运行游戏,WebGL支持3D图形渲染,WebSocket实现了实时双向通信,LocalStorage和IndexedDB提供了本地数据存储能力。这些API让HTML从一个「文档展示语言」进化为一个「应用开发平台」。值得一提的是,Canvas API的出现直接终结了Flash的统治地位,而WebGL作为OpenGL ES的浏览器实现,能够调用GPU进行硬件加速的3D渲染。2023年发布的WebGPU标准更是将浏览器的图形能力推向新高度——它提供了类似Vulkan/Metal的低级GPU访问能力,不仅能渲染3A级游戏画面,还能在浏览器中直接运行机器学习推理任务。这意味着未来AI模型甚至可以在浏览器本地运行,进一步强化HTML作为AI应用载体的地位。美团、滴滴、微信公众号,背后全是HTML完成的。微信小程序、支付宝小程序的技术栈,本质上也是HTML5的变体。
当下:Notion、飞书、甚至PS、Word、Excel都出了网页版。OpenAI的产品页面,甚至SpaceX的控制面板,都用到了HTML相关技术。今天你在浏览器里能玩3A级游戏、剪辑视频、运行Photoshop,都得益于HTML5的底层能力。
整个互联网的发展,都离不开HTML。
AI时代为什么非HTML不可?
原因一:浏览器是天然的代码运行环境
打开豆包,跟它说「帮我做一个贪吃蛇游戏」,它给你输出的就是一段HTML。为什么?因为代码得有地方跑,而浏览器就是一个天然的代码运行环境。手机、平板、电脑都有浏览器,把HTML拖进去就能直接跑。
浏览器之所以能充当这个角色,是因为现代浏览器内置了完整的渲染引擎和JavaScript引擎。以Chrome为例,它使用Blink引擎解析HTML和CSS,使用V8引擎执行JavaScript——V8采用即时编译(JIT)技术,能将JavaScript代码直接编译为机器码执行,性能已经接近原生应用。更关键的是,浏览器提供了沙箱安全机制:代码在隔离环境中运行,无法直接访问用户的文件系统或操作系统资源。具体来说,这是一套多层防御体系——在操作系统层面,Chrome为每个标签页创建独立的进程,使用操作系统级别的权限隔离(如Linux的seccomp-bpf、Windows的Job Objects)限制进程能执行的系统调用;在浏览器层面,同源策略(Same-Origin Policy)防止不同网站的代码互相访问数据,内容安全策略(CSP)可以限制代码能加载的外部资源。这套机制经过了20多年的实战检验和无数安全研究者的攻防测试,是目前最成熟的代码隔离方案之一。这意味着你可以放心地运行AI生成的HTML代码,不用担心它破坏你的电脑。这种「安全+跨平台+零安装」的组合,是其他任何运行环境都无法比拟的。

原因二:全文本格式,AI读写毫无障碍
AI的本质是大语言模型,它最擅长的事情就是读写文本。大语言模型(LLM)的核心工作方式是基于Transformer架构的序列到序列预测:模型将输入文本拆分为token(词元),每个token对应一个数字向量,然后通过注意力机制计算token之间的关联,最终逐个预测下一个最可能出现的token。这意味着LLM天然擅长处理结构化的纯文本格式。
早期跟AI协作,大家用的是Markdown文件,因为它是全文本、语法简单。但Markdown有天花板:它只能表达文档,没有按钮、没有交互、没有界面。
HTML恰好把这堵墙拆了。它一样是全文本,AI写起来一样轻松,但表达力比Markdown强非常多——有界面、交互、动效,让人很容易理解AI想要表达的是什么。HTML的标签语法(如<div>、<p>)本质上就是带有明确语义标记的文本,模型可以精确理解每个标签的含义和嵌套关系。从token化的角度来看,HTML标签通常会被拆分为少量可预测的token——例如<div class="container">可能被拆分为<div、 class、="、container、">等token。由于HTML标签的词汇表是有限且固定的(约110个标准标签),模型对这些token的概率分布非常确定,生成时几乎不会出现语法错误。相比之下,自然语言的歧义性和创造性用法会导致模型在生成时面临更多不确定性。这从统计学角度解释了为什么AI生成HTML的准确率远高于生成自然语言文本。而二进制格式(如.psd、.sketch设计文件)对AI来说几乎是不可读的黑箱,这也解释了为什么AI生成界面时选择HTML而非其他格式。
原因三:30年数据沉淀,AI写HTML最熟练
HTML在互联网上沉淀了30年,AI训练的数据里充满了HTML样本。所以AI写HTML比任何其他编程语言都熟练。你打完字,浏览器一渲染,几秒钟就能看到结果。
总结起来就是两个核心优势:一个方便AI写(全文本),一个方便人看(可视化)。HTML就是数字世界的普通话——你平时不觉得它先进,但只要你要跟数字世界交流,你就必须会它。
三分钟看懂HTML结构
以贪吃蛇游戏为例,一个HTML文件由三个核心部分组成:

HTML标签 = 骨架
一般的标签开头和结束成对出现。除了<html>,还有<head>和<body>。文件名以.html结尾,浏览器就会用HTML渲染引擎去解析。HTML决定页面里的内容是什么。
CSS样式 = 皮肤
CSS决定整个页面长什么样——颜色、字号、布局,所有涉及外观的内容全部由CSS控制。样式一般放在<head>里,这样在加载页面之前就能把样子渲染出来,避免页面错乱。
实际上,现代CSS的能力已经远超简单的颜色和字号设置。CSS Grid和Flexbox提供了强大的二维和一维布局系统,CSS动画(Animation)和过渡(Transition)可以创建流畅的60帧动效,CSS变量(Custom Properties)支持主题切换。甚至一些简单的交互——如下拉菜单、手风琴折叠、暗黑模式切换——现在纯CSS就能实现,完全不需要JavaScript。这对AI生成代码特别友好,因为减少了代码的复杂度和出错概率。
JavaScript = 肌肉

<script>标签里包裹的是JavaScript,它决定页面能做什么——所有的交互、点击、跳转、填表单,还有游戏逻辑,全都在这里定义。比如贪吃蛇的上下左右移动,就是JS控制的。
记住这三个比喻:HTML是骨架,CSS是皮肤,JS是肌肉。 记住这些,你已经超过99%的非程序员了。下次AI再给你一段代码,你扫一眼就知道结构在哪、样式在哪、交互在哪。
实战:用AI+HTML做产品原型
最后分享一个实际案例。作者之前做过一个本地文件管理工具PieceWiki,第一版是命令行工具,面向程序员。现在想把它做成桌面客户端,让普通人也能用。

做法是:用Claude Design来设计原型,把现有代码全部同步给它,让AI直接生成设计稿。而它生成的每一版设计稿,本质上就是一段HTML。
这就是今天HTML最强大的玩法:
- 你不需要会画图,也不需要会做UI,更不需要懂前端
- 只要跟AI说需求,AI就直接给你一个可以用、可以点、可以交互的真实用户界面
- 拿着这个界面,你就知道最终效果是什么样
- 再把HTML交给本地AI,让它把交互翻译成桌面客户端的方式
这里提到的「翻译成桌面客户端」,在技术上有一条成熟的路径。Electron框架(由GitHub开发)允许开发者用HTML+CSS+JavaScript构建跨平台桌面应用——VS Code、Slack、Discord、Notion桌面版都是用Electron开发的。Electron的工作原理是将Chromium浏览器和Node.js运行时打包进应用中,这导致即使是一个简单的应用也有约150MB的体积。更轻量的替代方案Tauri则采用了完全不同的策略:它使用Rust编写后端逻辑,前端复用操作系统自带的WebView组件(macOS上是WebKit,Windows上是WebView2,Linux上是WebKitGTK),因此打包体积可以压缩到几MB。2023年发布的Tauri 2.0还增加了移动端支持,同一套HTML代码可以同时打包为桌面和移动应用。这意味着AI生成的HTML原型,理论上可以几乎零改动地封装成一个真正的桌面应用。这条「AI生成HTML → 验证交互 → 封装为客户端」的工作流,正在成为独立开发者和小团队的标准产品开发路径。
「不讲道理的高效」背后的逻辑
Claude团队用的那个词「Unreasonable Effectiveness」——不讲道理的高效,指的不是HTML多神奇。它指的是:当你和AI讲同一门语言,效率会被指数级放大。
你说一句,AI做一版;你看懂了改一改,AI再做一版。三轮下来,别人可能还在排队等设计师排期,你的产品就已经上线了。
HTML不是突然又火了,它从来都没走。只是这一次,AI让我们重新看见了它的价值——它是人与AI之间最高效的沟通介质。
核心要点
- HTML是AI时代人机协作的最佳语言,因为它同时满足「AI方便写」和「人方便看」两个条件
- 浏览器提供了安全、跨平台、零安装的代码运行环境,是AI输出结果的天然载体
- HTML的全文本特性和有限的标签词汇表,使得AI生成HTML的准确率远高于其他格式
- 掌握HTML三件套(HTML骨架+CSS皮肤+JS肌肉)的基本概念,就能读懂AI生成的任何界面代码
- 「AI生成HTML → 验证交互 → 封装为客户端」正在成为小团队的标准产品开发路径
相关推荐

WorkBuddy安装MCP连接器与Skill技能同步完整教程
详解WorkBuddy安装本地MCP连接器,通过AI对话实现Skill技能在Cursor等多个AI工作台间一键迁移与自动同步的完整操作流程。

激光雷达揭秘古城:LiDAR如何重写失落文明史
探索LiDAR激光雷达技术如何穿透沙漠与丛林,揭示约旦塞拉古城的地下水窖系统和太平洋南马都尔水上巨城的隐藏建筑,重新书写失落文明的历史。

阿波罗计划的灾难与荣耀:重返月球前必须回望的历史
从阿波罗1号的致命火灾到阿波罗8号的绕月冒险,再到阿波罗11号的成功登月,回顾阿波罗计划中那些鲜为人知的灾难、恐惧与妥协,以及对当下重返月球的深刻启示。