AI两周自主设计部署AI加速器:芯片自动化工程迎来范式突破

AI系统仅需两位人类架构师写规格,两周内自动完成芯片设计、验证与部署全流程。
一项最新研究展示了名为Redwood的AI加速器设计过程:仅由两名人类架构师编写顶层硬件规格,AI系统在两周内自动完成RTL代码生成、UVM验证环境搭建、形式化证明、固件及内核开发,规格层以下全程无人工介入。Redwood专为单批次低延迟推理优化,在三星8nm工艺的投影数据中,相比Jetson Orin Nano实现1.75倍吞吐提升和3.4倍能效比改善,其FPGA变体已能运行Llama和Qwen等主流大语言模型。该系统声称每个模块达到95%验证覆盖率,且一次规格变更的完整迭代周期仅需48小时。不过,核心性能数据基于模型推算而非流片实测,对比基准的公平性及覆盖率定义等关键问题仍需独立验证。
当AI开始自己设计AI芯片
芯片设计一直被认为是最难被自动化的工程领域之一。它横跨系统架构、微架构设计、寄存器传输级(RTL)编码、验证、形式化证明、固件开发乃至底层内核优化,每一层都需要资深工程师的深度介入。然而,一项最新研究正在挑战这一认知。
据公开的研究成果,一套AI系统在仅两名人类架构师编写硬件规格说明书的前提下,自动生成了规格之下的所有内容——性能模型、RTL代码、UVM验证环境、形式化证明、固件和内核,全程在两周内完成,且规格层以下没有任何人工干预。

这意味着人类的工作被压缩到了最抽象的顶层:定义"我们想要什么",而"如何实现"的全部工程细节,交由AI系统闭环完成。这是自动化系统工程(Automated Systems Engineering)领域一次极具野心的尝试,也让芯片设计自动化的讨论进入了全新阶段。
Redwood:面向低延迟推理的专用加速器
这套AI全自动流程的产物是一款名为 Redwood 的AI加速器,专门针对单批次(single-batch)低延迟推理场景进行优化。这类场景在边缘部署和实时交互式AI应用中至关重要——你需要的不是海量并发吞吐,而是单个请求的最快响应时间。
Redwood 性能数据一览
根据研究方公布的投影数据,Redwood 在 三星 8nm 工艺上的表现相当亮眼:
- 相较实测的 Jetson Orin Nano,推理吞吐量达到 1.75 倍
- 功耗降低 1.9 倍
- 综合计算,每瓦性能提升 3.4 倍
每瓦性能(Performance per Watt)是衡量AI加速器的核心指标,尤其在边缘计算和嵌入式场景中,3.4倍的能效增益足以改变部署的经济模型。此外,Redwood 的 FPGA 变体能够运行数十亿参数级别的 Llama 和 Qwen 模型,说明这套设计并非玩具级验证品,而是能承载主流大语言模型的实用架构。
单批次低延迟推理(single-batch low-latency inference)与高吞吐批量推理代表了AI加速器设计的两种根本性权衡。高吞吐场景下,加速器通过将大量请求打包成大批次(large batch)来最大化矩阵运算单元的利用率,牺牲单次响应延迟换取整体吞吐量。而单批次场景下批次大小为1,矩阵乘法的计算强度大幅下降,访存带宽成为主要瓶颈,此时传统为高吞吐优化的GPU架构效率会显著下降。针对这一场景的专用加速器通常在片上存储(SRAM)容量、低延迟互连和权重预取机制上做特殊设计。边缘部署和实时对话类AI应用(如语音助手、实时翻译)对首token延迟极为敏感,是这类加速器最直接的应用场景。
全流程闭环:从自动验证到硬件在环部署
真正让这项工作引人注目的,不是生成了RTL代码本身,而是它打通了从代码生成到验证再到硬件部署的完整闭环。
研究声称,每一个功能模块都通过以下手段达到了 95% 的验证覆盖率:
- 商用 EDA 工具(电子设计自动化行业标准工具链)
- 专有的形式化验证引擎
- 硬件在环(Hardware-in-the-Loop)验证
覆盖率是芯片验证质量的关键门槛。95% 的自动化覆盖率意味着AI系统不仅会"写代码",还能自主构建测试环境、执行形式化证明、并在真实硬件上验证功能正确性。这三层验证手段的组合,恰恰是传统芯片团队投入大量人力和时间的环节。
48小时完成一次完整迭代
更值得关注的是迭代速度。研究方称,一次规格变更从修改到重新验证、再到重新部署上硬件,只需要 48 小时。
在传统芯片开发流程中,一次规格级别的改动可能引发数周甚至数月的重新验证周期。如果48小时的闭环真实可靠,这将从根本上改变硬件设计的迭代节奏——让芯片开发第一次接近软件领域习以为常的"快速迭代"体验。
UVM(Universal Verification Methodology)是芯片验证领域的行业标准方法论,基于SystemVerilog语言构建,通过面向对象的框架组织测试激励、参考模型和覆盖率收集。一套完整的UVM验证环境搭建通常需要数周时间,且需要专职验证工程师维护。形式化验证(Formal Verification)则通过数学方法穷举所有可能的输入状态来证明电路行为的正确性,相比仿真测试更严格,但对工程师的数理背景要求极高。硬件在环(Hardware-in-the-Loop,HiL)验证是指将生成的RTL代码综合并部署到FPGA上,在真实时序环境中运行测试用例,能够捕获纯仿真难以暴露的时序和接口问题。三种验证手段各有侧重:UVM侧重功能覆盖、形式化验证侧重逻辑正确性证明、HiL侧重真实硬件行为——同时自动化这三层,是该工作在验证层面最值得关注的技术主张。
如何理性看待这项成果
从公开信息来看,这项工作的核心意义在于展示了一种新的芯片工程范式:人类专注于顶层意图与规格定义,AI负责其下全部的实现、验证与部署链条。
不过,保持理性审视非常必要。目前信息主要来源于研究方自身发布的内容,以下几个关键点仍待独立验证:
- 性能数据基于投影(projected)而非流片实测。三星8nm上1.75倍吞吐、3.4倍能效比是基于模型推算,实际流片后的数据可能存在差距。
- 对比基准的公平性存疑。Jetson Orin Nano 是一款通用边缘计算平台,专用加速器在特定推理任务上超越它并不意外,关键要看对比条件是否对等。
- 95%覆盖率的具体定义。覆盖率有代码覆盖率、功能覆盖率、分支覆盖率等多种口径,不同定义下的含金量差异巨大。
- "无人工干预"的实际边界。规格之下全自动的前提,是人类编写了一份足够精确的硬件规格说明书——这份规格本身的工程含量和编写难度并未被充分披露。
RTL(Register Transfer Level,寄存器传输级)是芯片设计中介于系统架构与物理版图之间的关键抽象层,用硬件描述语言(HDL,如Verilog或VHDL)描述数据在寄存器之间的流动逻辑。RTL代码是EDA工具链进行逻辑综合、布局布线的直接输入,其质量直接决定最终芯片的面积、时序和功耗。自动生成RTL代码此前已有学术探索,但这些工作通常局限于小型模块或特定电路结构,且生成结果往往需要人工修正才能通过综合与验证。该研究声称对完整加速器的所有功能模块均实现了自动RTL生成且通过多层验证,若属实则代表了生成规模和可靠性的显著跃升——但这也正是需要独立复现才能确认的核心主张。
硬件设计的AI拐点正在到来
无论最终数据能否经受同行评审的严格检验,这项工作都指向一个清晰趋势:AI正在从芯片的"使用者"演变为芯片的"设计者"。当AI系统能够自主完成从架构实现到验证部署的全栈流程,芯片设计的门槛、成本与开发周期都可能被重新定义。
如果闭环迭代真能压缩到48小时,硬件领域的敏捷开发时代或许正在到来。对这一方向感兴趣的读者,建议直接查阅原始论文,结合未来的流片实测数据与独立复现结果,再对这些惊人数字做出最终判断。
相关推荐

Rootprint:基于S3对象存储的低成本开源日志搜索工具
Rootprint 是一款基于 Quickwit 和 S3 对象存储的开源日志与追踪搜索工具,支持倒排索引全文检索,月存储成本仅300美元即可保留24个月日志。适合个人开发者和小团队的轻量级可观测性方案。

OpenAI声称攻克数学难题:AI推理能力的重大突破
OpenAI宣布其AI代理解决重要数学开放性问题,引发学术界广泛争议。深度解析AI数学推理能力突破的意义、验证挑战及对科学研究的深远影响。

告别1Password:自托管密码管理器全方案对比
深度对比Vaultwarden、PassBolt、AliasVault、KeePass等自托管密码管理器方案,从Passkey支持、2FA、家庭共享到迁移成本,帮助你找到替代1Password的最佳选择。