PSSA:用Rust从零构建的非Transformer语言模型

PSSA是一个用Rust从零构建、完全绕开Transformer的开源语言模型探索项目。
PSSA是一个在当前大模型主流范式之外进行独立探索的开源项目:它完全用Rust编写,且刻意回避了Transformer架构。文章分析了这两个非主流选择背后的技术逻辑——Transformer的平方级注意力复杂度、参数膨胀和架构同质化是其主要痛点,而Mamba等状态空间模型与线性注意力的兴起,正说明学界对替代方案的需求是真实存在的;选择Rust则意味着以构建大量基础设施为代价,换取性能可控、部署简洁和从底层理解模型的可能。作者对PSSA的定位保持了清醒:它目前更具教学与架构实验价值,而非生产级竞争方案,但其「非主流语言+非主流架构+从零构建」的实践方式,本身就为AI生态增添了值得关注的多样性。
一个反主流的探索
在Transformer架构几乎垄断整个大语言模型领域的当下,一个名为PSSA的开源项目选择了另一条路径:完全用Rust从零实现,且刻意避开了Transformer。这个项目近期出现在Hacker News上,虽然讨论热度不算爆炸性(17个赞、3条评论),但它所代表的技术方向值得关注。
PSSA的核心主张在于两点——非Transformer架构与从零手写的Rust实现。这两个选择都不是随大流的做法,反而透露出作者试图在既有范式之外寻找可能性的意图。
为什么要避开Transformer
自注意力机制(Self-Attention)驱动的Transformer架构,凭借其并行化能力和对长程依赖的建模优势,成为了从GPT到各类开源大模型的标准底座。但这套架构并非没有代价:
- 注意力计算的复杂度随序列长度呈平方增长,长文本处理成本高昂;
- 模型参数规模与训练资源需求持续膨胀,普通开发者难以参与底层创新;
- 架构层面的同质化,使得大量研究集中在同一条技术路线上。
PSSA这类非Transformer模型的意义,正在于探索是否存在更轻量、更高效或结构上更简洁的替代方案。近年来学界也涌现出如状态空间模型(如Mamba)、线性注意力等一系列尝试,试图打破Transformer的绝对主导。PSSA可以看作这股探索浪潮中的一个独立实践。
状态空间模型(SSM)是目前最受关注的Transformer替代方向之一。以Mamba为代表的SSM架构,借鉴了经典控制论中的状态空间表示,通过隐式状态向量来压缩历史序列信息,而非像注意力机制那样显式地对所有位置对进行两两计算。这使得SSM在处理长序列时的计算复杂度可以降低到线性级别(O(n)),相较于标准Self-Attention的O(n²)有显著优势。线性注意力则是另一条思路,通过核函数近似将注意力矩阵的计算解耦,同样达到线性复杂度。这些探索的共同动机是:保留序列建模能力的同时,打破二次方复杂度的计算瓶颈,让语言模型在长文本和资源受限场景中更具实用性。PSSA选择非Transformer路线,意味着它可能与这一类方法在设计哲学上存在共鸣,尽管其具体架构细节仍需从源码中进一步解读。
选择Rust意味着什么
绝大多数机器学习项目建立在Python生态之上,依赖PyTorch、TensorFlow等成熟框架。PSSA选择用Rust从头编写,是一个颇具工程野心的决定。
Rust作为系统级编程语言,具备接近C/C++的性能表现,同时通过所有权模型提供了内存安全保障。将其用于语言模型实现,潜在的好处包括:
- 性能可控:不依赖庞大的Python运行时和第三方框架,底层计算路径更透明;
- 部署友好:Rust编译产物是独立的二进制文件,便于在资源受限环境中运行;
- 教育价值:从零手写迫使作者理解模型每一层的实现细节,这对学习者极具参考意义。
代价同样明显——Rust在机器学习领域的生态远不如Python成熟,缺少即插即用的高层库,意味着作者需要自行实现大量基础设施。这也从侧面反映出「from scratch(从零构建)」的分量。
Rust的所有权(Ownership)模型是其区别于C/C++的核心设计——编译器在编译期静态追踪每一块内存的生命周期,强制保证不会出现悬空指针、数据竞争等经典内存安全漏洞,而无需依赖垃圾回收器带来的运行时开销。这一特性对机器学习推理引擎尤为重要:张量运算涉及大量连续内存的分配与释放,Rust可以在不牺牲性能的前提下提供比Python更强的安全保障。目前Rust机器学习生态虽不成熟,但已有candle(HuggingFace出品)、burn等框架在探索这一方向,证明Rust用于神经网络推理具备工程可行性。从零手写意味着作者无法借助这些框架的现成算子,需要自行实现矩阵乘法、激活函数、前向传播等基础模块,这正是「from scratch」真正的技术含量所在。
独立项目的价值定位
需要清醒看待的是,从Hacker News上有限的讨论量来看,PSSA目前更像是一个技术探索型的个人/小团队项目,而非能与主流大模型竞争的生产级方案。它的价值主要体现在几个层面:
首先是教学与研究参考。对于想深入理解语言模型内部机制的开发者,一个不依赖黑盒框架、代码可读性强的Rust实现,是绝佳的学习材料。
其次是架构实验平台。非Transformer的设计为尝试新型序列建模方法提供了一块干净的画布,避免了在现有框架约束下缝补的困扰。
最后是工程范式的示范。它证明了用系统语言实现完整语言模型的可行性,为那些关注性能与部署效率的场景提供了思路。
值得持续观察
PSSA所代表的方向,契合了当前AI社区中一股正在增长的诉求:在巨头主导的大模型军备竞赛之外,寻找更开放、更可控、更易于理解的技术路径。无论最终这个具体项目能走多远,这种「用非主流语言、非主流架构从零构建」的实践本身,就为整个生态增添了多样性。
对于关注底层技术的开发者而言,PSSA是一个值得关注、也值得动手研究的开源尝试。它提醒我们,语言模型的实现方式远不止一种,而技术进步往往正源于这些不走寻常路的探索。
相关推荐

AI Agent全解析:从Claude到Devin,智能体如何重塑计算方式
一文读懂AI Agent(AI智能体):从OpenAI、Claude、Gemini到Devin、Manus、Cursor,解析智能体的工作原理、主流产品格局,以及自主性、工具、记忆等五大区分维度,看懂AI从回答到执行的根本转变。

Devin 获得记忆能力:Memory 与 Dreaming 如何改变编程智能体
Cognition 为编程智能体 Devin 推出 Memory 与 Dreaming 功能,实现跨会话记忆持久化。记忆以 Git 仓库中的 markdown 文件存储,并通过每日后台进程自动整理,同时开源了记忆标准。本文解析其工作原理与现实意义。

单人用AI工具链攻破韩国银行:ARTEX背后的安全警示
韩国多家大型银行遭遇网络攻击,CrowdStrike报告指出攻击者可能为单人,使用了ARTEX开源AI渗透工具及DeepSeek、GLM、Grok、Claude Code等多个大模型组成的攻击栈。本文解析这一AI驱动型网络攻击的新形态及对金融安全的启示。