PSSA:用Rust从零构建的非Transformer语言模型

PSSA是一个用Rust从零构建、完全绕开Transformer的开源语言模型探索项目。
PSSA是一个在当前大模型主流范式之外进行独立探索的开源项目:它完全用Rust编写,且刻意回避了Transformer架构。文章分析了这两个非主流选择背后的技术逻辑——Transformer的平方级注意力复杂度、参数膨胀和架构同质化是其主要痛点,而Mamba等状态空间模型与线性注意力的兴起,正说明学界对替代方案的需求是真实存在的;选择Rust则意味着以构建大量基础设施为代价,换取性能可控、部署简洁和从底层理解模型的可能。作者对PSSA的定位保持了清醒:它目前更具教学与架构实验价值,而非生产级竞争方案,但其「非主流语言+非主流架构+从零构建」的实践方式,本身就为AI生态增添了值得关注的多样性。
一个反主流的探索
在Transformer架构几乎垄断整个大语言模型领域的当下,一个名为PSSA的开源项目选择了另一条路径:完全用Rust从零实现,且刻意避开了Transformer。这个项目近期出现在Hacker News上,虽然讨论热度不算爆炸性(17个赞、3条评论),但它所代表的技术方向值得关注。
PSSA的核心主张在于两点——非Transformer架构与从零手写的Rust实现。这两个选择都不是随大流的做法,反而透露出作者试图在既有范式之外寻找可能性的意图。
为什么要避开Transformer
自注意力机制(Self-Attention)驱动的Transformer架构,凭借其并行化能力和对长程依赖的建模优势,成为了从GPT到各类开源大模型的标准底座。但这套架构并非没有代价:
- 注意力计算的复杂度随序列长度呈平方增长,长文本处理成本高昂;
- 模型参数规模与训练资源需求持续膨胀,普通开发者难以参与底层创新;
- 架构层面的同质化,使得大量研究集中在同一条技术路线上。
PSSA这类非Transformer模型的意义,正在于探索是否存在更轻量、更高效或结构上更简洁的替代方案。近年来学界也涌现出如状态空间模型(如Mamba)、线性注意力等一系列尝试,试图打破Transformer的绝对主导。PSSA可以看作这股探索浪潮中的一个独立实践。
状态空间模型(SSM)是目前最受关注的Transformer替代方向之一。以Mamba为代表的SSM架构,借鉴了经典控制论中的状态空间表示,通过隐式状态向量来压缩历史序列信息,而非像注意力机制那样显式地对所有位置对进行两两计算。这使得SSM在处理长序列时的计算复杂度可以降低到线性级别(O(n)),相较于标准Self-Attention的O(n²)有显著优势。线性注意力则是另一条思路,通过核函数近似将注意力矩阵的计算解耦,同样达到线性复杂度。这些探索的共同动机是:保留序列建模能力的同时,打破二次方复杂度的计算瓶颈,让语言模型在长文本和资源受限场景中更具实用性。PSSA选择非Transformer路线,意味着它可能与这一类方法在设计哲学上存在共鸣,尽管其具体架构细节仍需从源码中进一步解读。
选择Rust意味着什么
绝大多数机器学习项目建立在Python生态之上,依赖PyTorch、TensorFlow等成熟框架。PSSA选择用Rust从头编写,是一个颇具工程野心的决定。
Rust作为系统级编程语言,具备接近C/C++的性能表现,同时通过所有权模型提供了内存安全保障。将其用于语言模型实现,潜在的好处包括:
- 性能可控:不依赖庞大的Python运行时和第三方框架,底层计算路径更透明;
- 部署友好:Rust编译产物是独立的二进制文件,便于在资源受限环境中运行;
- 教育价值:从零手写迫使作者理解模型每一层的实现细节,这对学习者极具参考意义。
代价同样明显——Rust在机器学习领域的生态远不如Python成熟,缺少即插即用的高层库,意味着作者需要自行实现大量基础设施。这也从侧面反映出「from scratch(从零构建)」的分量。
Rust的所有权(Ownership)模型是其区别于C/C++的核心设计——编译器在编译期静态追踪每一块内存的生命周期,强制保证不会出现悬空指针、数据竞争等经典内存安全漏洞,而无需依赖垃圾回收器带来的运行时开销。这一特性对机器学习推理引擎尤为重要:张量运算涉及大量连续内存的分配与释放,Rust可以在不牺牲性能的前提下提供比Python更强的安全保障。目前Rust机器学习生态虽不成熟,但已有candle(HuggingFace出品)、burn等框架在探索这一方向,证明Rust用于神经网络推理具备工程可行性。从零手写意味着作者无法借助这些框架的现成算子,需要自行实现矩阵乘法、激活函数、前向传播等基础模块,这正是「from scratch」真正的技术含量所在。
独立项目的价值定位
需要清醒看待的是,从Hacker News上有限的讨论量来看,PSSA目前更像是一个技术探索型的个人/小团队项目,而非能与主流大模型竞争的生产级方案。它的价值主要体现在几个层面:
首先是教学与研究参考。对于想深入理解语言模型内部机制的开发者,一个不依赖黑盒框架、代码可读性强的Rust实现,是绝佳的学习材料。
其次是架构实验平台。非Transformer的设计为尝试新型序列建模方法提供了一块干净的画布,避免了在现有框架约束下缝补的困扰。
最后是工程范式的示范。它证明了用系统语言实现完整语言模型的可行性,为那些关注性能与部署效率的场景提供了思路。
值得持续观察
PSSA所代表的方向,契合了当前AI社区中一股正在增长的诉求:在巨头主导的大模型军备竞赛之外,寻找更开放、更可控、更易于理解的技术路径。无论最终这个具体项目能走多远,这种「用非主流语言、非主流架构从零构建」的实践本身,就为整个生态增添了多样性。
对于关注底层技术的开发者而言,PSSA是一个值得关注、也值得动手研究的开源尝试。它提醒我们,语言模型的实现方式远不止一种,而技术进步往往正源于这些不走寻常路的探索。
相关推荐

吴恩达Agent课精华:从单代理到完全自动化的实践路径
吴恩达联合LangChain推出的AI Agents in LangGraph课程精华解读:涵盖Agentic Workflow五大设计模式、从零手写ReAct智能体、LangGraph节点与状态管理、Agentic Search、持久化与人类介入,以及多智能体等前沿架构。

AI编程工具自动执行该不该全开?权限管控实战指南
AI编程工具的自动执行功能要不要全开?本文从权限分层、任务拆分、命令审核等角度,给出实战可用的安全配置建议,帮助开发者在效率与控制之间找到平衡。

10个AI Agent全自动开发游戏:我一行代码都没写
一位创作者用约10个AI Agent并行全自动开发游戏,自己一行代码都没写,只负责描述需求。本文解析Agent灰盒迭代、过程文档化与Unity项目恢复能力等亮点。