Strata
开源的LLM语义中间层工具,在数据与模型之间插入可控的语义层,通过规则约束拦截不合规、不安全或超出权限的LLM请求,支持可审计的允许/拒绝策略表达
Core Facts
Timeline (last 90 days)
该事件目前主要来自单一爆料者的观察,缺乏项目维护方的回应与独立佐证,具体动机未确认
该开发者运行项目的UPDATE脚本时Git操作失败,报错'no common ancestor'(没有共同祖先)
开源项目Strata改写了其GitHub提交历史,以抹除提交信息中的'Co-Authored by Claude'署名
Strata默认单卡运行,通过添加参数可启用双显卡
256K上下文约需70GB显存
UP主实测64K上下文下生成速度每秒90多token,256K上下文降到每秒60多token
Strata模型文件本身约60GB,是安装过程中最耗时的环节
约36GB内存建议装Q2版本,64GB以上(权重大于43GB)可选更高精度版本
Strata提供Q2、RQ2、RQ3SS等多个量化版本,以及专门用于写代码的code版本
Strata集成MTP投机解码提升生成速度,其解码器权重约0.71GB(Q2两位量化)
40 more timeline events
All Facts (20)
该项目已在GitHub开源
80%Verified在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒
70%Verified在输出(Decode)速度测试中,2 万 token 以内可达约 45 tokens/秒,3 万 token 以上骤降至约 20 tokens/秒
70%Unverified内存默认4GB可自行扩展至32GB,对于需要大量Docker容器、虚拟机或Surveillance Station多路监控的用户,建议购入后优先加装内存,第三方兼容内存条普遍可用且远低于官方内存价格
90%Unverified128GB以上大容量U盘优先选带DRAM缓存或高性能主控的型号(如固态U盘),普通闪存U盘容量越大持续写入越容易掉速,实际体验不如同价位移动固态硬盘
75%Partially VerifiedStrata的核心做法是当专家不在GPU上时由CPU直接在内存中就地计算,GPU并行处理缓存中的专家,使内存成为第二个计算域而非慢速虚拟显存
65%Partially VerifiedStrata使用低比特量化,最小配置约需38GB的内存+显存总和,最高质量配置约需55GB,64GB系统内存是理想目标
65%Unverified官方估计24GB显卡约能跑100~140 tokens/秒
60%Unverified该事件目前主要来自单一爆料者的观察,缺乏项目维护方的回应与独立佐证,具体动机未确认
50%UnverifiedStrata默认单卡运行,通过添加参数可启用双显卡
50%UnverifiedStrata对显存要求不高,对内存要求反而更严格
50%UnverifiedStrata默认服务端口是本地8080,可在启动脚本中修改
50%UnverifiedStrata模型文件本身约60GB,是安装过程中最耗时的环节
50%UnverifiedStrata项目将Qwen3 Next 125B大模型量化后,通过内存调度让消费级显卡本地运行
50%Unverified约36GB内存建议装Q2版本,64GB以上(权重大于43GB)可选更高精度版本
50%UnverifiedUP主实测64K上下文下生成速度每秒90多token,256K上下文降到每秒60多token
50%UnverifiedStrata集成MTP投机解码提升生成速度,其解码器权重约0.71GB(Q2两位量化)
50%UnverifiedStrata引擎部分用C++编写,通过Python脚本调用配置
50%UnverifiedStrata提供Q2、RQ2、RQ3SS等多个量化版本,以及专门用于写代码的code版本
50%Unverified256K上下文约需70GB显存
50%