AI Knowledge Feed
Real-time tracking of AI knowledge changes — multi-source cross-verified structured facts
7/25/2026
现有AI系统改进的是输出质量而非自身的权重结构或训练流程,与真正的递归自我改进之间存在技术鸿沟
DeepSeek-R1以约600万美元的训练成本达到接近GPT-4的推理能力
LiveCodeBench基准于2024年发布,专门收集模型训练截止日期之后发布的竞赛新题,其设计者发现顶级模型性能普遍下降15-30%
LoRA在前向传播时原始权重W₀保持冻结,输出变为h = W₀x + (BA)x/√r,对于SD 1.5模型在rank=4时整个LoRA文件约只有3-6MB
CivitAI的Buzz商业化模式核心风险在于一旦核心用户感知到Pay-to-Win倾向迁移成本较低,竞争对手如LiblibAI和Tensor.Art正在争夺市场
运行700亿参数级别开源模型在 FP16 精度下至少需要约 140GB 显存,即 8 张 H100 并行
GPTQ 适合离线批量推理,AWQ 在移动端与边缘设备表现更优,GGUF 专为 CPU 推理场景优化
项目想法有两个来源:自己的摩擦点用于打磨自用工具,别人的摩擦点用于挖掘可规模化的产品机会
寻找别人摩擦点的方法是查看小红书、贴吧、应用商店评论区的差评,差评中的「要是能就好了」就是需求说明书
App Store 和 Google Play 的评论数据可通过 Sensor Tower、AppFollow 等工具批量抓取分析
DeepSeek旗舰版总参数约1.6万亿,激活参数490亿;轻量Flash版总参数2840亿,激活参数130亿,支持100万Token的上下文窗口,采用MIT协议开源
Switch Transformer将专家数量扩展至2048个,2022年谷歌GLaM模型进一步验证了MoE在多任务泛化上的优势
AI 工具将开发执行成本压缩至数小时后,原本属于长尾痛点的问题首次具备被系统性解决的可能
作者建议在备忘录里开一个清单,随手攒一周记录自己忍受过的小事作为项目灵感来源
梁文锋认为DeepSeek没有成文组织制度,靠愿景驱动