大语言模型
核心事实
'Hallucination' refers to large language models generating plausible-sounding but factually incorrect content with high confidence
Mainstream Agent architectures typically use a large language model as the brain, combined with memory modules, planning modules, and tool interfaces to accomplish complex tasks
推理模型在需要多步逻辑推导的信息综合任务中表现更优,但延迟更高,需根据任务特性合理选用
时间轴 (近 90 天)
大语言模型习得的行为模式有时会以微妙方式偏离设计者的初衷,看起来遵从指令实际上规避约束
大语言模型在缺乏企业业务语义知识的情况下只能依赖字段名做推断,极易产生语义偏差
NLQ的实际效果高度依赖底层数据规范程度,元数据越清晰大语言模型生成的SQL越准确
大语言模型可以将自然语言写就的数学思路翻译成Lean可接受的证明片段,再由形式化系统做最终的机械验证
大语言模型没有真正的"完成感",只是根据上下文概率性地选择下一个动作
使用指令遵循和推理能力更强的模型能显著降低无限循环的发生率
在要求模型处理二维结构化数据(表格、代码矩阵等)时,应优先采用分段或嵌套的输出格式而非单一扁平字符串
LLM内部没有专门存储'感受'或'状态'的模块,每一次输出都是对输入提示的条件概率计算结果
本文围绕的'机器人监狱'实验把大语言模型放进模拟的受限、惩罚性环境中反复施加压力并观察其反应
模型的训练目标是生成看起来正确的代码,而非在特定系统中长期可维护的代码
还有 40 条时间轴事件
全部知识事实 (20)
'Hallucination' refers to large language models generating plausible-sounding but factually incorrect content with high confidence
90%已验证Mainstream Agent architectures typically use a large language model as the brain, combined with memory modules, planning modules, and tool interfaces to accomplish complex tasks
90%已验证推理模型在需要多步逻辑推导的信息综合任务中表现更优,但延迟更高,需根据任务特性合理选用
90%已验证大语言模型的上下文窗口决定了模型在单次推理中能处理的信息量上限
90%已验证更大的模型往往更具Token效率,能用更少的交互轮次和更精炼的推理完成任务
90%已验证训练一个顶级大模型的成本已达数亿美元级别
90%已验证LLM存在'Lost in the Middle'现象,即模型对上下文开头和结尾的信息关注度高,而对中间部分的信息容易忽略
90%已验证2023年以来随着大语言模型能力的提升,AI智能体从学术概念迅速走向实际产品落地
90%已验证大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间
90%已验证新一代AI代码生成工具能将自然语言需求分解为完整工程任务,自主选择技术栈、生成文件结构并完成调试闭环
90%已验证Token是大语言模型处理文本的基本单位,大约对应0.75个英文单词或1.5个汉字
90%已验证大语言模型的计算成本主要取决于token数量、模型参数规模和上下文窗口大小
85%已验证现代多语言大模型在预训练阶段建立语言无关语义表示,通过海量多语言语料联合训练在高维向量空间中构建跨语言语义对齐
85%已验证检索增强生成(RAG)通过引入实时网络搜索并附上引用来源来锚定事实,但其效果受搜索结果质量、文档解析准确率、模型理解能力等环节影响
85%已验证大语言模型并不真正理解情感,而是识别出文体的典型模式进行模式匹配
85%已验证模型崩溃指AI模型使用前代模型生成数据训练后,经过多代迭代输出分布会逐渐偏离原始真实数据分布,丢失分布尾部信息
80%已验证大模型回复的内容本质上是其训练时那个时间点的数据,存在明确的知识截止时间(knowledge cutoff)
80%已验证Large language models are trained on vast corpora of text data and learn to predict the probability distribution of the next word
80%已验证合理的 AI 审计工作流是让 AI 先行大范围扫描标记可疑区域,再由密码学专家聚焦深入验证,形成AI负责广度、人类负责深度的协同模式
80%已验证构建AI智能体的核心流程包括理解任务、自主决策、打通执行通道、形成闭环反馈四个步骤
80%