LLM
大语言模型(Large Language Model,LLM),是基于深度学习技术、经过海量文本数据训练的自然语言处理模型。其核心能力包括文本理解、生成、推理与对话,能够处理翻译、摘要、代码生成、问答等多种语言任务。LLM通常采用Transformer架构,参数规模从数十亿到数千亿不等,是当前人工智能应用的重要基础组件。
Core Facts
Timeline (last 90 days)
LLM进行数学计算时依赖从训练数据学到的模式匹配,而非执行确定性算术逻辑,面对罕见组合(如大数乘法)准确率会急剧下降
涉及数字、事实和精确逻辑时不应盲目信任LLM的输出
对于需要精确计算的场景,应让模型生成代码或调用工具,而非直接让它回答
LLM处理的是token(词元)而非单个字符,导致在字符计数任务上存在天然缺陷
当前主流大语言模型的上下文窗口在128K-200K token之间,构成Agent能力的硬性天花板
作者预测所有繁琐的拖拽、属性设置乃至运动学配置,AI和LLM很快都能胜任
在LLM时代,RAG、Prompt Engineering、Agent框架等应用层技术使应用AI入门门槛降低,但对工程集成能力和领域知识要求提高
融合ASR、LLM、TTS的复杂系统如今已可由独立开发者借助成熟API快速搭建,这在两三年前几乎不可想象
控制LLM幻觉的工程方案包括关键事实锚定、后验检查(规则引擎验证)和引导式生成(结构化输出约束)
研究者已证明可以通过修改不到0.1%的训练数据实现LLM后门植入
40 more timeline events
All Facts (20)
大语言模型本质上是无状态函数,权重在推理时已经固定,不会随时间推移而学习
80%Verified大语言模型的涌现能力是指在参数规模突破某个阈值后突然展现出的复杂推理能力
80%VerifiedAI Agent底层通常由大语言模型(LLM)驱动,配合工具调用、记忆模块和规划框架(如ReAct范式)实现复杂任务自动化
80%VerifiedLLM的生成机制是基于概率的文本预测,而非真正'理解'代码语义
75%VerifiedLLM的输出具有天然的非确定性,即使输入相同的Prompt,模型在不同时刻可能返回格式、内容甚至逻辑不同的结果
70%Verified大语言模型基于Transformer架构,每次推理都是独立的前向传播过程,不保留任何会话状态
70%VerifiedLLM存在幻觉(Hallucination)问题,即以高置信度生成事实错误的信息
70%Verified大语言模型的幻觉问题源于其本质是基于统计概率的序列预测系统,生成的Token基于条件概率最大化而非真正的逻辑推理
70%Verified一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段
65%VerifiedAI 工具的上下文窗口从早期的 4K tokens 发展到如今的百万级 tokens
65%Verified大型语言模型通过将输入文本分割为tokens来处理语言,tokens可以是完整单词、子词片段或单个字符
65%UnverifiedHallucination refers to LLMs generating plausible-sounding but factually incorrect information
90%UnverifiedAI-powered phone answering involves ASR to convert speech to text, an LLM to understand intent and generate responses, and TTS to convert replies into voice output
90%UnverifiedKarpathy提出LLM特别擅长循环直到达成目标,应该给它成功标准而非告诉它做什么
90%UnverifiedLanguage models are fundamentally probabilistic text generation systems that produce content based on statistical patterns in training data rather than understanding facts
85%UnverifiedLLM在代码生成场景中引用软件包时,是基于上下文语义和训练数据模式合成一个看似合理的包名,而非从实际的包注册表中检索
85%UnverifiedAPI call prices for mainstream large models have dropped by orders of magnitude over the past two years
85%UnverifiedMainstream Agent architectures typically use a large language model as the brain, combined with memory modules, planning modules, and tool interfaces to accomplish complex tasks
85%UnverifiedA core limitation of current large language models is the finite context window
85%UnverifiedIn traditional programs, sleep is set by programmers based on clear technical requirements, while an LLM's sleep calls come from the model's own judgment
85%