大语言模型
Core Facts
'Hallucination' refers to large language models generating plausible-sounding but factually incorrect content with high confidence
Mainstream Agent architectures typically use a large language model as the brain, combined with memory modules, planning modules, and tool interfaces to accomplish complex tasks
推理模型在需要多步逻辑推导的信息综合任务中表现更优,但延迟更高,需根据任务特性合理选用
Timeline (last 90 days)
自适应界面的研究由来已久,但大语言模型的出现让理解用户意图第一次变得真正可行
实时调用大模型生成界面在延迟和成本上不可忽视
2023年以来多项研究已在就业推荐、贷款审批建议等领域发现类似的大模型偏见现象
研究显示,当对话中出现暗示用户经济状况的线索时,AI模型给出的价格建议会出现系统性偏移,对较富裕用户推荐价格偏高,对经济条件一般用户推荐更便宜选项
大模型不需要持久化存储用户数据,仅凭单次对话的自然语言输入就能完成即时推断
从精确命令到自然语言交互的转变使系统输出从确定性结果变为概率性生成,用户需建立新的心智模型来判断何时信任模型输出
大语言模型的说服力陷阱本质是校准失败,输出流畅度与事实准确性之间不存在正相关
意图识别(Intent Detection)试图在语义层面判断发帖者的真实需求,通常依赖大语言模型理解帖子上下文,而非简单字符串匹配
RadOnc-Agent是一个用大语言模型作为调度核心的智能体框架,目标是把分散的放疗AI能力串联成可协同的流水线
一项发表于arXiv的研究提出了「零样本可视化」(Zero-Shot Visualization,简称ZSV)这一任务,将大语言模型的语义理解能力引入文本语料的视觉探索中
40 more timeline events
All Facts (20)
'Hallucination' refers to large language models generating plausible-sounding but factually incorrect content with high confidence
90%VerifiedMainstream Agent architectures typically use a large language model as the brain, combined with memory modules, planning modules, and tool interfaces to accomplish complex tasks
90%Verified推理模型在需要多步逻辑推导的信息综合任务中表现更优,但延迟更高,需根据任务特性合理选用
90%Verified大语言模型的上下文窗口决定了模型在单次推理中能处理的信息量上限
90%Verified更大的模型往往更具Token效率,能用更少的交互轮次和更精炼的推理完成任务
90%Verified训练一个顶级大模型的成本已达数亿美元级别
90%Verified现代大语言模型通常经历预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)三个训练阶段
90%VerifiedLLM存在'Lost in the Middle'现象,即模型对上下文开头和结尾的信息关注度高,而对中间部分的信息容易忽略
90%Verified2023年以来随着大语言模型能力的提升,AI智能体从学术概念迅速走向实际产品落地
90%Verified大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间
90%Verified新一代AI代码生成工具能将自然语言需求分解为完整工程任务,自主选择技术栈、生成文件结构并完成调试闭环
90%VerifiedToken是大语言模型处理文本的基本单位,大约对应0.75个英文单词或1.5个汉字
90%Verified大语言模型的计算成本主要取决于token数量、模型参数规模和上下文窗口大小
85%Verified现代多语言大模型在预训练阶段建立语言无关语义表示,通过海量多语言语料联合训练在高维向量空间中构建跨语言语义对齐
85%Verified检索增强生成(RAG)通过引入实时网络搜索并附上引用来源来锚定事实,但其效果受搜索结果质量、文档解析准确率、模型理解能力等环节影响
85%Verified大语言模型并不真正理解情感,而是识别出文体的典型模式进行模式匹配
85%Verified模型崩溃指AI模型使用前代模型生成数据训练后,经过多代迭代输出分布会逐渐偏离原始真实数据分布,丢失分布尾部信息
80%Verified大模型回复的内容本质上是其训练时那个时间点的数据,存在明确的知识截止时间(knowledge cutoff)
80%VerifiedLarge language models are trained on vast corpora of text data and learn to predict the probability distribution of the next word
80%Verified合理的 AI 审计工作流是让 AI 先行大范围扫描标记可疑区域,再由密码学专家聚焦深入验证,形成AI负责广度、人类负责深度的协同模式
80%