[控场AI]
概念LLM / 大语言模型 / Large Language Model

大模型

大模型(Large Model)是指基于深度学习技术、具有大规模参数量的机器学习模型,涵盖语言、视觉、多模态等多种类型。其通过在海量数据上进行预训练,获得通用的知识表示与推理能力,可通过微调或提示工程适配问答、生成、分类、翻译等多种下游任务,是当前人工智能领域的主流技术范式之一。

核心事实

时间轴 (近 90 天)

10月2日

该机构课程覆盖大模型、智能体、Java全栈、Python、云计算、AIGC、嵌入式、Web前端等多个方向,范围过广往往意味着难以深入

待验证50%
10月2日

传统大模型本质上是一个无状态的函数,每次对话都从空白开始,上下文窗口超出长度限制便会被截断

待验证50%
10月1日

原生大模型只掌握训练时的知识,对训练之后发生的事情往往会产生错误回答

待验证50%
10月1日

用户调用原生大模型通常有两条路:编写代码或通过API接口调用

待验证50%
10月1日

大模型的知识停留在训练完成的时间点之前,对训练之后发生的新事件一无所知

待验证50%
10月1日

大模型(LLM)没有记忆,每一次对话都当作独立交互,难以支撑连续性的复杂任务

待验证50%
10月1日

裸大模型只能决定要调用某个工具,但不会真正执行工具,而 Agent 能真正执行工具调用并返回结果

待验证50%
9月30日

代码能力越强的模型在带来生产力的同时也带来更高的滥用潜力,对接入外部输入或执行代码的场景需要额外的沙箱与审计机制

待验证50%
9月30日

Java 微服务与大模型目前是两套独立运行、定位分明的技术体系,若要让二者协同工作,必须引入一层中间连接技术。

待验证50%
9月30日

大模型看到的只是一段字符串,缺乏可靠信号判断工具调用是成功、失败还是部分完成

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

模型能力越强、越能调用外部工具,其潜在攻击面就越广,这是AI厂商面临的根本性两难困境

90%
已验证

微调是在通用预训练模型基础上用特定领域数据进行二次训练,使模型能将领域知识内化为参数,推理时无需额外检索步骤,延迟更低

90%
已验证

同一个AI模型面对不同质量的提示词,输出效果可能存在数量级的差异

90%
已验证

大模型回复的内容本质上是其训练时那个时间点的数据,存在明确的知识截止时间(knowledge cutoff)

80%
已验证

AI Agent与传统聊天AI的根本区别在于具备感知-决策-行动的闭环能力,采用ReAct(Reasoning + Acting)框架

80%
已验证

Agent的核心公式为:Agent = 大模型 + 工具调用 + 自主决策能力

80%
已验证

AI Agent具备工具调用(Tool Use)和规划推理(Planning & Reasoning)两大核心能力,能将复杂目标自动分解为可执行的子任务序列

80%
已验证

大型语言模型存在知识截止日期的固有局限,模型只包含训练数据截止日期之前的信息

80%
已验证

大模型幻觉的技术本质在于模型在训练时学习的是语言模式的概率分布而非事实本身

80%
已验证

训练一个前沿大模型需要投入数亿美元的算力、数据清洗和人力

80%
已验证

2024年以来大模型API价格战愈演愈烈,多家厂商多次大幅降价

80%
已验证

大模型竞争重心正从对话能力向行动能力(通用智能体)迁移

75%
已验证

工具调用的基本原理是模型识别需要外部能力的场景,输出结构化的函数调用请求(通常为JSON格式),由外部系统执行后返回结果给模型继续推理

75%
已验证

推理时间长并不总是带来更好的结果,模型可能陷入过度思考的陷阱,真正决定输出质量的是模型的基础能力和对齐程度

75%
已验证

单纯堆砌参数而训练数据不足会导致模型大而不强,参数跃升需配合同步扩大的训练语料与算力才能兑现能力增益

75%
已验证

当前大模型本质上是静态的,训练完成后权重被冻结,知识停留在训练截止日期

75%
已验证

无代码开发平台与AI大模型的结合正在让非技术用户能够在不需要编程基础、服务器运维知识和UI设计能力的情况下完成AI应用的全流程开发

75%
已验证

原生大模型存在没有记忆、有知识截止时间、无法联网、无法操作工具和电脑等缺陷

70%
已验证

过去两年,随着大模型技术的爆发式发展,AI产品经理岗位的用人需求呈现显著增长

70%
已验证

大模型的预训练数据有明确的截止时间,模型内部不包含企业私有数据,直接询问企业私有信息时会产生幻觉

70%

来源文章