#大语言模型
共 214 篇相关文章

小米 MiMo v2.6 发布:开源大模型再进一步
小米发布新一代大模型 MiMo v2.6,在 Hacker News 获得近三百点赞热议。本文梳理 MiMo 系列定位、小米自研大模型的战略意义,并分析其在开源模型竞争格局中的位置与看点。

Fable 5引发热议:AI推理能力真的在下降吗?
Hacker News 热议话题「Fable 5」指出 AI 推理能力中位数在八月出现下滑,引发社区对大模型表现波动的讨论。本文分析模型退化的可能原因与第三方监测的价值。

SAGE:用Schema引导LLM做拨款评审,人机协作达成中高一致性
arXiv 最新研究提出 SAGE 系统,用 Schema 引导大语言模型进行拨款评审。通过结构化检查与证据链接,SAGE 在人机协作模式下达成 kappa=0.58 的中高一致性,显著优于简单提示基线,为 AI 辅助专业评审提供可审计范式。

SpecOpt:用智能体优化药物分子的靶向特异性
SpecOpt 提出了一项全新的分子设计任务:通过智能体框架结合残基感知接触分析与大语言模型推理,优化现有药物的靶向特异性。在 915 个化合物上,84.8% 获得结合选择性改善。

AI精神科问诊质量如何把关?临床验证平台给出答案
arXiv最新研究提出InterviewPlayground平台,用记忆增强模拟患者对AI精神科问诊进行质量评估。试点显示LLM信息挖掘率达88%远超医生,但临床幻觉更多、安全隐患刻画不足,为AI医疗部署提供质量把关框架。

聊天式大语言模型:为何它像通灵骗术一样让人上头
一篇研究指出聊天式大语言模型复制了通灵者冷读术的核心机制,通过迎合性与模糊表述让用户产生「AI 懂我」的信任幻觉。本文解析 LLM 与冷读术、巴纳姆效应的相似性及其认知风险。

厌倦了AI腔调:大模型千篇一律的语气从何而来
越来越多用户厌倦了ChatGPT、Claude等大模型千篇一律的"AI腔调"。本文解析这种同质化语气的成因、影响,以及通过提示词优化等方式减轻AI味道的实用方法。

Elias Thorne现象:AI聊天机器人为何反复编造同一个虚构人物
AI聊天机器人为何反复编造名为Elias Thorne的虚构人物?本文解析这一现象背后的大语言模型幻觉机制、训练数据偏置与模型坍缩隐忧,并探讨其对AI内容可信度的启示。

阶跃星辰Step 5预览版登陆AA帕累托前沿
阶跃星辰Step 5 Preview大语言模型据称进入Artificial Analysis帕累托前沿,本文解读该说法背后的性能与成本平衡含义,并探讨如何理性看待大模型评测信号。

GPT-6 Astra破解一战德军无线电密码:AI推理能力新突破
OpenAI 新模型 GPT-6 Astra 据称破解了一战德军无线电密码,本文分析其背后的AI推理能力、历史密码学背景、社区质疑与实际应用边界。

GPT模型的"伤害洗白":性别歧视被转化而非消除
GPT模型中的性别歧视可能并未被消除,而是被转化为更隐蔽的形式,即"伤害洗白"(Harm Laundering)。本文解析这一AI偏见治理盲区及其对模型评估方法的启示。

Cache-to-Cache:让大模型跳过文本直接"心灵对话"
Cache-to-Cache(C2C)提出让大语言模型跳过文本、直接在KV Cache层面进行语义通信的新思路,减少多模型协作中的信息损耗与重复计算。本文解析其核心机制、优势与技术挑战。

AI Agent智能体入门:从传统程序到感知决策行动闭环
零基础入门AI Agent智能体:讲解传统程序与智能体的本质区别、感知决策行动核心能力闭环、大语言模型+工具调用+记忆系统的技术栈,以及客服、数据分析等典型应用场景。

Neo-Classic基准:大模型能真正读懂古典诗词吗?
Neo-Classic 是一个用于评估大语言模型古典中文诗词语言-美学推理能力的新基准。研究发现 Qwen3-Max、Gemini-3-Pro、DeepSeek-V3.2 等顶尖模型在当代格律诗上性能下滑20%-50%,篇章排序准确率仅0%-13%,暴露全局规划能力短板。

让LLM主动发现用户矛盾:UC-Bench与SynUC合成方法解析
arXiv最新研究提出UC-Bench基准与SynUC约束引导合成方法,解决人机对话中用户侧隐性冲突检测难题。基于UC-Data训练的Qwen3.5-4B小模型在该任务上超越Claude Opus等更大模型,为对话系统可靠性研究提供新思路。

解剖对话式AI的网络搜索:ChatGPT、Claude、Grok谁更靠谱?
arXiv最新研究首次系统剖析ChatGPT、Claude、Grok、DeepSeek四大对话式AI的网络搜索全流程,揭示搜索决策、查询策略、领域偏好与引用缺失等关键问题,为AI代理可靠性提供实证。

解码LLM基准测试:14767篇论文揭示评估变迁
一项分析 14767 篇 arXiv 论文的研究揭示 LLM 基准测试的设计变迁:评估重心转向行动与交互,LLM 打分日益普遍,并引出评估独立性的深层隐忧。

PrismML押注微型大模型:小体积能否改写AI使用方式
AI实验室PrismML押注微型大语言模型(tiny LLM),试图通过小体积、低成本、可本地运行的路线改变人们使用AI的方式。本文解析微型LLM的价值、行业逻辑与待验证的关键问题。

