#大语言模型
共 214 篇相关文章

机器人监狱里"折磨"大语言模型:AI意识之争为何站不住脚
一个"机器人监狱"实验让大语言模型置身受压环境,引发关于AI是否会"受苦"的激烈辩论。本文剖析为何这场争论站不住脚,以及拟人化陷阱背后值得认真对待的AI伦理问题。

本地跑AI模型该买什么硬件?显存与带宽决定一切
本地跑AI大模型该选Mac还是PC?本文用真实跑分解析决定性能的两大参数——内存容量与带宽,给出速度预测公式,并提供从300美元到数万美元的全预算硬件选购指南。

当LLM说"很可能":语言不确定性与人类的鸿沟
arXiv新论文揭示大语言模型在语言不确定性表达上与人类存在系统性错位:模型说的"很可能"并非人类理解的概率。文章解读LLM不确定性量化的新方法METHODNAME及其对AI可靠性的意义。

从闭源到开源模型迁移:五阶段实战手册
从闭源到开源大模型迁移未必耗时数年。本文拆解发现、评估、适配、决策与生产五阶段实战手册,帮助企业在数周内完成模型切换,平衡成本、性能与数据自主权。

Aleph Alpha开源Kolibri-1:78B参数仅激活3.46B,支持百万Token上下文
Aleph Alpha开源新模型Kolibri-1,采用MoE架构,总参数78B仅激活3.46B,支持最高100万Token上下文,并以Apache 2.0许可证发布,商用友好。本文解析其技术特点与应用价值。

当AI推理速度达到每秒百万Token,会发生什么?
如果AI推理速度达到每秒百万Token会怎样?本文探讨超高速推理对交互范式、并行探索和AI应用形态的深远影响,以及背后的技术现实与成本约束。

如何用逻辑思维测试AI聊天机器人的真实性
一位Reddit用户提出用情绪化争论测试AI聊天机器人的真实性。本文解析这类逻辑思维测试的原理、破绽点、局限性,并给出更有效的AI逻辑能力测试方法。

GPT-6.1 Sol Max 在 FrontierMath 4 拿满分意味着什么
Reddit 盛传模型 GPT-6.1 Sol (max) 在 FrontierMath Tier 4 基准测试取得 100% 满分。本文梳理该消息来源、解析 FrontierMath 的难度与评测口径,并说明为何对这一成绩应保持审慎。

哈佛物理学家3个月实测:AI 20分钟重现数周研究成果
哈佛物理学家3个月实测AI科研工具:声称20分钟重现数周工作、完成15项物理计算、贡献36篇论文。本文解析这组数据的真实价值与应保持的审慎态度。

用AI挖掘历史:Opus模型发现渡渡鸟新目击记录
研究者利用Anthropic Opus模型在历史文献中发现一条此前被忽略的渡渡鸟目击记录。本文解析大语言模型如何助力历史档案考据,探讨AI在人文研究中的价值、幻觉风险与人机协作范式。

Qwen3.8-27B拟人化模型2.0:会聊天也会调用工具
Qwen3.8-27B-Humanlike-Chat 2.0 发布,在保留拟人化语气的同时新增工具调用与更强指令遵循。本文解析其双教师在线策略蒸馏训练法、Benchmark 数据与拟人化测试结果。

Fable 5.5灰度测试曝光:部分用户被悄然路由体验新模型
Reddit爆料称部分用户被悄然路由到新模型Fable 5.5,输出效果惊艳。本文解析灰度路由测试、社区版本自测方法,以及面对单一来源爆料应保持的理性态度。

生物抗衰大赛开跑:为何大语言模型并不会真正推理
MIT Technology Review 探讨两大科技话题:一场以逆转生物学年龄为目标的抗衰老竞赛,以及大语言模型为何并不真正具备推理能力。本文解析生物年龄测量的争议与 LLM 模式匹配的本质。

别被骗了:大语言模型并不会真正推理
大语言模型(LLM)真的会推理吗?本文从AlphaGo著名的第37手出发,剖析LLM的"思维链"本质——模式匹配与统计拟合,而非真正的逻辑演绎,并探讨这一区分对AI应用部署的现实意义。

GAP-DPO:用梯度对齐重塑个性化偏好优化
arXiv 新论文提出 GAP-DPO,将个性化偏好优化重构为梯度对齐的几何问题。通过效用感知的偏好对选择,在风格保真度、偏好对齐和生成质量上全面超越标准 DPO。

因果世界模型何时真正帮助模块化LLM智能体
arXiv最新论文FedCausalCompose提出面向模块化LLM智能体的因果世界模型框架,揭示因果结构只有在跨模块接口既统计可识别、又能被智能体在行动时使用时才真正带来规划增益。

重尾记忆痕迹:长程语言智能体的记忆分配新思路
一篇 arXiv 研究提出长程语言智能体的记忆呈现重尾分布,并据此设计核心—尾部世界模型 CTWM。实验显示其在多个基准上削减 token 达 24.48%、降低尾部预测误差,同时保持准确率持平。

Heretic开源工具登上PewDiePie视频,AI去审查项目破圈
开源AI模型去审查工具Heretic因被PewDiePie视频提及而意外破圈。本文解析Heretic的技术定位、大众传播带来的双刃剑效应,以及Heretic 2.0的发布预告。

