本地Gemma对决GPT-5.4:都输给了每天说"涨"的机器人

四个月实验证明:所有大模型预测股价均不敌"永远说涨"的傻瓜规则,唯一亮点来自输入管道优化而非模型本身。
一位开发者历时四个月,以时间戳锁定、结果不可删除的严格方式,让本地Gemma 26B、Claude Opus 4.8和GPT-5.4预测股票每日涨跌,并与"永远说涨"的傻瓜基准持续对比。结果令人警醒:三个模型无一能够跑赢对应的基准线,顶级商业API与本地小模型几乎站在同一起跑线。唯一出现正向信号的变量,是将输入从静态历史价格换成当日有新闻驱动的股票,使准确率比基准高出7.6个百分点——尽管样本量有限,统计结论需谨慎。实验的核心启示是:在AI应用中,输入管道的设计远比模型选型更能决定系统效果上限,而这套透明、防作弊的评测框架本身也为AI能力评估提供了值得借鉴的范本。
一场持续四个月的股价预测实验
一位开发者在Reddit上分享了他历时四个月的实验:让多个大语言模型预测股票每日的涨跌方向,并将每次预测与真实价格进行严格比对。这个实验的独特之处在于它的透明度——所有预测都在提交时锁定时间戳,任何结果都不会被删除,全部记录在一个公开的排行榜(LDBD)上。
实验的参赛者阵容颇具代表性:一台笔记本上本地运行的4-bit量化Gemma 26B(基于MLX构建,而非Ollama,但原理相同),以及通过API调用的Claude Opus 4.8和GPT-5.4。三者获得的都是完全相同的提示词:给出最近的收盘价,然后回答"涨"或"跌"。
这是一个刻意设计得极其朴素的提示,目的是检验模型在最基础条件下的原生预测能力。

令人尴尬的结果:没有AI模型能打败"傻瓜规则"
实验结果堪称对AI预测能力的一次冷水浇头。
本地运行的Gemma 26B在453次评分预测中,准确率仅为49.2%——比抛硬币还差一点。但真正打脸的是对照基准:一个每天雷打不动地回答"涨"的傻瓜规则,在完全相同的预测标的上,准确率达到了53.4%。
有人可能会立刻嘲讽本地小模型不行,但作者提前堵住了这条退路——旗舰级API模型同样没能跑赢自己的基准线:
- Claude Opus 4.8:53.9%,而配对的"永远说涨"基准为54.6%
- GPT-5.4:50.5%,而配对基准为51.6%
- 本地Gemma 26B:49.2%,配对基准53.4%
换句话说,没有任何一个模型能战胜那个只会说"涨"的机器人。无论是本地运行的开源模型,还是价格不菲的顶级商业API,在朴素提示下都未能展现出超越随机基准的预测优势。
这个结果并不意外——它再次印证了金融市场的短期方向预测本质上接近随机游走。而牛市中股票"上涨概率略高于50%"这一统计事实,恰好让"永远说涨"成为了一个难以逾越的对照。
唯一奏效的变量:不是模型而是输入管道
实验中唯一出现亮点的组合,揭示了一个更值得深思的方向。
作者尝试改变输入管道:不再给Gemma喂一个固定的股票列表,而是每天挑选一只当天有新闻驱动的股票。这个改动让同样的本地Gemma模型,准确率比其配对基准高出了7.6个百分点(p≈0.02)。
当然,作者本人对此保持了克制的严谨:样本量较小,这个显著性也可能是多重比较带来的偶然运气。但即便如此,这个信号已经足够引人注目。
它指向一个核心结论:
到目前为止,输入管道的重要性远远超过模型本身。
同一个模型,同样的参数,仅仅因为喂给它的信息从"静态历史价格"变成了"当日新闻热点股",表现就出现了本质差异。这说明模型的预测能力并非源自其"智能",而是取决于输入信号中是否真的包含了有效信息。
这个实验对AI应用的启示
大模型不是万能预言机
这个实验最直接的价值,是为"用LLM炒股"这类流行想象泼了一盆冷水。无论模型参数多大、多先进,当被要求预测本质上高度随机的短期市场方向时,它们并不具备魔法般的优势。顶级API与本地小模型在这个任务上几乎站在了同一起跑线,且都跑不过一个一行代码就能写出的规则。
数据管道决定AI系统的效果上限
真正的启示在于:在实际应用中,你如何为模型准备输入,往往比选择哪个模型更关键。这与AI工程实践中的普遍经验高度吻合——检索质量、上下文构建、信息筛选,这些"看似不性感"的工程环节,常常是决定系统效果的胜负手。
严谨的AI评测方法值得借鉴
作者构建的这套评测框架本身也颇具价值:时间戳锁定、结果不可删除、始终与配对基准对比、明确标注统计显著性和样本局限。这种"防作弊"的公开评测思路,正是当前AI能力评估中稀缺的品质。太多的"AI跑赢市场"宣传,恰恰缺少这样的对照基准和透明记录。
开放的邀请:你的本地模型能否战胜基准
作者坦承自己是这个排行榜(LDBD)的建设者,并诚恳地发出邀请:他非常希望看到有人的本地模型能够战胜"永远说涨"的配对基准。为此他还提供了一个开箱即用的起步机器人——约120行代码,仅依赖标准库,默认干跑模式,采用MIT许可证开源。
这个实验以一种略带黑色幽默的方式提醒我们:在拥抱大模型能力的同时,保持对其边界的清醒认知同样重要。一个每天说"涨"的机器人,有时就是最好的照妖镜。
相关推荐

@ai-sdk/zai@3.0.10 发布:依赖更新的补丁版本解析
Vercel AI SDK 发布 @ai-sdk/zai@3.0.10 补丁版本,同步更新 provider、provider-utils 与 openai-compatible 等底层依赖。本文解析该版本变更内容及 AI SDK provider 体系的设计意义。

Vercel AI SDK 更新:@ai-sdk/workflow 2.0.29 修复工具结果保留问题
Vercel AI SDK 发布 @ai-sdk/workflow 2.0.29 补丁版本,核心修复工作流在终止、延迟、暂停三种响应状态下 provider 工具执行结果的保留问题,并同步升级 ai@7.0.98 等核心依赖。

Vercel AI SDK 更新:@ai-sdk/xai 4.0.58 批处理与图像生成改进
Vercel AI SDK 发布 @ai-sdk/xai 4.0.58 版本更新,新增批处理图像生成支持,修复批处理请求类型校验及 DeepSeek 推理流问题,并同步升级 provider 相关依赖。