拒绝AI成为差异化定位:反AI潮流背后的工程理性

当拒绝AI成为一种立场
在几乎所有科技公司都在争先恐后地将"AI"塞进产品、宣传语和融资叙事中的当下,一篇标题为《We never use AI. For anything》(我们从不使用AI,任何事情都不用)的帖子在Hacker News上引发了讨论。这个略显叛逆的标题本身就是一种态度表达——在AI被奉为万能钥匙的时代,公开宣称"完全不用AI"反而成了一种引人注目的差异化定位。
这篇帖子虽然讨论热度不算爆炸(23个点赞、10条评论),但它触及了一个正在技术社区悄然发酵的话题:当AI从工具异化为营销标签时,是否有人愿意逆流而行?

"不用AI"背后的几种动机
对AI宣传泡沫的反感
过去两年,"AI-powered"(AI驱动)几乎成了每个产品发布会的标配用语。从待办清单应用到宠物喂食器,无数产品都硬贴上AI标签以获取关注和溢价。这种普遍的"AI洗白"(AI-washing)现象,让一部分技术从业者产生了强烈的逆反心理。
AI-washing这一概念类似于早年的"greenwashing"(漂绿),指企业在产品中并未实质性地使用AI技术,却在营销中大量使用AI标签以吸引投资者和消费者。这种行为的经济激励是显而易见的:研究机构Epoch AI的数据显示,2023-2024年间,在公司名称或产品描述中加入"AI"字样的初创企业,其种子轮融资中位数比同类非AI企业高出约40%。这种资本溢价进一步助长了AI-washing行为的蔓延。与此同时,学术界也开始关注"AI theater"现象——即企业内部名义上部署了AI系统,但实际上并未将其整合进核心业务流程,仅作为向董事会和投资者展示的"橱窗工程"。
2024年,美国证券交易委员会(SEC)已开始对AI-washing行为进行调查和处罚,两家投资顾问公司因夸大其AI使用程度而被罚款。高盛的一项调查显示,标普500公司在财报电话会议中提及"AI"的频率在2023-2024年间增长了超过6倍,但其中大量提及仅停留在愿景层面而非实际部署。值得注意的是,AI-washing的蔓延并不局限于科技行业——传统制造业、零售业甚至农业企业都在试图贴上AI标签。欧盟《人工智能法案》(AI Act)于2024年正式生效,其中明确要求企业在向消费者提供AI驱动的产品或服务时必须进行透明披露,虚假宣称使用AI可能面临最高3500万欧元或全球营业额7%的罚款。这一监管趋势表明,AI-washing不仅是一个信誉问题,正在逐步成为法律合规问题。这种现象的泛滥,正是催生"反AI"立场的重要土壤。
对这些人而言,公开声明"我们从不使用AI",本质上是在与浮夸的行业风气划清界限。它传递的潜台词是:我们靠的是扎实的工程能力和确定性的逻辑,而不是概率性的黑箱。在一个人人都在追赶潮流的环境里,坚守传统反而成了信任的来源。
对可靠性与确定性的坚持
大语言模型的核心特性是概率生成,这意味着它天然存在"幻觉"(hallucination)和不可预测性。所谓"幻觉",是指模型生成看似合理但实际上不正确或完全虚构的内容。这一问题根植于LLM的工作原理:模型本质上是在进行"下一个token预测",基于统计概率选择最可能的后续词语,而非从结构化知识库中检索事实。模型并不"理解"真假,它只是在生成统计上最连贯的文本序列。
从技术根源来看,幻觉问题与LLM的训练范式密切相关。预训练阶段,模型通过海量互联网文本学习语言模式,但这些文本本身就包含矛盾、过时和错误信息。微调阶段的RLHF(基于人类反馈的强化学习,Reinforcement Learning from Human Feedback)虽然提升了对话质量,但也可能导致模型学会"自信地编造"——因为训练信号鼓励流畅和有帮助的回复,而非保守和诚实的"我不知道"。学术界将此称为"校准问题"(calibration problem),即模型的自信程度与其实际准确率之间存在系统性偏差。尽管检索增强生成(RAG)、思维链提示(Chain-of-Thought)等技术在一定程度上缓解了幻觉问题,但目前没有任何方法能完全消除它。在2024年的多项基准测试中,即使是最先进的模型在事实准确性方面仍存在5%-15%的错误率,这对于零容错场景来说是不可接受的。
对于某些对准确性要求极高的场景——例如金融计算、医疗数据处理、法律文书或核心系统逻辑——引入生成式AI反而会增加风险。这里涉及到一个深层的工程哲学问题:确定性系统与概率系统的本质差异。在软件工程中,"确定性系统"是指给定相同输入总能产生相同输出的系统,其行为可以被完整测试、验证和审计。传统的规则引擎、关系型数据库查询、数学计算模块都属于此类。而基于深度学习的AI系统本质上是概率系统——即使是相同的输入,由于温度参数、随机种子等因素,输出也可能不同。
这种差异在安全关键领域尤为突出。在航空航天、核电等行业,软件系统需要通过DO-178C等认证标准,要求对每一行代码的行为进行形式化验证(Formal Verification)——即用数学方法证明程序在所有可能输入下的行为都符合规范。波音787的飞控软件约有650万行代码,每一行都经过了这种级别的验证。这种严格的确定性要求与当前AI系统的概率本质存在根本性冲突,也是为什么这些行业对AI的采纳最为谨慎——在当前的AI技术框架下,对大语言模型进行形式化验证几乎不可想象。
这种差异在工程实践中的影响是深远的。在传统软件工程中,测试覆盖率是衡量代码质量的核心指标,行业标准通常要求关键路径达到80%-100%的覆盖率。但对于AI系统,传统的测试方法论面临根本性挑战:你无法穷举自然语言的所有可能输入,也无法为一个输出空间近乎无限的系统定义"正确答案"。这催生了一个新的工程子领域——AI系统的评估(Evaluation),它更接近于统计学方法而非传统的断言式测试,使用基准数据集、人工评分、自动化评分模型等手段来估计系统的整体表现。这种范式转变要求团队具备完全不同的技能组合和质量文化。确定性系统可以编写精确的单元测试,出现bug时可以通过日志精确定位;而概率系统的"错误"往往是模糊的、难以复现的,传统的软件质量保证方法论在此几乎失效。
一些开发者认为,与其用一个可能出错且难以调试的AI组件替代成熟的确定性代码,不如坚持使用经过验证的传统方案。"不用AI"在这里不是保守,而是基于工程理性的风险控制。
隐私、成本与依赖性顾虑
完全不使用AI还可能出于更现实的考量:
- 数据隐私:调用第三方AI服务往往意味着将用户数据传输到外部服务器,这对注重隐私的产品是不可接受的。在GDPR和各国数据保护法的框架下,将用户数据发送至第三方AI服务可能触发复杂的数据处理协议(DPA)要求和跨境数据传输限制。2023-2024年间,意大利、法国等国的数据保护机构曾对ChatGPT的数据处理实践进行调查,凸显了AI服务在隐私合规方面的风险。虽然本地部署的开源模型可以在一定程度上缓解这一问题,但部署和维护这些模型的技术门槛和硬件成本对中小企业来说往往是另一个障碍。
- 成本控制:大模型的推理成本高昂,对于利润微薄的业务,AI可能得不偿失。以GPT-4级别的模型为例,每百万输入token的费用在2024年初约为30美元,到2024年底已降至数美元,但对于日均处理数百万请求的应用来说,年化成本仍可能达到数十万甚至数百万美元。AI推理成本的下降曲线遵循一种类似于摩尔定律的模式,2024年被业界称为"推理成本大跳水"之年,主要驱动因素包括开源模型(如Meta的Llama系列)带来的竞争压力、推理优化技术(如量化、投机解码、KV缓存优化)的成熟、以及专用AI芯片(如Groq的LPU、AWS的Trainium)的规模化部署。在技术层面,量化技术(如INT4/INT8量化)通过降低模型参数的数值精度来换取推理速度和成本的大幅改善,通常可将推理成本降低3-5倍,而质量损失控制在1-3%以内;投机解码(Speculative Decoding)则利用一个小模型预测大模型的输出,只在小模型不确定时才调用大模型,可将推理速度提升2-3倍。但成本下降并不意味着AI对所有场景都经济可行——还需要考虑延迟要求、吞吐量需求和质量门槛。对于需要亚毫秒响应的实时系统,LLM的数百毫秒延迟可能比成本更成问题。此外还有隐性成本:提示词工程的人力投入、输出质量监控系统的建设、以及处理AI出错时的客服和公关成本。相比之下,一个经过优化的传统算法可能只需要极低的计算资源就能完成同样的任务——前提是该任务本身不需要AI的生成能力。对于利润率只有个位数百分比的业务(如SaaS工具、电商基础设施),AI的投入产出比确实需要仔细计算。
- 供应链依赖:过度依赖OpenAI、Anthropic等外部API,会让产品受制于第三方的定价、限流和政策变化。这种"供应商锁定"(Vendor Lock-in)风险在AI领域尤为突出,因为不同模型的API接口、提示词策略和输出特性差异显著,迁移成本远高于传统云服务。2024年OpenAI多次调整API定价和使用政策的经历表明,将核心业务逻辑绑定在单一AI供应商上可能带来显著的运营风险。
逆潮流的立场是否可持续
这类"反AI"立场引发的一个核心争论是:它究竟是理性的克制,还是终将被时代淘汰的固执?
支持者认为,AI只是工具,不该成为目的。真正优秀的产品应该以解决问题为导向,而非以"是否用了AI"为荣。在这个意义上,"我们从不使用AI"是一种对产品本质的回归。
但反对声音也同样有力。随着模型能力的持续进化和成本的快速下降,AI正在从"锦上添花"变为"基础设施"。回顾历史,这种技术基础设施化的进程并非没有先例。1990年代也有企业公开质疑互联网的必要性,Newsweek在1995年刊登了一篇著名的文章《互联网?呸!》(The Internet? Bah!),预言在线数据库永远无法取代日报。未来学家Roy Amara提出的"阿马拉定律"(Amara's Law)精准概括了这种认知偏差:"我们倾向于高估技术的短期影响,而低估其长期影响。"这一定律描述了几乎每一次重大技术范式转移的公众认知曲线——互联网在1995-2001年间经历了从狂热到幻灭的完整周期,但到2010年代已成为现代经济不可分割的基础设施。即使在互联网泡沫破裂后,亚马逊的股价从100美元跌至6美元,但坚持投入的公司最终定义了数字经济的格局。
经济学家Carlota Perez在其经典著作《技术革命与金融资本》中将技术从新奇工具到基础设施的演变描述为一个可预测的模式:早期采用者获得超额回报,随后进入泡沫期(大量不合理的应用涌现),泡沫破裂后进入低谷期(质疑声四起),最终技术找到真正适合的应用场景并融入日常。电力、汽车、个人电脑和互联网都经历了这一过程。当前AI可能正处于从泡沫期向生产力部署期过渡的阶段,这也解释了为什么"完全不用AI"和"什么都要用AI"这两种极端立场能够同时存在——它们分别代表了对泡沫的合理警惕和对长期趋势的正确判断,只是各自忽略了故事的另一半。
如今,AI正在经历类似的基础设施化进程:操作系统层面(如Apple Intelligence、Windows Copilot)、开发工具层面(如GitHub Copilot已被超过百万开发者使用)、云服务层面(AWS、Azure、GCP都将AI能力作为核心服务)都在将AI嵌入底层。Gartner预测,到2026年,超过80%的企业将在生产环境中使用生成式AI API或模型,而2023年初这一比例不到5%。这种渗透速度意味着,完全回避AI的空间正在系统性地缩小。
就像今天没有公司会宣称"我们从不使用互联网"一样,未来完全排斥AI可能会导致效率和体验上的显著落后。将AI一概拒之门外,可能是在用一时的立场牺牲长期的竞争力。
更值得思考的中间地带
事实上,非黑即白的态度都可能失之偏颇。更成熟的技术选型思路或许是:
- 区分场景:在容错性高、创造性强的场景(如内容草稿、代码辅助)拥抱AI;在确定性要求高的核心逻辑中坚持传统方案。这种"选择性采纳"的策略在实践中已有成功案例:Stripe在其支付核心系统中完全使用传统确定性代码,但在欺诈检测和客户支持中积极部署AI;Notion将AI功能定位为"增强层"而非"替代层",用户可以选择是否启用AI辅助。关键在于建立清晰的"AI适用性评估框架"——对每个潜在的AI应用场景评估其容错空间、数据敏感度、延迟要求和可回退性,而不是一刀切地接受或拒绝。
- 透明沟通:无论用不用AI,都应向用户诚实说明,而不是为了营销而夸大或隐瞒。
- 控制主导权:即使使用AI,也要保持对系统的可解释性和可控性,避免沦为黑箱的附庸。在AI系统中保持可解释性(Explainability)和可控性(Controllability)是一个活跃的研究和工程领域。实践中的常见策略包括:设置"人在回路"(Human-in-the-Loop)机制,让AI生成的结果必须经过人工审核才能生效;使用结构化输出(如JSON Schema约束)限制模型的输出格式和范围;实施"护栏"(Guardrails)系统对AI输出进行实时过滤和验证;以及保持"AI可降级"的架构设计——即当AI组件失效时,系统能自动回退到传统逻辑继续运行。
在不同行业中,Human-in-the-Loop机制的成熟度差异显著。在医疗领域,FDA已建立了针对AI/ML医疗设备的审批框架,要求大多数AI辅助诊断系统必须由持证医师做最终判断。在自动驾驶领域,SAE定义的Level 3以下的自动驾驶都要求人类驾驶员随时准备接管。而在软件开发中,Guardrails框架(如Guardrails AI、NeMo Guardrails)提供了一套声明式的验证规则,可以检查AI输出是否包含有害内容、是否偏离预定主题、是否符合预期的数据格式。这些工程实践正在形成一套新的最佳实践体系,通常被称为"LLMOps"——类比于传统的DevOps和MLOps,它涵盖了模型选择、提示词管理、输出评估、成本监控、安全审计等一系列运维实践。一个典型的LLMOps流水线包括:提示词模板管理→A/B测试框架→输出质量自动评分→异常检测与告警→成本仪表盘→安全审计日志。Weights & Biases、LangSmith、Helicone等工具构成了这一新兴生态的核心基础设施。LLMOps的成熟度将直接决定企业能否安全、可控地在生产环境中部署AI,也代表了一种务实的中间路线:既利用AI的能力,又不让系统的命运完全交给一个概率性的黑箱。
"我们从不使用AI"之所以能引起共鸣,恰恰是因为它戳中了行业浮躁的痛处。它提醒我们:技术选型的出发点永远应该是解决真实问题,而不是追逐标签和风口。 无论最终选择拥抱还是拒绝,清醒的判断力才是最稀缺的能力。
结语
这场围绕"完全不用AI"的小型讨论,折射出技术社区对AI热潮的一种冷静反思。它不是要否定AI的价值,而是在提醒每一个从业者:不要让工具凌驾于目的之上。在人人喊AI的时代,敢于说"不"或许需要勇气,但更重要的是,无论说"是"还是说"不",都应基于对自身业务和用户需求的深刻理解,而非随波逐流。
核心要点
相关推荐

Dude系统:双检测多智能体如何揪出论文与代码的不一致
Dude是首个面向论文-代码差异检测的双检测多智能体系统,通过粒度对齐协商和两阶段显著性过滤机制,解决了多智能体系统中的过度解读与误报问题,召回率和精确率最高提升22.8%,F1分数提升18.7%。

全双工语音助手隐式指令遵循评测:DSB-IFEval基准解析
深入解析DSB-IFEval基准测试,揭示全双工语音助手在隐式指令遵循、人设推理和冲突消解方面的能力短板。覆盖六大语音系统实测对比,剖析架构差异带来的行为与内容权衡。

提示工程实现AI教学助手个性化:六维画像框架详解
深入解析基于提示工程的AI教学助手个性化框架,通过六维学习者画像与布鲁姆认知分类法,无需重训练模型即可实现96种个性化教学风格,为教育AI落地提供务实工程路径。