[控场AI]
· 4 分钟阅读· 2,231 字

Reddit收紧old.reddit.com访问:对抗AI爬虫的无奈之举

Reddit收紧old.reddit.com访问:对抗AI爬虫的无奈之举

Reddit因AI爬虫泛滥,被迫对老版界面加设登录与活跃度门槛并砍掉RSS支持,真实用户为此买单。

为遏制AI训练数据爬取浪潮,Reddit宣布对老版界面old.reddit.com实施两项强制限制:用户须在过去六个月内使用过该版本,且必须登录账号才能访问。与此同时,Reddit还计划停止对RSS订阅源的支持,因为其结构化格式极易被自动化脚本利用。讽刺的是,Reddit此前已与OpenAI、Google等达成独家数据授权协议,但这并未阻止大量未授权爬虫持续抓取平台内容。上述反爬虫措施的实际代价由真实用户承担——惯于匿名潜水的用户被强制登录,依赖RSS聚合信息的用户则失去了便捷工具,老版Reddit"开放、轻量、匿名"的核心气质正被逐步侵蚀。

老版Reddit遭遇爬虫围剿

对于很多资深Reddit用户来说,old.reddit.com 是他们心中无可替代的入口。相比不断改版的新界面,老版Reddit保留了经典的论坛式布局,信息密度更高、加载更快,也更符合这批元老级用户的使用习惯。

然而,这片"净土"正面临前所未有的压力。据该YouTube视频分析,Reddit不得不收紧对 old.reddit.com 的访问权限,原因直指泛滥的机器人爬虫——AI训练对数据的饥渴,正让Reddit这类社区内容成为被疯狂抓取的目标。

Of course.

独家授权挡不住全网爬取

Reddit对内容被爬取这件事其实早有警觉。为了把海量UGC内容的价值变现,Reddit此前已经与OpenAI、Google等公司达成协议,授权它们"独家"抓取平台内容用于训练AI模型。

但现实并不如纸面约定那样理想。按照Reddit的说法,即便有了这些独家授权交易,依然有大量机器人在绕过规则、持续抓取平台数据。换句话说,官方授权渠道并没有堵住非官方的爬虫洪流,Reddit面对的是一场"按下葫芦浮起瓢"的持久战。

But now it seems that at least what Reddit is saying is that everyone is still scraping

Reddit与AI公司之间的数据授权协议,本质上属于API商业授权模式:平台向付费合作方开放结构化数据访问通道,同时在合同层面限制对方之外的第三方抓取行为。Reddit曾在2023年大幅提高API使用费并关停免费额度,此举直接引发了著名的"版主大罢工"事件,数千个子版块集体设为私密以示抗议。然而,API收费和合同条款只能约束愿意遵守规则的合作方,对于直接模拟浏览器行为、绕过API的未授权爬虫毫无约束力。这也揭示了内容平台数据变现逻辑的根本矛盾:开放性是社区活力的来源,而开放性本身也使数据保护极为困难。

新规则:必须登录且近期活跃

为了遏制爬虫,Reddit对老版入口祭出了两条硬性门槛:

六个月活跃期限制

新规要求用户必须在过去六个月内使用过 old.reddit.com,否则访问将变得更加困难。这意味着那些偶尔才回来看看老版界面的用户,可能会被挡在门外。

强制登录

另一条更具争议的规则是:使用老版Reddit必须登录账号。这对Reddit的社区文化冲击不小——长期以来,Reddit恰恰是那种人们习惯"潜水"(lurking)而非发帖的平台。大量用户从不登录,只是匿名浏览内容。强制登录的要求,等于改变了这批潜水党的使用方式。

So the new rules are that you have to have used it within the last six months.

Reddit希望通过这两道关卡,能够显著减少机器人对老版入口的滥用。逻辑也不难理解:登录状态和活跃度数据,能帮助平台更有效地区分真实用户与自动化脚本。

RSS订阅也成了牺牲品

除了收紧访问权限,Reddit还计划停止对RSS订阅源的支持。原因同样指向爬虫——RSS feed结构化、易于程序读取的特性,让它成了机器人轻松抓取内容的又一通道。

对普通用户而言,这无疑是个坏消息。RSS是许多人聚合信息、追踪特定社区动态的便捷工具,一刀切地关停,等于用户体验为反爬虫战争买了单。

of just posting.

RSS(Really Simple Syndication)是一种诞生于1990年代末的网页内容订阅标准,允许用户通过RSS阅读器统一订阅来自不同网站的更新,而无需逐一访问各站点。其核心优势在于结构化的XML格式——内容以机器可读的方式整齐排列,标题、正文、时间戳一目了然。这种特性在帮助人类用户高效聚合信息的同时,也恰恰使其成为爬虫的理想目标:自动化脚本无需解析复杂的HTML页面,只需直接读取RSS feed即可批量获取全站文章内容。Reddit的RSS端点历来被内容抓取者广泛利用,停止支持RSS是平台关闭数据"易入口"的直接选择,但代价是误伤了数量可观的技术类重度用户——这批人恰恰是Reddit最活跃、最有价值的社区贡献者之一。

用户体验与数据防护的两难

Reddit此次的调整,折射出整个内容平台在AI时代面临的共同困境:平台数据是训练大模型的宝贵燃料,但无节制的爬取既侵蚀了平台的商业利益,也可能拖垮基础设施。

问题在于,所有防护措施最终都落在了真实用户身上。强制登录、活跃度门槛、关停RSS,每一项都在削弱老版Reddit"开放、轻量、匿名"的原始魅力。对那些坚守 old.reddit.com 的元老用户来说,这更像是一种被迫的妥协——他们没做错任何事,却要为机器人的行为承担代价。

如何在保护数据资产与维护用户体验之间找到平衡,恐怕是Reddit乃至所有UGC平台在未来相当长一段时间内都要反复权衡的难题。

分享:

相关推荐