3周爬取59亿TikTok视频:移动端逆向工程与大规模数据采集全解析

开发者三周内逆向TikTok移动端API,爬取近百亿条记录并免费开源,技术壮举背后暗藏合规与隐私争议。
一位开发者利用自研的TikTok移动端逆向工程方案,在三周内采集了59.4亿条视频元数据与32.3亿个用户资料,并将完整数据集免费发布于Hugging Face。其核心方法是通过抓包与签名破解,找到TikTok App中24个无需登录即可调用的接口,再配合分布式调度实现百亿级吞吐——采集代码则另行收费,形成「数据免费、工具付费」的分层商业模式。这一项目展示了个人开发者的工程能力上限,同时也将公开数据抓取的法律灰色地带、用户隐私聚合风险以及数据集使用者的连带合规责任推上讨论台前。
近日,一位开发者在 Reddit 上发帖称,他在三周内爬取了 59.4 亿条 TikTok 视频和 32.3 亿个用户资料,并将完整数据集免费上传至 Hugging Face 开源平台。这一惊人的数据规模和采集速度,迅速引发了技术圈对大规模数据抓取、移动端 API 逆向工程以及数据合规性的广泛讨论。

59亿条记录:数据集到底包含什么
根据发帖者的描述,这个数据集不仅仅包含视频,还涵盖了 TikTok 平台上几乎所有可公开访问的内容类型:
- 59.4 亿条视频元数据
- 32.3 亿个用户资料
- 评论及回复
- 标签(hashtags)
- 音频/声音(sounds)
- 以及更多结构化字段
完整数据集已发布在 Hugging Face 上(kuben-developer/tiktok-videos-4b),声称完全开源、免费访问。对于研究人员而言,这样量级的社交媒体数据集极为罕见——它可以用于内容趋势分析、推荐系统研究、社交网络图谱构建,甚至是大规模的自然语言与多模态模型训练。
有意思的是,能在三周内完成近百亿条记录的采集,背后必然涉及高度并行化的分布式抓取架构与高效的请求调度机制。这个速度本身就是一项工程上的成就。
核心方法:TikTok 移动端 App 逆向工程
发帖者透露,这套数据采集能力的核心是他几年前开发的一套 TikTok 移动 App 逆向工程方法。
为什么选择逆向移动端而非网页端
与传统网页爬虫相比,逆向移动 App 的接口通常具有几个显著优势:
- 数据更完整:移动端 API 往往返回比网页更丰富的结构化字段。
- 反爬相对薄弱:相比 Web 端复杂的前端渲染和风控,移动 API 的返回是干净的 JSON。
- 可绕过账号限制:这是关键——据其描述,TikTok App 暴露了 24 个无需登录账号即可访问的接口。
换句话说,这些数据本身在技术上是「公开可访问」的。开发者只是通过分析 App 与服务器之间的通信协议,找到了这些无需鉴权的端点,并对其进行了大规模、自动化的调用。
逆向工程的典型流程
虽然发帖者并未公开全部技术细节(完整代码需付费获取),但基于其描述,这类移动端逆向的通用流程大致包括:
- 抓包分析:通过中间人代理(如 mitmproxy、Charles)捕获 App 的网络请求。
- 签名破解:TikTok 等 App 通常对请求参数进行签名校验(如
X-Gorgon、X-Khronos等),逆向的难点在于还原签名算法。 - 端点复现:在无 App 环境下模拟合法请求,稳定地调用这 24 个公开端点。
- 规模化调度:通过代理池、请求频控和分布式部署,实现十亿级的采集吞吐。
签名破解往往是这类工作中最耗时也最有技术含量的部分,这也解释了为何作者选择对代码收费。
签名机制补充说明
TikTok 使用的 X-Gorgon 与 X-Khronos 是其自研的请求完整性校验方案。X-Khronos 本质上是当前 Unix 时间戳,而 X-Gorgon 则是基于请求参数、时间戳、设备指纹等多个字段通过私有哈希算法生成的签名串。服务端在收到请求后会验证签名是否合法,以此区分来自真实 App 的流量与自动化脚本。逆向这套机制通常需要对 App 的原生二进制(Android 端为 .so 动态库)进行静态反汇编或动态插桩,提取签名函数的实现逻辑。这也是为什么单纯的网络抓包不足以完成复现——抓包只能看到请求结果,签名的生成逻辑藏在客户端本地代码中。
免费数据集与付费代码的商业逻辑
这个项目采取了一种有趣的分层策略:
- 数据集完全免费开源——上传至 Hugging Face,任何人可下载使用。
- 采集代码则需付费——作者在其网站(tiktok-api.seeksocial.io)提供完整代码与文档,但收取一定费用。
这种「成果免费、工具收费」的模式颇具巧思。对于绝大多数研究者和数据分析师来说,他们真正需要的是数据本身,而非重新造轮子。免费公开数据集既能建立技术声誉、扩大影响力,又能为付费的代码服务导流——那些希望自行持续采集、获取实时数据的商业用户,才是付费代码的目标客户。
绕不开的数据合规与隐私争议
在惊叹于技术能力的同时,这个项目也踩在了法律与伦理的灰色地带。发帖者本人也坦诚地给出了免责声明:
「TikTok App 暴露了 24 个无需账号即可访问的端点,因此数据本身是公开可访问的。但以这种方式访问,很可能仍然违反 TikTok 的服务条款(ToS)。」
这里涉及几个值得警惕的问题:
「公开可访问」不等于「可自由抓取」
数据在技术上可访问,与在法律上允许大规模抓取,是两回事。近年来多起判例(如 hiQ v. LinkedIn)表明,公开数据抓取的合法性高度依赖具体司法管辖区、数据用途以及是否绕过技术防护措施。
hiQ v. LinkedIn 案是目前美国司法体系中关于公开数据爬取合法性最具代表性的判例。该案历经多轮上诉,核心争议在于:对公开网页数据的自动化抓取是否构成《计算机欺诈与滥用法》(CFAA)所禁止的「未经授权访问」。2022 年第九巡回上诉法院的裁决倾向于认为,若数据本身对公众开放(无需登录),则抓取行为不构成 CFAA 意义上的未授权访问——但这一结论仅适用于特定司法管辖范围,且并不豁免违反平台服务条款(ToS)的民事责任,更不触及欧盟 GDPR 框架下基于「数据最小化」原则的独立合规义务。
大规模用户数据聚合的隐私风险
32.3 亿个用户资料的开放,意味着海量个人信息被聚合。即使每条数据单独看是公开的,大规模聚合后也可能构成对用户隐私的实质性威胁,并可能触及 GDPR、CCPA 等数据保护法规。
「重识别」(Re-identification)是大规模公开数据聚合最核心的隐私风险之一。即便数据集中的每一条记录都不包含姓名或身份证号等直接标识符,通过将用户名、头像、地理位置标签、发帖时间规律等字段交叉比对,往往可以高置信度地将匿名记录还原至真实个人。GDPR 第4条将「可识别的自然人」所对应的任何数据都纳入个人数据范畴,而不仅仅是直接标识符。因此,32.3 亿条用户资料即使字段看似无害,其聚合体在法律意义上极可能整体构成需受保护的个人数据集合,数据集的发布者与使用者均可能承担相应的数据控制者责任。
使用者的连带责任
下载并使用该数据集的研究者,同样可能面临合规风险。在将其用于任何正式研究或商业用途前,务必审慎评估数据来源的合法性。
结语:技术能力与责任的边界
这个项目是一次令人印象深刻的工程展示——它证明了通过移动端逆向工程,个人开发者也能在极短时间内构建起百亿级的数据采集能力。它对研究社区而言是一份诱人的资源,也再次凸显了大型平台在数据防护上的持续挑战。
但技术能力越强,责任边界就越需要清晰。在开源精神、数据研究价值与用户隐私、平台条款之间,如何取得平衡,是每一位数据从业者都需要认真思考的问题。对于这类数据集,我们建议:欣赏其技术,但审慎对待其使用。
相关推荐

Vercel AI SDK 发布 Vue 3.0.282 补丁更新
Vercel AI SDK 发布 @ai-sdk/vue@3.0.282 补丁更新,同步核心包 ai@6.0.282。本文解析该 Vue 生态 AI 开发工具的更新内容、版本节奏与开发者升级建议。

Vercel AI SDK 沙箱组件发布补丁更新
Vercel AI SDK 发布 sandbox-vercel@1.0.109 补丁更新,同步 harness 依赖至同版本。本文解读这次维护更新的内容及其对 AI 应用开发者的意义。

Claude的承重词汇:哪些关键词真正影响AI行为输出
探索Claude大语言模型中的承重词汇概念,解析特定关键词如何以超额权重影响AI行为输出,以及这一发现对提示工程优化、AI对齐研究和模型安全的实践启示。