#数据集
共 5 篇相关文章

·4 分钟
56亿条TikTok视频元数据开源:Hugging Face上的大规模社交数据集
开发者在Hugging Face开源56亿条TikTok视频元数据,涵盖2014至2026年,包含创作者、视频与声音三张表,并提供ClickHouse在线查询。本文解析其数据结构、访问方式及合规隐私风险。
阅读全文 →

·5 分钟
生产级PPE安全装备数据集采购指南:渠道、质量与自建权衡
构建生产级PPE安全装备检测系统,数据集采购是关键门槛。本文解析安全帽、反光背心等六类PPE数据集的质量要求、主流采购渠道(Scale AI、Appen、Dataloop等)以及自采外包与购买现成数据的权衡策略。
阅读全文 →

·5 分钟
TutlAit v1:摩洛哥塔马齐格特语语音数据集的众包实践
TutlAit v1 是一个众包构建的摩洛哥塔马齐格特语语音数据集,包含约20.9小时音频、阿拉伯语转写和地区口音标签,可用于语音识别、语音翻译和口音识别,为低资源语言技术提供基础素材。
阅读全文 →

·5 分钟
PAWS数据集:政策驱动的金融多智能体世界仿真
PAWS是一个政策驱动的金融多智能体仿真数据集,覆盖36个美国金融政策事件、12,727条新闻和65,291个有来源支撑的行为,为可审计的政策响应仿真提供历史依据。
阅读全文 →

·5 分钟
ISAAC语料库:5.27亿Reddit帖分析社会群体话语的开源利器
伊利诺伊大学推出开源语料库 ISAAC,收录超 5.27 亿条 Reddit 帖子,覆盖 2007-2023 年六大社会群体维度,提供道德化、情感、地区等多维标注,支持无代码和编程访问,助力大规模社会话语研究的可复现分析。
阅读全文 →