[控场AI]

#数据集

共 5 篇相关文章

56亿条TikTok视频元数据开源:Hugging Face上的大规模社交数据集
·4 分钟

56亿条TikTok视频元数据开源:Hugging Face上的大规模社交数据集

开发者在Hugging Face开源56亿条TikTok视频元数据,涵盖2014至2026年,包含创作者、视频与声音三张表,并提供ClickHouse在线查询。本文解析其数据结构、访问方式及合规隐私风险。

阅读全文 →
生产级PPE安全装备数据集采购指南:渠道、质量与自建权衡
·5 分钟

生产级PPE安全装备数据集采购指南:渠道、质量与自建权衡

构建生产级PPE安全装备检测系统,数据集采购是关键门槛。本文解析安全帽、反光背心等六类PPE数据集的质量要求、主流采购渠道(Scale AI、Appen、Dataloop等)以及自采外包与购买现成数据的权衡策略。

阅读全文 →
TutlAit v1:摩洛哥塔马齐格特语语音数据集的众包实践
·5 分钟

TutlAit v1:摩洛哥塔马齐格特语语音数据集的众包实践

TutlAit v1 是一个众包构建的摩洛哥塔马齐格特语语音数据集,包含约20.9小时音频、阿拉伯语转写和地区口音标签,可用于语音识别、语音翻译和口音识别,为低资源语言技术提供基础素材。

阅读全文 →
PAWS数据集:政策驱动的金融多智能体世界仿真
·5 分钟

PAWS数据集:政策驱动的金融多智能体世界仿真

PAWS是一个政策驱动的金融多智能体仿真数据集,覆盖36个美国金融政策事件、12,727条新闻和65,291个有来源支撑的行为,为可审计的政策响应仿真提供历史依据。

阅读全文 →
ISAAC语料库:5.27亿Reddit帖分析社会群体话语的开源利器
·5 分钟

ISAAC语料库:5.27亿Reddit帖分析社会群体话语的开源利器

伊利诺伊大学推出开源语料库 ISAAC,收录超 5.27 亿条 Reddit 帖子,覆盖 2007-2023 年六大社会群体维度,提供道德化、情感、地区等多维标注,支持无代码和编程访问,助力大规模社会话语研究的可复现分析。

阅读全文 →