[KongchangAI]
ProductApache Parquet

Parquet

Apache开源的列式数据存储格式,专为高效的数据存储和检索设计,具备高压缩率、投影下推和谓词下推能力,是湖仓一体架构中最广泛使用的物理存储格式

Core Facts

Timeline (last 90 days)

Oct 8

数据湖通常指以低成本对象存储(如Amazon S3)为底层、以Parquet或ORC等列式格式存储数据的体系

Unverified50%
Oct 7

Parquet 默认写入方式会打乱 Xet 的去重逻辑,因为其列式编码、Row Group 边界和 Footer 每次重写都会使字节布局大幅改变

Unverified50%
Oct 7

一个 100MB 的 Parquet 文件在靠近开头处新增 3000 行,使用默认设置几乎整个文件都要重新上传,而开启内容定义分块后只需上传约 6 个分片

Unverified50%
Oct 6

湖仓一体架构基于开放的存储格式(如Parquet)和开放的表格式(如Delta Lake、Iceberg、Hudi),在廉价的对象存储之上提供事务、版本管理和schema演进等能力

Unverified50%
Oct 6

Parquet作为底层列式存储格式,凭借高压缩率和向量化读取支持,成为这些表格式的通用物理存储选择

Unverified50%
Oct 3

数据集结构化数据以Parquet格式提供,视频采用webdataset格式

Unverified50%
Oct 3

Parquet是由Apache基金会维护的面向列存储的开源数据格式,读取特定字段时只需扫描对应列,减少I/O开销

Unverified50%
Oct 1

若引擎在读取Parquet文件时跳过治理层的行过滤,可能发生权限泄露

Unverified50%
Sep 30

湖仓架构将开放格式(如 Parquet、Iceberg)的数据湖与数据库的事务性和查询能力相结合,使同一份数据既可被 Postgres 引擎访问,也可被 Spark、Trino 等分析引擎直接读取

Unverified50%
Sep 22

Delta 表基于 Delta Lake 格式,在 Parquet 文件之上增加事务日志,支持 ACID 事务、Time Travel、Schema Enforcement 和高效增删改操作

Unverified50%

All Facts (11)

Verified

Delta Lake是Databricks开源的存储层格式,构建于Parquet文件之上,提供ACID事务、版本回溯、Schema演进等特性

80%
Unverified

数据湖通常指以低成本对象存储(如Amazon S3)为底层、以Parquet或ORC等列式格式存储数据的体系

50%
Unverified

Parquet 默认写入方式会打乱 Xet 的去重逻辑,因为其列式编码、Row Group 边界和 Footer 每次重写都会使字节布局大幅改变

50%
Unverified

一个 100MB 的 Parquet 文件在靠近开头处新增 3000 行,使用默认设置几乎整个文件都要重新上传,而开启内容定义分块后只需上传约 6 个分片

50%
Unverified

湖仓一体架构基于开放的存储格式(如Parquet)和开放的表格式(如Delta Lake、Iceberg、Hudi),在廉价的对象存储之上提供事务、版本管理和schema演进等能力

50%
Unverified

Parquet作为底层列式存储格式,凭借高压缩率和向量化读取支持,成为这些表格式的通用物理存储选择

50%
Unverified

Parquet是由Apache基金会维护的面向列存储的开源数据格式,读取特定字段时只需扫描对应列,减少I/O开销

50%
Unverified

数据集结构化数据以Parquet格式提供,视频采用webdataset格式

50%
Unverified

若引擎在读取Parquet文件时跳过治理层的行过滤,可能发生权限泄露

50%
Unverified

湖仓架构将开放格式(如 Parquet、Iceberg)的数据湖与数据库的事务性和查询能力相结合,使同一份数据既可被 Postgres 引擎访问,也可被 Spark、Trino 等分析引擎直接读取

50%
Unverified

Delta 表基于 Delta Lake 格式,在 Parquet 文件之上增加事务日志,支持 ACID 事务、Time Travel、Schema Enforcement 和高效增删改操作

50%

Source Articles