高性能分布式处理
依托 Ray 分布式计算框架与 Apache Arrow 列式内存格式,轻松应对 PB 级数据的目录管理与变更捕获任务
基于 Ray 与 Apache Arrow,提供快速、可扩展且具备事务一致性的数据目录管理能力
好内容,值得被认真对待
依托 Ray 分布式计算框架与 Apache Arrow 列式内存格式,轻松应对 PB 级数据的目录管理与变更捕获任务
提供类 Git 的暂存与提交 API,确保数据操作的事务一致性,支持数据版本回溯与表修复
采用 Pythonic 设计风格,易于集成到现有数据分析与机器学习流水线中,降低开发与维护成本
DeltaCat 旨在为大规模数据湖提供高效、ACID 合规的数据目录管理能力,支持数据变更捕获、一致性检查与表维护
可以通过 pip install deltacat 命令进行安装,要求环境中已配置 Python 及必要的依赖库
DeltaCat 由 Ray 项目团队开发和维护,底层利用 Ray 的分布式计算能力来实现高并发和高吞吐的数据目录操作