GalaxDB

GalaxDB7.9MB囊括SQL、向量与对象存储

GalaxDB 是一个开源的轻量级数据库,用一个 7.9MB 的二进制文件替代 PostgreSQL、Pinecone 和 S3。它支持 PostgreSQL wire 协议、HNSW 向量搜索、Merkle-DAG 版本控制、内置训练数据去重,并遵循 EU AI Act 的溯源要求。Apache 2.0 许可证,适合 AI 应用的数据层统一。

free
GalaxDB向量数据库PostgreSQL兼容对象存储Merkle-DAG版本控制训练数据去重EU AI Act合规开源数据库轻量级数据库AI数据基础设施
收录日期
更新日期
3.4 (0 评价数量)

登录后可为项目评分

AI 应用的数据管理越来越像一场拼图游戏:你需要 PostgreSQL 处理关系数据,Pinecone 做向量检索,还得配个 S3 存对象。三套系统,三种 API,维护成本和延迟都在涨。GalaxDB 的想法很直接——把它们塞进一个 7.9MB 的二进制文件,而且完全开源。

一个二进制,三种能力

GalaxDB 的核心卖点不是炫技,而是务实。它通过 PostgreSQL wire 协议 对外通信,意味着任何支持 PostgreSQL 的客户端(psql、pgAdmin、各种 ORM)都能直接连。关系查询?照常写 SQL。与此同时,它还内建了 HNSW 向量索引,可以执行近似最近邻搜索,召回率和延迟表现对标专业的向量数据库。对象存储层则通过 Merkle-DAG 组织数据,天然具备版本控制和内容寻址能力。

对团队来说,这意味着少学一套工具。原来需要三个运维栈,现在一个二进制就搞定。尤其适合做 RAG(检索增强生成) 或者 AI Agent 记忆系统 的项目——向量和关系数据直接在同一个事务里操作。

内置数据溯源与去重

训练数据的管理常常被忽略,直到合规审计找上门。GalaxDB 内置了 Merkle-DAG 版本控制,每次写入都会产生可验证的哈希链,数据从哪里来、经过什么变换,都有迹可循。这恰好对上了 EU AI Act 要求的训练数据溯源条款。此外,它还在写入时自动检测重复数据,避免相同样本重复存储——对大量采集的训练数据集来说,能省不少空间。

  • PostgreSQL 兼容:现有工具链无需改造,迁移成本低。
  • HNSW 向量搜索:支持高维向量近似检索,精度可控。
  • Merkle-DAG 版本控制:数据可追溯、可回滚、可验证。
  • 训练数据去重:写入时自动过滤重复,节省存储。
  • EU AI Act 合规:内置溯源日志满足监管要求。

开箱即用,但生态尚幼

下载一个 7.9MB 的二进制,跑起来就能用——GalaxDB 的部署体验确实轻量。不过,它毕竟很新,社区贡献者不过几十人,文档目前以英文为主,部分高级特性(如分布式集群、异地容灾)还没实现。如果你的场景是单机原型验证或中小规模生产,它值得一试;但如果需要高可用、水平扩展,可能还得等一等。

实用建议

如果你是做 AI 应用的原型验证,或者想简化开发环境的数据栈,GalaxDB 能让你少装三个容器。先用它替代 PostgreSQL 做关系存储,再试试向量检索能力,看看是否满足精度要求。追踪数据来源时,Merkle-DAG 的版本快照功能可以直接查到历史。注意,生产环境前建议自己做压测,毕竟社区案例还不够多。

优缺点

优点

  • 7.9MB 单一二进制,部署极简
  • 统一关系、向量、对象三种存储
  • 内置 Merkle-DAG 版本控制
  • 自动训练数据去重,节省存储
  • 遵循 EU AI Act 溯源性要求

缺点

  • 社区和文档相对薄弱
  • 不支持分布式与高可用
  • 高级 PostgreSQL 特性兼容有限
  • 大规模生产场景缺乏验证

常见问题

GalaxDB 和 PostgreSQL 完全兼容吗?

GalaxDB 使用 PostgreSQL wire 协议,所以大多数 PostgreSQL 客户端和工具可以直接连接。但内部存储引擎不同,部分高级 PostgreSQL 特性(如触发器和存储过程)可能不支持,建议先测试兼容性。

向量搜索性能如何?

它采用 HNSW 索引,在百万级向量上召回率和延迟表现接近 Pinecone 等专用向量数据库。但作为单体数据库,在高并发场景下可能受限于单机资源,建议根据数据规模评估。

版本控制怎么用?

每次写入都会生成 Merkle-DAG 快照,你可以通过快照 ID 回滚到任意历史版本,也能验证数据完整性。这类似于 Git 的提交链,但针对数据库设计。

GalaxDB 适合生产环境吗?

目前版本适合中小规模生产及原型验证。它缺少分布式和高可用特性,如果业务要求 99.99% 可靠性和水平扩展,建议搭配其他方案或等待后续版本。

探索更多

相似工具

MatchIQ

MatchIQ 是一款免费的世界杯数据平台,整合实时比分、球员信息、Dixon-Coles 预测模型、小组排名、赛程构建器及详细比赛卡片。无需注册即可使用,适合球迷和数据爱好者快速获取赛事洞察。

Axelr AI

Axelr AI是一个智能执行平台,专注于将非结构化数据转化为可操作洞察,并自动化UI/UX开发流程。其AI驱动架构帮助团队跳过摩擦、加速迭代,适合数据分析和产品设计场景。本文介绍核心功能、典型使用场景和实用建议。

Lensiq

Lensiq

Lensiq 让任何企业都能在几分钟内获得企业级的机器学习预测,无需数据团队或编程经验。上传数据、选择目标,即可获得用通俗英语解释的可操作预测,快速辅助决策。

DataViz

DataViz 是一款面向非技术用户的数据分析工具,支持上传 CSV 文件并用自然语言提问,自动生成折线图、饼图等。无需公式或代码,即可快速完成数据探索与可视化。个人开发者作品,适合小团队和个体用户。

WorldCupAI Predictor

WorldCupAI Predictor 是一个基于 Vertex AI 的世界杯赛程模拟器,覆盖2026年全部104场比赛,支持自定义场景(红牌、伤病、天气等),实时显示概率变化。多语言界面让全球用户都能使用,并可直接跳转当地官方转播渠道。内置 Cloudflare Workers 实现边缘加速,响应迅速。

Cogniview

Cogniview 利用脑编码模型分析短视频,预测观众注意力变化,精确指出注意力峰值、中断和衰减的秒数,帮助创作者优化内容,提升完播率与互动率。

开源项目

Quilt: 开源科学数据管理平台让AI更懂数据

Quilt 是一个基于 AWS 的开源科学数据管理平台,通过深度版本控制和丰富上下文的数据包,帮助团队和 AI 高效查找、信任和重用数据。适合需要可重复性、可追溯性的研究及AI开发团队。

fiftyone: 开源数据集可视化管理与 AI 模型精炼利器

fiftyone 是由 Voxel51 开发的开源 Python 工具,专为计算机视觉数据集管理和模型评估设计。它提供交互式 Web UI 和 Python API,支持数据集浏览、查询、标注分析、模型比较、嵌入可视化等功能,帮助开发者快速发现数据问题、提升模型性能。

Banana Slides: 开源文本转PPT工具

Banana Slides 是一个在 GitHub 上开源的工具,用来把文本、思路和素材快速转化成演示文稿。它不单纯是模板套用的 PPT 生成器,而是结合内容解析与风格生成逻辑,让最终输出的幻灯片在结构和视觉上更协调统一。

materialize: 用 SQL 构建实时数据层

Materialize 是一个基于 Rust 的开源实时数据层,允许用户使用标准 SQL 对事件流进行即时的增量计算,无需手动维护物化视图或缓存层。它通过持续更新结果,为应用和 AI 代理提供秒级的数据可见性,尤其适合需要低延迟、高并发查询的实时分析场景。

portaljs: AI 原生的数据门户构建框架

portaljs 是一个 AI-native 的开源框架,用自然语言描述即可快速搭建数据门户,几分钟内加载数据集,支持 CKAN、GitHub 等多种后端。适合政府、科研机构和企业快速发布数据资产,降低门户建设门槛。

saiku: 开源语义层,统一Excel、仪表盘和AI代理的数据查询

saiku 是一个基于 Mondrian 和 Apache Calcite 的开源语义层,提供统一的数据立方体,支持 Excel(MDX/XMLA)、仪表盘和 AI 代理(MCP 协议)的查询。它降低了数据访问的复杂度,让多工具共享同一套业务语义,适合需要一致数据体验的企业团队。