GalaxDB

GalaxDB7.9MB囊括SQL、向量與對象儲存

GalaxDB 是一個開源的輕量級資料庫,用一個 7.9MB 的二進位制檔案替代 PostgreSQL、Pinecone 和 S3。它支援 PostgreSQL wire 協議、HNSW 向量搜尋、Merkle-DAG 版本控制、內建訓練資料去重,並遵循 EU AI Act 的溯源要求。Apache 2.0 許可證,適合 AI 應用的資料層統一。

free
GalaxDB向量資料庫PostgreSQL相容對象儲存Merkle-DAG版本控制訓練資料去重EU AI Act合規開源資料庫輕量級資料庫AI資料基礎設施
收錄日期
更新日期
3.4 (0 評價數量)

登錄后可為項目評分

AI 應用的資料管理越來越像一場拼圖遊戲:你需要 PostgreSQL 處理關係資料,Pinecone 做向量檢索,還得配個 S3 存對象。三套系統,三種 API,維護成本和延遲都在漲。GalaxDB 的想法很直接——把它們塞進一個 7.9MB 的二進位制檔案,而且完全開源。

一個二進位制,三種能力

GalaxDB 的核心賣點不是炫技,而是務實。它通過 PostgreSQL wire 協議 對外通訊,意味著任何支援 PostgreSQL 的客戶端(psql、pgAdmin、各種 ORM)都能直接連。關係查詢?照常寫 SQL。與此同時,它還內建了 HNSW 向量索引,可以執行近似最近鄰搜尋,召回率和延遲表現對標專業的向量資料庫。對象儲存層則通過 Merkle-DAG 組織資料,天然具備版本控制和內容定址能力。

對團隊來說,這意味著少學一套工具。原來需要三個運維棧,現在一個二進位制就搞定。尤其適合做 RAG(檢索增強生成) 或者 AI Agent 記憶系統 的專案——向量和關係資料直接在同一個事務裡操作。

內建資料溯源與去重

訓練資料的管理常常被忽略,直到合規審計找上門。GalaxDB 內建了 Merkle-DAG 版本控制,每次寫入都會產生可驗證的雜湊鏈,資料從哪裡來、經過什麼變換,都有跡可循。這恰好對上了 EU AI Act 要求的訓練資料溯源條款。此外,它還在寫入時自動檢測重複資料,避免相同樣本重複儲存——對大量採集的訓練資料集來說,能省不少空間。

  • PostgreSQL 相容:現有工具鏈無需改造,遷移成本低。
  • HNSW 向量搜尋:支援高維向量近似檢索,精度可控。
  • Merkle-DAG 版本控制:資料可追溯、可回滾、可驗證。
  • 訓練資料去重:寫入時自動過濾重複,節省儲存。
  • EU AI Act 合規:內建溯源日誌滿足監管要求。

開箱即用,但生態尚幼

下載一個 7.9MB 的二進位制,跑起來就能用——GalaxDB 的部署體驗確實輕量。不過,它畢竟很新,社羣貢獻者不過幾十人,文件目前以英文為主,部分高階特性(如分散式叢集、異地容災)還沒實現。如果你的場景是單機原型驗證或中小規模生產,它值得一試;但如果需要高可用、水平擴充套件,可能還得等一等。

實用建議

如果你是做 AI 應用的原型驗證,或者想簡化開發環境的資料棧,GalaxDB 能讓你少裝三個容器。先用它替代 PostgreSQL 做關係儲存,再試試向量檢索能力,看看是否滿足精度要求。追蹤資料來源時,Merkle-DAG 的版本快照功能可以直接查到歷史。注意,生產環境前建議自己做壓測,畢竟社羣案例還不夠多。

優缺點

優點

  • 7.9MB 單一二進位制,部署極簡
  • 統一關係、向量、對象三種儲存
  • 內建 Merkle-DAG 版本控制
  • 自動訓練資料去重,節省儲存
  • 遵循 EU AI Act 溯源性要求

缺點

  • 社羣和文件相對薄弱
  • 不支援分散式與高可用
  • 高階 PostgreSQL 特性相容有限
  • 大規模生產場景缺乏驗證

常見問題

GalaxDB 和 PostgreSQL 完全相容嗎?

GalaxDB 使用 PostgreSQL wire 協議,所以大多數 PostgreSQL 客戶端和工具可以直接連線。但內部儲存引擎不同,部分高階 PostgreSQL 特性(如觸發器和儲存過程)可能不支援,建議先測試相容性。

向量搜尋效能如何?

它採用 HNSW 索引,在百萬級向量上召回率和延遲表現接近 Pinecone 等專用向量資料庫。但作為單體資料庫,在高併發場景下可能受限於單機資源,建議根據資料規模評估。

版本控制怎麼用?

每次寫入都會生成 Merkle-DAG 快照,你可以通過快照 ID 回滾到任意歷史版本,也能驗證資料完整性。這類似於 Git 的提交鏈,但針對資料庫設計。

GalaxDB 適合生產環境嗎?

目前版本適合中小規模生產及原型驗證。它缺少分散式和高可用特性,如果業務要求 99.99% 可靠性和水平擴充套件,建議搭配其他方案或等待後續版本。

探索更多

相似工具

MatchIQ

MatchIQ 是一款免費的世界盃資料平臺,整合實時比分、球員資訊、Dixon-Coles 預測模型、小組排名、賽程構建器及詳細比賽卡片。無需註冊即可使用,適合球迷和資料愛好者快速獲取賽事洞察。

Axelr AI

Axelr AI是一個智慧執行平臺,專注於將非結構化資料轉化為可操作洞察,並自動化UI/UX開發流程。其AI驅動架構幫助團隊跳過摩擦、加速迭代,適合資料分析和產品設計場景。本文介紹核心功能、典型使用場景和實用建議。

Lensiq

Lensiq

Lensiq 讓任何企業都能在幾分鐘內獲得企業級的機器學習預測,無需資料團隊或程式設計經驗。上傳資料、選擇目標,即可獲得用通俗英語解釋的可操作預測,快速輔助決策。

DataViz

DataViz 是一款面向非技術使用者的資料分析工具,支援上傳 CSV 檔案並用自然語言提問,自動生成折線圖、餅圖等。無需公式或程式碼,即可快速完成資料探索與視覺化。個人開發者作品,適合小團隊和個體使用者。

WorldCupAI Predictor

WorldCupAI Predictor 是一個基於 Vertex AI 的世界盃賽程模擬器,覆蓋2026年全部104場比賽,支援自定義場景(紅牌、傷病、天氣等),實時顯示概率變化。多語言介面讓全球使用者都能使用,並可直接跳轉當地官方轉播渠道。內建 Cloudflare Workers 實現邊緣加速,響應迅速。

Cogniview

Cogniview 利用腦編碼模型分析短視訊,預測觀眾注意力變化,精確指出注意力峰值、中斷和衰減的秒數,幫助創作者優化內容,提升完播率與互動率。

開源專案

Quilt: 開源科學資料管理平臺讓AI更懂資料

Quilt 是一個基於 AWS 的開源科學資料管理平臺,通過深度版本控制和豐富上下文的資料包,幫助團隊和 AI 高效查詢、信任和重用資料。適合需要可重複性、可追溯性的研究及AI開發團隊。

fiftyone: 開源資料集視覺化管理與 AI 模型精煉利器

fiftyone 是由 Voxel51 開發的開源 Python 工具,專為計算機視覺資料集管理和模型評估設計。它提供互動式 Web UI 和 Python API,支援資料集瀏覽、查詢、標註分析、模型比較、嵌入視覺化等功能,幫助開發者快速發現資料問題、提升模型效能。

Banana Slides: 開源文字轉PPT工具

Banana Slides 是一個在 GitHub 上開源的工具,用來把文字、思路和素材快速轉化成簡報。它不單純是模板套用的 PPT 生成器,而是結合內容解析與風格生成邏輯,讓最終輸出的幻燈片在結構和視覺上更協調統一。

materialize: 用 SQL 構建實時資料層

Materialize 是一個基於 Rust 的開源實時資料層,允許使用者使用標準 SQL 對事件流進行即時的增量計算,無需手動維護物化檢視或快取層。它通過持續更新結果,為應用和 AI 代理提供秒級的資料可見性,尤其適合需要低延遲、高併發查詢的實時分析場景。

portaljs: AI 原生的資料門戶構建框架

portaljs 是一個 AI-native 的開源框架,用自然語言描述即可快速搭建資料門戶,幾分鐘內載入資料集,支援 CKAN、GitHub 等多種後端。適合政府、科研機構和企業快速釋出資料資產,降低門戶建設門檻。

saiku: 開源語義層,統一Excel、儀表盤和AI代理的資料查詢

saiku 是一個基於 Mondrian 和 Apache Calcite 的開源語義層,提供統一的資料立方體,支援 Excel(MDX/XMLA)、儀表盤和 AI 代理(MCP 協議)的查詢。它降低了資料訪問的複雜度,讓多工具共享同一套業務語義,適合需要一致資料體驗的企業團隊。