智慧眼鏡這類硬體, 最讓人期待的其實不是鏡片本身, 而是它能不能真正「看懂」你眼前的世界。VisionClaw 這個開源專案, 就是衝著這個方向去的——它把 Meta Ray-Ban 智慧眼鏡變成一臺隨身 AI 助手, 支援實時語音對話、視覺理解, 還能執行一些代理操作。
一個專案, 三條能力線
從 GitHub 頁面上的描述看, VisionClaw 的核心是 Real-time AI assistant, 也就是說它主打實時互動。具體能力可以拆成三塊:
- 語音互動: 對著眼鏡說話, 就能獲得 AI 迴應, 不需要掏出手機。
- 視覺理解: 眼鏡攝像頭捕捉的畫面, 會成為 AI 判斷的輸入, 相當於讓 AI「看到」你所看到的。
- 代理操作: 不只是聊天, 還能替你完成某些動作, 比如提醒、查詢或控制其他裝置。
這三塊能力並不算新鮮, 但組合在一起, 並且跑在一副大眾消費級眼鏡上, 就有了點意思。
技術棧與現狀
VisionClaw 由 Intent-Lab 團隊建立, 專案用 TypeScript 編寫, 目前(倉庫資料)已有 2489 顆星, 關注度不低。它依賴 Gemini Live 和 OpenClaw 這兩個外部元件——前者負責多模態 AI 推理, 後者則可能是代理執行層的支撐。對於開發者來說, 這意味著你需要具備一定的 JavaScript/TypeScript 基礎, 並且願意去閱讀專案文件和原始碼。
這類專案最典型的使用場景, 是開發者或極客使用者自己動手, 把「買來的眼鏡」變成「自己的 AI 終端」。
它能做什麼, 以及你會踩的坑
如果你正好有一副 Meta Ray-Ban 智慧眼鏡, 並且熟悉命令列和 API 配置, VisionClaw 可以讓你提前體驗一下「隨身 AI」是什麼感覺: 走在路上問它路邊的建築是什麼, 或者讓它幫你記下眼前螢幕上的文字。不過, 它畢竟是一個年輕的開源專案, 官方公開的技術細節有限, 很多實用配置需要你自己去摸索。
另外要提醒一點: 依賴 Gemini Live 意味著你需要準備相應的開發者 API 接入方式, 這可能涉及費用或區域限制。專案本身是開源的, 但執行它的雲服務未必免費。
上手提示
- 先去看倉庫的 README 和 issue 區, 瞭解當前對 Meta Ray-Ban 型號的支援情況。
- 準備好 Node.js 環境和 TypeScript 編譯工具鏈, 再處理 Gemini API key。
- 如果只是好奇, 可以先從代理功能入手, 語音和視覺的聯動除錯會更折騰一些。
VisionClaw 目前仍在快速迭代, 適合喜歡折騰、願意參與到早期專案的開發者。它未必是最終答案, 但至少讓人們看到, 智慧眼鏡離「有用」又近了一步。










評論
暫無評論
成為第一個評論的人