智能眼镜这类硬件, 最让人期待的其实不是镜片本身, 而是它能不能真正“看懂”你眼前的世界。VisionClaw 这个开源项目, 就是冲着这个方向去的——它把 Meta Ray-Ban 智能眼镜变成一台随身 AI 助手, 支持实时语音对话、视觉理解, 还能执行一些代理操作。
一个项目, 三条能力线
从 GitHub 页面上的描述看, VisionClaw 的核心是 Real-time AI assistant, 也就是说它主打实时交互。具体能力可以拆成三块:
- 语音交互: 对着眼镜说话, 就能获得 AI 回应, 不需要掏出手机。
- 视觉理解: 眼镜摄像头捕捉的画面, 会成为 AI 判断的输入, 相当于让 AI“看到”你所看到的。
- 代理操作: 不只是聊天, 还能替你完成某些动作, 比如提醒、查询或控制其他设备。
这三块能力并不算新鲜, 但组合在一起, 并且跑在一副大众消费级眼镜上, 就有了点意思。
技术栈与现状
VisionClaw 由 Intent-Lab 团队创建, 项目用 TypeScript 编写, 目前(仓库数据)已有 2489 颗星, 关注度不低。它依赖 Gemini Live 和 OpenClaw 这两个外部组件——前者负责多模态 AI 推理, 后者则可能是代理执行层的支撑。对于开发者来说, 这意味着你需要具备一定的 JavaScript/TypeScript 基础, 并且愿意去阅读项目文档和源码。
这类项目最典型的使用场景, 是开发者或极客用户自己动手, 把“买来的眼镜”变成“自己的 AI 终端”。
它能做什么, 以及你会踩的坑
如果你正好有一副 Meta Ray-Ban 智能眼镜, 并且熟悉命令行和 API 配置, VisionClaw 可以让你提前体验一下“随身 AI”是什么感觉: 走在路上问它路边的建筑是什么, 或者让它帮你记下眼前屏幕上的文字。不过, 它毕竟是一个年轻的开源项目, 官方公开的技术细节有限, 很多实用配置需要你自己去摸索。
另外要提醒一点: 依赖 Gemini Live 意味着你需要准备相应的开发者 API 接入方式, 这可能涉及费用或区域限制。项目本身是开源的, 但运行它的云服务未必免费。
上手提示
- 先去看仓库的 README 和 issue 区, 了解当前对 Meta Ray-Ban 型号的支持情况。
- 准备好 Node.js 环境和 TypeScript 编译工具链, 再处理 Gemini API key。
- 如果只是好奇, 可以先从代理功能入手, 语音和视觉的联动调试会更折腾一些。
VisionClaw 目前仍在快速迭代, 适合喜欢折腾、愿意参与到早期项目的开发者。它未必是最终答案, 但至少让人们看到, 智能眼镜离“有用”又近了一步。










评论
暂无评论
成为第一个评论的人