Gemini 3.5 Flash: 模型首次实现计算机操作

Gemini 3.5 Flash: 模型首次实现计算机操作

Ryan Mitchell
61
original

Google DeepMind 在 Gemini 3.5 Flash 中引入 computer use 能力,让 AI 能直接观察屏幕、移动光标、点击按钮并填写表单,自动完成软件操作。这一突破将自动化从聊天界面延伸到真实计算机交互,对 RPA、测试、个人助理等领域意义深远。

本周,Google DeepMind 放出了一枚重磅炸弹:Gemini 3.5 Flash 正式上线了 computer use 功能。简单来说,这个模型现在能像人一样「看」屏幕、移动鼠标、点按钮、打字——全部自主完成。

听起来像科幻片?实际上它已经跑在开发者手里了。DeepMind 在博客中展示了模型操作浏览器、填写表格、甚至使用命令行界面的例子。这一切并非预编脚本,而是模型实时理解屏幕截图后决定的下一步动作。

computer use 到底怎么工作?

核心机制并不复杂:模型接收当前屏幕的截图(或视频帧),输出鼠标移动、点击、键盘输入等指令。然后系统执行这些指令,截取新屏幕,循环往复。Gemini 3.5 Flash 专门针对这种 「观察-行动」循环 做了优化,将延迟控制在可接受范围内。

与之前一些依赖 API 或结构化接口的方案不同,computer use 直接操作 GUI,这意味着它几乎可以控制任何桌面软件——无论对方有没有提供 API。开发者在博客评论中惊呼:“这下 RPA 工具要地震了。”

当然,目前仍处于早期阶段。模型在复杂界面上偶尔会犯低级错误,比如点错按钮或输错字段。但考虑到这是首次公开亮相,进步空间显而易见。

这对谁意味着什么?

对于自动化工程师:传统 RPA 需要录制步骤或编写脚本,而 computer use 可以用自然语言描述任务,模型自行完成。比如:“把这个 Excel 文件里的数据导成 CSV,再上传到 Google Sheets”——全程无需人工干预。

对于软件测试:自动化的 UI 测试可以不再依赖脆弱的元素选择器,而是用视觉理解来操作。边界情况或许更容易被覆盖。

对于普通用户:未来你的个人 AI 助理可能不只是回答问题,还能直接帮你操作电脑——整理文件、设置软件、预订行程。不过隐私和安全壁垒会很高,Google 表示目前访问权限严格受控。

  • GitHub 上已有开发者尝试用 Gemini 3.5 Flash 控制本地应用,效果令人惊喜。
  • 一些早期测试者报告:模型能完成表单填写、搜索、注册等重复性任务,成功率约 70%。
  • DeepMind 强调这仍是研究预览,生产环境需谨慎。

值得关注的限制

首先,速度还不够快。每次决策需要模型推理,延迟叠加后,简单操作可能花费数秒。其次,视觉鲁棒性:窗口大小变化、分辨率不同、甚至截图压缩都可能影响模型判断。最后,安全隐患:赋予模型操作能力意味着潜在的风险——如果模型被诱导执行恶意操作,后果严重。Google 采取了一些护栏,但远未完美。

DeepMind 这次选择在 Gemini 3.5 Flash 上首发 computer use,而非更强大的 Ultra 模型,显然是为了快速迭代和收集反馈。Flash 版本成本更低、速度更快,更适合实验性部署。

“这可能是 AI 从「对话」走向「行动」最关键的一步。”—— DeepMind 博客原文

无论你是开发者还是观察者,都值得关注这个方向的演进。有观点认为,computer use 将重塑人机交互范式:不再是我们教 AI 说话,而是 AI 替我们动手。

下一步,看看开源社区能做出什么有趣的衍生品吧。

Gemini 3.5 Flash计算机操作自动化AI操控电脑DeepMindGoogle AI新功能人机交互RPA视觉理解

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

相似工具

WeiClaw

WeiClaw 是一款配合 Agent 软件运行的智能硬件设备,实时监控 Agent 状态并接管消息通道,让主机在无任务时休眠、有消息时自动唤醒去处理请求。

Completo AI

Completo AI

Completo AI 是一款生产力助手,输入一个项目目标即可自动拆解成结构化的任务路线图,适合从想法到执行之间总是卡壳的用户。

BotIntelli

BotIntelli

面向企业的 AI 操作系统,用无代码工作流编排 GPT-4、Claude、Gemini、Llama 等多家模型,配备玻璃盒审计、SOC 2 与 ISO 27001 级别的安全与治理能力。

Valkoma AI

Valkoma AI

Valkoma AI 是一个多合一 AI 平台,声称可以替换五种不同工具。它提供 AI 网站构建器,能从单个句子生成完整网站,包括带有实时 WebGL 动画的3D 沉浸式网站。聊天机器人构建器可在几分钟内部署训练好的 AI 聊天机器人。帖子生成器可即时创建 LinkedIn 和 Instagram 内容。AI 审计员优化提示和工作流程。系统构建器让用户设计自主 AI 代理管道。该平台由 Google Gemini 提供支持,无需代码,也没有模板。

Nodey

Nodey

Nodey 是 n8n 自动化平台的 iPhone 与 iPad 移动配套应用,提供实时工作流仪表盘、位置和 NFC 触发,Pro 版附带 AI 诊断功能。

AutomationMart

AutomationMart

AutomationMart 是一个买卖预制自动化工作流的市场,覆盖 Make.com、n8n 与 Zapier。买家可筛选并预览工作流示意图,付款后即时下载 JSON 蓝图与安装指南;卖家可从每笔交易保留 80%,通过 Razorpay 结算。平台还提供可选的付费安装协助。

开源项目

agent-device:让 AI 代理通过命令行操控移动设备

agent-device 是一个开源命令行工具,旨在让 AI 代理通过 CLI 直接控制 iOS 和 Android 设备。它使用 TypeScript 构建,支持点击、滑动和文本输入等基本操作,易于集成到自动化流程中,适合需要 AI 与真实移动设备交互的开发者和测试人员。该项目采用 MIT 许可证,目前 GitHub 星标数为 2916。

agent-sandbox:管理隔离有状态的 AI 代理运行时

agent-sandbox 是 Kubernetes SIG 旗下的开源项目,用于管理隔离、有状态、单例的 AI 代理运行时。采用 Go 语言开发,提供声明式 API 和 CRDs,简化代理的部署与运维。该项目适合需要长期运行、持久状态的 AI 应用,目前在 GitHub 上已获得超过 3100 颗星。

Omnigent:开源元层框架,统一 AI 代理

Omnigent 是一个开源元层框架,允许开发者无缝切换或组合 Claude Code、Codex、Pi 等 AI 代理,无需重写集成代码。提供策略控制、沙箱隔离和跨设备实时协作功能。以 Python 为主要语言,采用 Apache-2.0 许可证,在采集时拥有2562个星标,适合需要多代理协调的开发团队。

agent-squad:编排多 AI 代理的开源框架

agent-squad 是一个开源框架,用于编排多个 AI 代理,将每个用户查询智能路由到合适的专家代理。该项目支持 Python、TypeScript 和 Swift 语言,主要语言为 Swift,并采用 Apache-2.0 许可证。据采集数据,该项目在 GitHub 上获得7671颗星。

MindsHub:开源统一工作区,将项目委托给 AI 代理

MindsHub 是一个开源统一工作区,用户可将整个项目委托给 AI 代理。支持路由工作至开放或专有模型,连接自有数据,运行如 Anton 和 Hermes 等代理框架,并将结果转化为可发布的应用。项目基于 MIT 许可证,主要语言为 Makefile。

Activepieces:开源自托管的 Zapier 替代品

Activepieces 是一个开源、自托管的自动化平台,作为 Zapier 的替代品,提供超过 280 个集成组件,并内置 AI 模块与 MCP 服务器。项目使用 TypeScript 开发,采用 MIT 社区版许可证。