Gemini 3.5 Flash: 模型首次實現計算機操作

Gemini 3.5 Flash: 模型首次實現計算機操作

Ryan Mitchell
61
original

Google DeepMind 在 Gemini 3.5 Flash 中引入 computer use 能力,讓 AI 能直接觀察螢幕、移動游標、點選按鈕並填寫表單,自動完成軟體操作。這一突破將自動化從聊天介面延伸到真實計算機互動,對 RPA、測試、個人助理等領域意義深遠。

本週,Google DeepMind 放出了一枚重磅炸彈:Gemini 3.5 Flash 正式上線了 computer use 功能。簡單來說,這個模型現在能像人一樣「看」螢幕、移動滑鼠、點按鈕、打字——全部自主完成。

聽起來像科幻片?實際上它已經跑在開發者手裡了。DeepMind 在部落格中展示了模型操作瀏覽器、填寫表格、甚至使用命令列介面的例子。這一切並非預編指令碼,而是模型實時理解螢幕截圖後決定的下一步動作。

computer use 到底怎麼工作?

核心機制並不複雜:模型接收當前螢幕的截圖(或視訊幀),輸出滑鼠移動、點選、鍵盤輸入等指令。然後系統執行這些指令,擷取新螢幕,迴圈往復。Gemini 3.5 Flash 專門針對這種 「觀察-行動」迴圈 做了優化,將延遲控制在可接受範圍內。

與之前一些依賴 API 或結構化介面的方案不同,computer use 直接操作 GUI,這意味著它幾乎可以控制任何桌面軟體——無論對方有沒有提供 API。開發者在部落格評論中驚呼:「這下 RPA 工具要地震了。」

當然,目前仍處於早期階段。模型在複雜介面上偶爾會犯低階錯誤,比如點錯按鈕或輸錯欄位。但考慮到這是首次公開亮相,進步空間顯而易見。

這對誰意味著什麼?

對於自動化工程師:傳統 RPA 需要錄製步驟或編寫指令碼,而 computer use 可以用自然語言描述任務,模型自行完成。比如:「把這個 Excel 檔案裡的資料導成 CSV,再上傳到 Google Sheets」——全程無需人工干預。

對於軟體測試:自動化的 UI 測試可以不再依賴脆弱的元素選擇器,而是用視覺理解來操作。邊界情況或許更容易被覆蓋。

對於普通使用者:未來你的個人 AI 助理可能不只是回答問題,還能直接幫你操作電腦——整理檔案、設定軟體、預訂行程。不過隱私和安全壁壘會很高,Google 表示目前訪問許可權嚴格受控。

  • GitHub 上已有開發者嘗試用 Gemini 3.5 Flash 控制本地應用,效果令人驚喜。
  • 一些早期測試者報告:模型能完成表單填寫、搜尋、註冊等重複性任務,成功率約 70%。
  • DeepMind 強調這仍是研究預覽,生產環境需謹慎。

值得關注的限制

首先,速度還不夠快。每次決策需要模型推理,延遲疊加後,簡單操作可能花費數秒。其次,視覺魯棒性:視窗大小變化、解析度不同、甚至截圖壓縮都可能影響模型判斷。最後,安全隱患:賦予模型操作能力意味著潛在的風險——如果模型被誘導執行惡意操作,後果嚴重。Google 採取了一些護欄,但遠未完美。

DeepMind 這次選擇在 Gemini 3.5 Flash 上首發 computer use,而非更強大的 Ultra 模型,顯然是為了快速迭代和收集反饋。Flash 版本成本更低、速度更快,更適合實驗性部署。

「這可能是 AI 從「對話」走向「行動」最關鍵的一步。」—— DeepMind 部落格原文

無論你是開發者還是觀察者,都值得關注這個方向的演進。有觀點認為,computer use 將重塑人機互動正規化:不再是我們教 AI 說話,而是 AI 替我們動手。

下一步,看看開源社羣能做出什麼有趣的衍生品吧。

Gemini 3.5 Flash計算機操作自動化AI操控電腦DeepMindGoogle AI新功能人機互動RPA視覺理解

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多

相似工具

WeiClaw

WeiClaw 是一款配合 Agent 軟體運行的智慧硬體裝置,即時監控 Agent 狀態並接管訊息通道,讓主機在無任務時休眠、有訊息時自動喚醒去處理請求。

Completo AI

Completo AI

Completo AI 是一款生產力助手,輸入一個專案目標即可自動拆解成結構化任務路線圖,適合從想法到執行之間總是卡關的人。

BotIntelli

BotIntelli

面向企業的 AI 作業系統,以無程式碼工作流編排 GPT-4、Claude、Gemini、Llama 等多家模型,配備玻璃盒稽核、SOC 2 與 ISO 27001 級別的安全與治理能力。

Valkoma AI

Valkoma AI

Valkoma AI是一個多合一AI平臺,聲稱可以替換五種不同工具。它提供AI網站構建器,能從單個句子生成完整網站,包括帶有實時WebGL動畫的3D沉浸式網站。聊天機器人構建器可在幾分鐘內部署訓練好的AI聊天機器人。帖子生成器可即時創建LinkedIn和Instagram內容。AI審計員優化提示和工作流程。系統構建器讓用戶設計自主AI代理管道。該平臺由Google Gemini提供支持,無需代碼,也沒有模板。

Nodey

Nodey

Nodey是n8n自動化平臺的iPhone與iPad行動配套應用,提供即時工作流程儀表板、位置與NFC觸發,Pro版附帶AI診斷功能。

AutomationMart

AutomationMart

AutomationMart 是一個買賣預製自動化工作流程的市集,涵蓋 Make.com、n8n 與 Zapier。買家可篩選並預覽工作流程示意圖,付款後即時下載 JSON 藍圖與安裝指南;賣家可從每筆交易保留 80%,透過 Razorpay 結算。平台還提供可選的付費安裝協助。

開源專案

agent-device: 讓 AI 代理通過命令行操控行動裝置

agent-device 是一個開源命令行工具,旨在讓 AI 代理通過 CLI 直接控制 iOS 和 Android 設備。它使用 TypeScript 構建,支持點擊、滑動和文本輸入等基本操作,易於集成到自動化流程中,適合需要 AI 與真實行動裝置交互的開發者和測試人員。該項目採用 MIT 許可證,目前 GitHub 星標數為 2916。

agent-sandbox: 管理隔離有狀態的AI代理運行時

agent-sandbox 是 Kubernetes SIG 旗下的開源項目,用於管理隔離、有狀態、單例的 AI 代理運行時。採用 Go 語言開發,提供聲明式 API 和 CRDs,簡化代理的部署與運維。該項目適合需要長期運行、持久狀態的 AI 應用,目前在 GitHub 上已獲得超過 3100 顆星。

Omnigent: 開源元層框架,統一AI代理

Omnigent是一個開源元層框架,允許開發者無縫切換或組合Claude Code、Codex、Pi等AI代理,無需重寫集成代碼。提供策略控制、沙箱隔離和跨設備實時協作功能。以Python為主要語言,採用Apache-2.0許可證,在採集時擁有2562個星標,適合需要多代理協調的開發團隊。

agent-squad: 編排多AI代理的開源框架

agent-squad 是一個開源框架,用於編排多個AI代理,將每個用戶查詢智能路由到合適的專家代理。該項目支持Python、TypeScript和Swift語言,主要語言為Swift,並採用Apache-2.0許可證。據採集數據,該項目在GitHub上獲得7671顆星。

MindsHub: 開源統一工作區,將項目委託給AI代理

MindsHub是一個開源統一工作區,用戶可將整個項目委託給AI代理。支持路由工作至開放或專有模型,連接自有數據,運行如Anton和Hermes等代理框架,並將結果轉化為可發布的應用。項目基於MIT許可證,主要語言為Makefile。

Activepieces: 開源自託管的Zapier替代品

Activepieces 是一個開源、自託管的自動化平臺,作為 Zapier 的替代品,提供超過 280 個集成組件,並內置 AI 模塊與 MCP 伺服器。項目使用 TypeScript 開發,採用 MIT 社區版許可證。