Gemini 3.5 Flash: モデル初のコンピューター操作を実現

Gemini 3.5 Flash: モデル初のコンピューター操作を実現

Ryan Mitchell
61
original

Google DeepMind は Gemini 3.5 Flash に computer use 機能を導入し、AI が画面を直接観察し、カーソルを動かし、ボタンをクリックし、フォームに入力して、ソフトウェア操作を自動で完了できるようにしました。この進歩により、自動化はチャットインターフェースから実際のコンピューター操作に拡張され、RPA、テスト、パーソナルアシスタントなどの分野で大きな意味を持ちます。

今週、Google DeepMind が衝撃的な発表を行った。Gemini 3.5 Flashcomputer use 機能が正式に搭載されたのだ。簡単に言えば、このモデルは人間のように画面を「見て」、マウスを動かし、ボタンをクリックし、文字を入力する――すべて自律的に実行できる。

SF映画のように聞こえるかもしれない。実際には、すでに開発者の手元で動いている。DeepMind はブログで、モデルがブラウザを操作し、フォームに入力し、コマンドラインインターフェースを使用する例を公開した。これらは事前にスクリプト化されたものではなく、モデルがスクリーンショットをリアルタイムで理解し、次のアクションを決定している。

computer use はどのように機能するのか?

中核となる仕組みは複雑ではない。モデルは現在の画面のスクリーンショット(またはビデオフレーム)を受け取り、マウスの移動、クリック、キーボード入力などの命令を出力する。システムがその命令を実行し、新しいスクリーンショットを取得して、このサイクルを繰り返す。Gemini 3.5 Flash はこの「観察-行動」ループに特化して最適化されており、遅延は許容範囲内に抑えられている。

API や構造化インターフェースに依存する従来の手法とは異なり、computer use は GUI を直接操作する。つまり、API が用意されていないデスクトップソフトウェアでも、ほぼすべて制御できることを意味する。開発者からはブログのコメントで「これで RPA ツールは大地震だ」という声が上がっている。

もちろん、まだ初期段階だ。複雑な画面では、誤ったボタンをクリックしたり、誤ったフィールドに入力したりといった初歩的なミスをすることがある。ただし、これが初めての公開であることを考えれば、改善の余地は明らかに大きい。

これは誰にとって何を意味するのか?

自動化エンジニアにとって:従来の RPA はステップの記録やスクリプトの作成が必要だった。一方、computer use は自然言語でタスクを記述すれば、モデルがそれを実行する。「この Excel ファイルのデータを CSV に変換して、Google Sheets にアップロードして」――といった指示だけで、人手を介さずに完了する。

ソフトウェアテストにとって:UI テストの自動化では、脆弱な要素セレクターに頼る必要がなくなり、視覚的な理解に基づいて操作できるようになる。エッジケースもより簡単にカバーできる可能性がある。

一般ユーザーにとって:将来、パーソナル AI アシスタントは質問に答えるだけでなく、ファイルの整理、ソフトウェアの設定、旅行の予約など、コンピューターの操作も直接代行してくれるようになるかもしれない。ただし、プライバシーとセキュリティの壁は高く、Google は現在アクセス権限を厳重に管理していると述べている。

  • GitHub では、Gemini 3.5 Flash を使ってローカルアプリを制御する試みがすでに登場しており、その結果は驚くべきものだ。
  • 初期のテスターによると、フォーム入力、検索、登録などの反復タスクを約 70% の成功率で完了できるとの報告がある。
  • DeepMind は、これはあくまで研究プレビューであり、本番環境での使用には慎重な対応が必要だと強調している。

注目すべき制限事項

まず、速度がまだ十分ではない。毎回の判断にモデルの推論が必要なため、遅延が積み重なると、単純な操作でも数秒かかることがある。次に、視覚的ロバスト性の問題だ。ウィンドウサイズの変更、解像度の違い、スクリーンショットの圧縮などがモデルの判断に影響を与える可能性がある。最後に、セキュリティ上のリスクがある。モデルに操作能力を与えることは潜在的な危険を意味し、悪意のある操作を実行するよう誘導された場合の影響は深刻だ。Google はいくつかのガードレールを設けているが、完璧とは程遠い。

DeepMind が今回、より高性能な Ultra モデルではなく Gemini 3.5 Flash で computer use を先行公開したのは、迅速なイテレーションとフィードバック収集を目的としたものだ。Flash 版はコストが低く、速度も速いため、実験的な導入に適している。

「これは AI が『対話』から『行動』へと向かう上で、最も重要な一歩になるかもしれない。」―― DeepMind ブログより

開発者であれ観察者であれ、この方向性の進化に注目する価値はある。computer use は人とコンピューターのインタラクションのパラダイムを変革するという見方もある。もはや AI に話し方を教えるのではなく、AI が私たちの代わりに手を動かす時代になる。

次のステップは、オープンソースコミュニティがどんな興味深い派生作品を生み出すかだ。

Gemini 3.5 Flashコンピューター操作自動化AIによるパソコン操作DeepMindGoogle AI新機能ヒューマンコンピューターインタラクションRPA視覚理解

共有

コメント

0
0/500 文字

コメントはまだありません

最初のコメントを書きましょう

もっと見る

類似ツール

WeiClaw

WeiClawはAgentソフトウェアと連携して動作するスマートハードウェアデバイスで、Agentの状態をリアルタイムで監視し、メッセージチャネルを引き継ぎます。ホストはタスクがないときはスリープし、メッセージがあれば自動的に起動してリクエストを処理します。

Completo AI

Completo AI

Completo AI は生産性アシスタントで、プロジェクトの目標を入力するだけで、自動的に構造化されたタスクのロードマップに分解してくれます。アイデアから実行までの間でいつも行き詰まるユーザーに適しています。

BotIntelli

BotIntelli

企業向けのAIオペレーティングシステム。ノーコードのワークフローでGPT-4、Claude、Gemini、Llamaなど複数のモデルをオーケストレーションし、グラスボックス監査、SOC 2およびISO 27001レベルのセキュリティとガバナンス能力を備えています。

Valkoma AI

Valkoma AI

Valkoma AI は、5つの異なるツールを置き換えるとされるオールインワンAIプラットフォームです。1つの文から完全なWebサイトを生成できるAI Webサイトビルダーを提供しており、リアルタイムのWebGLアニメーションを備えた3D没入型Webサイトも作成できます。チャットボットビルダーを使用すると、トレーニング済みのAIチャットボットを数分でデプロイできます。投稿生成ツールは、LinkedInやInstagramのコンテンツを即座に作成します。AI監査人はプロンプトとワークフローを最適化します。システムビルダーにより、ユーザーは自律型AIエージェントパイプラインを設計できます。このプラットフォームはGoogle Geminiを搭載し、コードは不要で、テンプレートもありません。

Nodey

Nodey

Nodeyは、n8nオートメーションプラットフォームのiPhoneおよびiPad向けモバイルコンパニオンアプリです。リアルタイムのワークフローダッシュボード、位置情報・NFCトリガーを提供し、Pro版にはAI診断機能が含まれます。

AutomationMart

AutomationMart

AutomationMartは、事前に作成された自動化ワークフローを売買するマーケットプレイスです。Make.com、n8n、Zapierに対応しています。購入者はワークフロー図をフィルタリングしてプレビューでき、支払い後、JSONブループリントとインストールガイドを即座にダウンロードできます。販売者は各取引で80%を受け取ることができ、決済はRazorpay経由です。プラットフォームは有料のインストール支援オプションも提供しています。

オープンソース代替

agent-device:AIエージェントがコマンドラインでモバイルデバイスを操作できるようにする

agent-device は、AIエージェントがCLI経由でiOSおよびAndroidデバイスを直接制御できるようにする、オープンソースのコマンドラインツールです。TypeScriptで構築されており、タップ、スワイプ、テキスト入力などの基本操作をサポートし、自動化ワークフローに簡単に統合できます。AIと実際のモバイルデバイスの連携を必要とする開発者やテスターに適しています。このプロジェクトはMITライセンスを採用しており、現在のGitHubスター数は2916です。

agent-sandbox:分離されたステートフルなAIエージェントランタイムの管理

agent-sandboxはKubernetes SIGが運営するオープンソースプロジェクトであり、分離され、ステートフルでシングルトンのAIエージェントランタイムを管理します。Go言語で開発され、宣言的APIとCRDを提供し、エージェントのデプロイと運用を簡素化します。このプロジェクトは、長期的な実行と永続的な状態を必要とするAIアプリケーションに適しており、現在GitHubで3100以上のスターを獲得しています。

Omnigent:オープンソースのメタレイヤーフレームワーク、AIエージェントを統合

Omnigentはオープンソースのメタレイヤーフレームワークです。開発者は統合コードを書き直すことなく、Claude Code、Codex、PiなどのAIエージェントをシームレスに切り替えたり組み合わせたりできます。ポリシー制御、サンドボックス隔離、デバイス間のリアルタイムコラボレーション機能を提供します。主言語はPythonで、Apache-2.0ライセンスを採用しており、収集時点で2562個のスターを獲得しています。複数のエージェントを調整する必要がある開発チームに適しています。

agent-squad:複数のAIエージェントをオーケストレーションするオープンソースフレームワーク

agent-squadは、複数のAIエージェントをオーケストレーションするためのオープンソースフレームワークで、各ユーザークエリを適切な専門エージェントにインテリジェントにルーティングします。このプロジェクトはPython、TypeScript、Swift言語をサポートしており、主要言語はSwiftで、Apache-2.0ライセンスを採用しています。収集データによると、GitHubで7671スターを獲得しています。

MindsHub:プロジェクトをAIエージェントに委任できるオープンソースの統合ワークスペース

MindsHubは、ユーザーがプロジェクト全体をAIエージェントに委任できるオープンソースの統合ワークスペースです。オープンまたは専有モデルへのタスクルーティング、独自データの接続、AntonやHermesなどのエージェントフレームワークの実行、結果の公開可能なアプリケーションへの変換をサポートしています。プロジェクトはMITライセンスに基づき、主要言語はMakefileです。

Activepieces:オープンソース・セルフホスト型のZapier代替ツール

Activepiecesは、オープンソースでセルフホスト型の自動化プラットフォームです。Zapierの代替品として、280以上の統合コンポーネントを提供し、AIモジュールとMCPサーバーを内蔵しています。プロジェクトはTypeScriptで開発され、MITコミュニティ版ライセンスを採用しています。