Gemini 3.5 FlashにComputer Use統合 — 低コスト×エージェントUI操作の現在地を徹底解説
はじめに
2026年6月24日、Googleは低レイテンシ・低コストの主力モデル「Gemini 3.5 Flash」に Computer Use(コンピュータ操作) 機能を統合したと発表しました。ブラウザ・モバイル・デスクトップの画面を「見て、推論し、操作する」エージェントを構築できる機能です。これまでComputer Useは2024年秋にAnthropicが切り拓き、各社が専用モデルで追随してきた領域でしたが、今回それが「安くて速い汎用モデルの一機能」として降りてきた点に大きな意味があります。本記事では、何が発表されたのか、ベンチマークをどう読むべきか、そしてエンジニアの実務に何が変わるのかを掘り下げます。
何が発表されたか — 専用モデルから主力モデルの一機能へ
最大のポイントは、Computer Useが 独立した専用モデル(従来のGemini 2.5 computer-use系)から、主力のGemini 3.5 Flashへネイティブ統合された ことです。これにより開発者は、画面のスクリーンショットを入力として受け取り、「ここをクリック」「この欄に入力」「スクロール」といった操作アクションを出力するエージェントを、Gemini API経由で構築できるようになります。
Googleが挙げるユースケースは、プロフェッショナル向けアプリ全般にわたる「継続的なソフトウェアテスト」と「ナレッジワーク」です。具体例として、Webアプリのアクセシビリティ監査や、アプリケーションの機能分析・カテゴリ化などが示されています。提供面では、エンタープライズ向けのGemini Enterprise Agent Platformに対応し、Browserbaseがホストするデモ環境で実際に試せるようになっています。
ただし、検証エンジニアが注意すべき重要な前提があります。発表時点では、Computer Use APIの本系統はまだプレビュー段階にあり、評価の際は2.5系のプレビューモデルを通すケースが残るという指摘が出ています。「3.5 Flashで発表された=即座に同一APIで本番投入できる」とは限らないため、自分のユースケースでどのエンドポイントが叩けるのかは事前に確認すべきです。
技術的背景 — OSWorldベンチマークと「人間並み」のライン
Computer Useエージェントの実力は、主にOSWorld-Verifiedというベンチマークで測られます。これはLibreOffice・Chrome・VS Code・ファイル管理など、実在のデスクトップ環境上の369タスクをエージェントに解かせ、クリックやナビゲーションを伴う実作業の完遂率を評価するものです。人間の平均は概ね72〜73%程度とされ、ここがひとつの「人間並み」の目安になります。
報じられている数値では、Gemini 3.5 Flashが約 78.4%、AnthropicのClaude Opus 4.7が78.0% と、両者は1ポイント以内のほぼ互角。主要なComputer Useモデルはいずれも人間ベースラインを上回る水準に達しています。この領域の進歩は急で、OpenAIが2025年1月にOperatorを出した当初のOSWorldスコアは38.1%、Anthropicも2025年に数か月で38%→61%へと跳ね上がりました。1年あまりで「半分も解けない」状態から「人間を超える」水準まで来たことになります。
そしてGemini 3.5 Flashが注目される本当の理由は精度そのものよりコスト構造です。価格は100万トークンあたり入力$1.50・出力$9.00で、Anthropicのフラッグシップ級と比べトークン単価はおよそ1/3。「最高精度を僅差で追いながら、3倍安く回せる」というポジションは、大量のUI操作を反復するエージェント用途で効いてきます。なお、新世代モデルは旧Flash世代より単価自体は上がっており、「Flash=とにかく激安」という前提は更新が必要です。
エンジニアへの影響 — E2Eテストと業務自動化の現実解
実務へのインパクトが最も大きいのは、E2Eテストとブラウザ業務の自動化でしょう。従来のSeleniumやPlaywrightはセレクタ(DOMの要素指定)に強く依存し、UIが変わるたびにテストが壊れる「flaky test」に悩まされてきました。画面を視覚的に理解して操作するエージェントなら、「ログインして請求書をダウンロードする」といった自然言語の意図ベースで操作を組め、軽微なUI変更への耐性が期待できます。低コストモデルでこれが回せる意味は小さくありません。
一方で安全性は最重要の検討事項です。Googleはプロンプトインジェクションへの対抗的訓練(adversarial training)を施し、エンタープライズ向けに「機微な操作の前に明示的な確認を求める」「間接的なインジェクションを検知したら自動停止する」といった多層防御(defense-in-depth)を用意しています。逆に言えば、画面操作エージェントは悪意あるWebページのテキストに操作を乗っ取られうるということ。本番導入では権限の最小化、確認ステップの必須化、操作ログの監査を前提に設計すべきです。
まとめ
- Googleが主力モデルGemini 3.5 FlashにComputer Useをネイティブ統合し、ブラウザ/モバイル/デスクトップ操作エージェントを構築可能に。
- OSWorld-Verifiedで約78%とClaude Opus 4.7に肉薄しつつ、トークン単価は約1/3という「安くて十分速い」ポジション。
- 一方でComputer Use APIの提供形態にはプレビューの注意点があり、本番投入前にエンドポイントの確認が必要。
- E2Eテストや業務自動化の現実解になりうるが、プロンプトインジェクション対策と権限設計は必須。
エージェントUI操作はAnthropicが切り拓いた領域ですが、それが「安価な汎用モデルの標準機能」へと降りてきたことで、いよいよ実験から実装のフェーズへ移りつつあります。次の焦点は、精度の数ポイント差ではなく「いかに安全に・安く・壊れずに回し続けられるか」の運用品質になるでしょう。