agent-browser logo

agent-browser

認証する

agent-browserは、AIエージェント向けのブラウザ自動化CLIです。Chromeを起動し、refベースのスナップショットと多彩なブラウザ操作に対応。macOS、Linux、Windows向けのネイティブバイナリを提供します。

agent-browser preview

AIエージェント向けのブラウザ自動化CLI

agent-browserは、AIエージェント向けのブラウザ自動化CLIです。ネイティブのRustデーモンを通じてChromeを起動・制御し、コンパクトなテキスト出力でエージェントの文脈でもブラウザ状態を読みやすく保ちます。

この製品はrefベースのスナップショット・ワークフローを中心に設計されています。ブラウザは安定したrefを持つアクセシビリティツリーを返し、以降のコマンドはそれらのrefを直接操作できます。ドキュメントでは、シェル駆動のエージェント向けとして位置づけられ、ナビゲーション、フォーム、スクリーンショット、ネットワーク検査、ストレージ、タブ、フレーム、デバッグ、その他のブラウザタスクへの対応が示されています。

インストール方法には npm、npx、Homebrew、Cargo、ソースビルドがあり、macOS、Linux、Windows向けのネイティブバイナリも利用できます。サイトには、永続セッション、プロキシ、カスタムブラウザ実行ファイル、ブラウザ自動化MCPサーバーのための設定ファイル、環境変数、コマンドも記載されています。

機能

refベースのコンパクトなスナップショット

snapshot コマンドは、`@e1` や `@e2` のようなrefを含むコンパクトなアクセシビリティツリーを返します。これにより、トークン使用量を抑えつつ要素選択を決定論的にすることを意図しています。

幅広いコマンド対応

CLIは、ナビゲーション、フォーム、スクリーンショット、ネットワーク、ストレージ、ファイル、タブ、フレーム、デバッグをカバーし、サイト全体で50以上のコマンドがドキュメント化されています。

観察可能なブラウザセッション

組み込みツールには、ビデオ録画、ストリーミング、デバッグ、プロファイラ、差分比較が含まれており、CLIを離れずにブラウザセッションを確認できます。

クロスプラットフォームのネイティブバイナリ

ドキュメントでは、macOS、Linux、Windows へのネイティブ対応が強調されており、ブラウザ拡張機能のラッパーではなくRustバイナリとして提供されています。

ステートフルなブラウザセッション

セッションは、プロフィール、認証状態、Cookie、ストレージ、プロキシ設定、セキュリティ制御を保持でき、長時間のワークフローに対応します。

高度なワークフロー対応

設定とインストールのドキュメントでは、プロキシ対応、初期化スクリプト、React と Web Vitals のワークフロー、アプリ固有の自動化のための Next.js + Vercel ドキュメントが案内されています。

ユースケース

  • AI主導のブラウザ操作

    AIエージェントがターミナルから決定論的にブラウザを制御する必要があるときに、CLIでページを開き、スナップショットを取得し、refを使ってクリックしたりフィールドに入力したりします。

  • 長時間の認証済みワークフロー

    長いワークフローや繰り返し実行の間もブラウザをログイン状態に保つ必要がある場合は、永続セッション、プロフィール、Cookie、ストレージを使用します。

  • デバッグと視覚的確認

    レンダリング変更を確認したり、デバッグ用にブラウザの挙動を記録したりする必要がある場合は、スクリーンショット、ビデオ録画、ストリーミング、プロファイラ、差分比較を使います。

  • 制御された環境とCI

    CI、devcontainer、または企業ネットワークの制約下で自動化する場合は、プロキシ設定、カスタム起動引数、インストール時の依存関係ヘルパーを使用します。

  • エージェント支援開発

    Claude Code、Cursor、GitHub Copilot、OpenAI Codex などのコーディングエージェントと組み合わせる際は、ドキュメント化されたネイティブ統合とシェルコマンドのワークフローを使用します。

Pros and Cons

Pros

  • コンパクトなテキスト出力は、完全なDOMやJSON出力よりも少ないトークンで済むよう設計されています。
  • スナップショットは要素refを公開するため、後続のコマンド間でも一貫した操作を実現できます。
  • CLIには、ナビゲーションやフォームからスクリーンショット、ネットワーク、ストレージ、デバッグまで、幅広いブラウザ操作がドキュメント化されています。
  • macOS、Linux、Windows向けのネイティブバイナリが利用できます。
  • 設定では、永続的な既定値、環境変数による上書き、プロジェクト単位の設定に対応しています。

Cons

  • 収集された証拠では、料金ページに安定して公開されたプラン概要が現時点で示されていません。
  • 一部の統合やプロバイダーの詳細は収集ソース内で部分的にしか文書化されていないため、対応エコシステムは監査済みの証拠で確認できる範囲より広い可能性があります。

FAQ

agent-browserは何に使いますか?

AIエージェント向けに設計されたブラウザ自動化CLIです。ページを開き、スナップショットを取得し、refを使ってクリックしたりフォームに入力したり、CDP経由でブラウザに接続したりするためのコマンドがドキュメントに記載されています。

agent-browserはどのようにインストールしますか?

インストール手順には、グローバルインストール、プロジェクト内インストール、macOSでのHomebrew、Cargo、npxによるクイックスタートが示されています。Linuxでは `agent-browser install --with-deps` を使って必要なシステム依存関係もインストールできます。

基本的なワークフローはどのように動作しますか?

コマンドリファレンスでは、シェル中心のワークフローが示されています。ページを開き、スナップショットを取得して要素refを得てから、そのrefを使って click、fill、type、screenshot などのコマンドで操作します。

どのようなコマンドをサポートしていますか?

ドキュメントには、利用可能なコマンドとして `snapshot`、`screenshot`、`pdf`、`read`、`stream`、`connect`、`mcp` が挙げられており、ナビゲーション、フォーム、タブ、ファイル、デバッグ操作も含まれています。

どのプラットフォームとエージェントに対応していますか?

サイトでは、macOS、Linux、Windows向けのネイティブバイナリが案内されており、Claude Code、Cursor、GitHub Copilot、OpenAI Codex、Gemini など、シェルコマンドを実行できるエージェントで動作すると説明されています。

Quick Facts

カテゴリ
開発者ツール
主な用途
AIエージェント向けのブラウザ自動化
対応プラットフォーム
macOS、Linux、Windows
インターフェース
ネイティブRustデーモンを備えたCLI
ソースドメイン
agent-browser.dev
ワークフロー
ページを開く → refをスナップショット化 → コマンドで操作