論文の概要: Scalable Behaviour Cloning on Browser Using via Skill Distillation
- arxiv url: http://arxiv.org/abs/2606.32014v1
- Date: Tue, 30 Jun 2026 17:46:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.332834
- Title: Scalable Behaviour Cloning on Browser Using via Skill Distillation
- Title(参考訳): ブラウザ上でのスキル蒸留によるスケーラブルな振る舞いのクローン
- Abstract要約: ブラウザエージェントのボトルネックは不完全な情報に基づく意思決定である,と我々は主張する。
ユーザインタラクションの軌跡を、エージェントが直接読み、検索、再利用、構成できるような、コンパクトな自然言語スキルに変換する。
- 参考スコア(独自算出の注目度): 4.437750866609224
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Internet users collectively perform an enormous range of skilled work through web browsers, from software development and document editing to search, forms, and enterprise workflows, making human browsing a highly scalable but under-exploited source of reusable browser skills. We argue that the bottleneck for browser agents is decision-making under incomplete information rather than low-level operation, and that the priors agents lack are already implicit in human interaction traces. We therefore study scalable behavior cloning for browser agents via skill distillation, converting user interaction trajectories into compact natural-language skills that agents can read, retrieve, reuse, and compose directly. We further organize the distilled skills into a skill graph so that growth proceeds through consolidation rather than unbounded accumulation. This suggests that the scalability of browser agents may come less from manually designed tasks and more from the collective skills already expressed by internet users. Our project is available at: https://lab.einsia.ai/browserbc/.
- Abstract(参考訳): インターネット利用者は、ソフトウェア開発やドキュメント編集から検索、フォーム、エンタープライズワークフローに至るまで、Webブラウザを通じて、膨大な数の熟練した作業を行う。
ブラウザエージェントのボトルネックは、低レベルの操作よりも不完全な情報に基づく意思決定であり、先行エージェントに欠けていることは、人間のインタラクショントレースにおいてすでに暗黙的である、と我々は主張する。
そこで我々は,ブラウザエージェントのスケール性のある動作クローニングをスキル蒸留を用いて研究し,ユーザインタラクションの軌跡を,エージェントが読み,検索,再利用し,直接構成できるコンパクトな自然言語スキルに変換する。
蒸留したスキルをスキルグラフに整理し、無拘束の蓄積ではなく、集約を通じて成長が進むようにする。
これは、ブラウザエージェントのスケーラビリティが、手動で設計されたタスクからではなく、インターネットユーザによってすでに表現されている総合的なスキルから来ていることを示唆している。
私たちのプロジェクトは、https://lab.einsia.ai/browserbc/.comで利用可能です。
関連論文リスト
- COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation [58.84646485020439]
人為的なAIスキルを生成するための自動トレース・ツー・スキル蒸留システムを提案する。
COLLEAGUE.SKILLは、実践、メンタルモデル、意思決定のための能力トラックと、コミュニケーションスタイル、インタラクションルール、修正履歴のための有界な行動トラックの2つのトラックを持つバージョン付きのスキルパッケージを生成する。
論文 参考訳(メタデータ) (2026-05-29T12:59:08Z) - cotomi Act: Learning to Automate Work by Watching You [7.063461281524173]
Cotomi Actは、信頼性の高いマルチステップタスク実行と、ユーザ行動から学んだ永続的な組織的知識を組み合わせた、ブラウザベースのコンピュータ利用エージェントである。
実行のためには、適応的な遅延観察を持つエージェントスキャフォールドが179タスクのWebArenaのヒューマン評価サブセットで80.4%を達成する。
実演では、参加者が実際のブラウザでシステムと対話し、タスクを発行し、エンドツーエンドの自律実行を観察し、知識管理を共有します。
論文 参考訳(メタデータ) (2026-05-04T23:50:20Z) - WebXSkill: Skill Learning for Autonomous Web Agents [104.76374637691212]
WebXSkillは、コードベースのスキルと自然言語ガイダンスのギャップを埋めるフレームワークである。
WebArenaとWebVoyagerでは、WebXSkillはタスク成功率をベースラインで最大9.8と12.9ポイント改善する。
論文 参考訳(メタデータ) (2026-04-14T21:48:15Z) - OSExpert: Computer-Use Agents Learning Professional Skills via Exploration [55.660669638732024]
汎用コンピュータ利用エージェントは、人間の専門家ほど役に立たない。
本研究では,環境の単位関数を探索し,検証するための深度優先探索アルゴリズムを提案する。
エージェントは、合成タスクのカリキュラムを自己構築するために、ユニットスキル間の構成性を利用する。
論文 参考訳(メタデータ) (2026-03-09T05:27:56Z) - BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions [48.194688161526756]
BrowserAgentは、事前に定義されたブラウザアクションのセットを通じて、Playwright経由で生のWebページで直接動作する。
ステップ間で重要な結論を格納するための明示的なメモリ機構を導入し、モデルの推論能力をさらに強化する。
論文 参考訳(メタデータ) (2025-10-12T15:43:37Z) - WALT: Web Agents that Learn Tools [66.73502484310121]
WALTは、Webサイト機能を再利用不能なツールにリバースエンジニアリングするフレームワークである。
WALTはアドホックなスキルを仮説化するのではなく、既にウェブサイトに設計されている自動化の堅牢な実装を公開している。
VisualWebArenaとWebArenaでは、WALTはより少ないステップとLLM依存の推論でより高い成功を達成している。
論文 参考訳(メタデータ) (2025-10-01T23:41:47Z) - WebSailor: Navigating Super-human Reasoning for Web Agent [72.5231321118689]
WebSailorは、この重要な機能を組み込むように設計された、完全なポストトレーニング方法論である。
我々のアプローチは、構造化サンプリングと情報難読化によって、新しい、不確実なタスクを生成することである。
WebSailorは複雑な情報検索タスクにおいて、すべてのオープンソースエージェントを著しく上回っている。
論文 参考訳(メタデータ) (2025-07-03T12:59:07Z) - Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution [34.66260172204154]
人間の学習過程を反映したボトムアップエージェントパラダイムを導入する。
エージェントは、試行錯誤メカニズムを探索し、成果を反映し、時間とともにスキルを抽象化することで能力を獲得する。
Slay the Spire and Civilization Vでは、エージェントが生の視覚的入力を通じて知覚し、マウスのアウトプットを介して行動する。
論文 参考訳(メタデータ) (2025-05-23T09:38:55Z) - Never-Ending Behavior-Cloning Agent for Robotic Manipulation [38.756955029068294]
NBAgentは言語条件のNever-ending Behavior-cloning Agentである。
新しい3Dシーンセマンティクスとロボット操作スキルの観察知識を、スキル共有とスキル固有属性から学習する。
論文 参考訳(メタデータ) (2024-03-01T07:51:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。