論文の概要: WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance
- arxiv url: http://arxiv.org/abs/2608.06704v1
- Date: Fri, 07 Aug 2026 02:00:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.326712
- Title: WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance
- Title(参考訳): WebRider: ライブWebアシストのためのペルソナコンディションインテントコントローラ
- Authors: Zhi Li, Tao Zhou, Yeqing Li, Eugene Ie, Demetri Terzopoulos,
- Abstract要約: 現在のライブウェブエージェントは最終回答のみに基づいて評価され、デリゲートを定義するポリシー制約を無視します。
WebRiderは、デリゲートされたポリシーを意図的な契約として形式化し、このギャップを埋めます。
WebRiderは、最終回答決定とアクション実現を混同することなく、監査可能、人的判断可能、学習可能なシステムを実現する。
- 参考スコア(独自算出の注目度): 13.202697146509317
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Delegating a web task involves more than asking a question; it requires transferring a policy: what to verify, how to handle uncertainty, which preferences matter, and when to stop. Yet, current live-web agents are evaluated solely on the final answer, ignoring the policy constraints that define the delegation. A plausible final answer can conceal violations of that policy. Our full live audit reveals this critical gap: a strong controller completes 99.2% of tasks but honors all policy constraints in only 38.8% of cases. Finishing does not imply fidelity. WebRider bridges this gap by formalizing the delegated policy as an intent contract---an operational record of goals, constraints, evidence obligations, answer form, and task-local persona controls that must hold even as web pages change. WebRider employs a hierarchical architecture: a top-layer controller maintains the contract, a middle layer realizes intentions as guarded executable actions, and a tool layer executes these actions via browser, search, and maps tools. Our benchmark, RiderBench, evaluates this design on 4,096 live-web contracts across 42 public websites, auditing both the internal contract state and the visible user experience to determine if a rollout preserved its policy and if the steps were persona-consistent. The guarded middle interface also serves as a high-quality training signal; an 8B action-policy model trained through this interface outperforms executable-only baselines under a fixed controller. By making the browsing path a first-class object, WebRider enables a system that is auditable, human-judgeable, and learnable without conflating action realization with final-answer decisions. Dataset URL: hf.co/datasets/WebRider/WebRider.
- Abstract(参考訳): 何を検証するか、不確実性を扱う方法、どの好みが重要か、いつ停止するか。
しかし、現在のライブウェブエージェントは最終回答のみに基づいて評価され、デリゲートを定義するポリシー制約を無視します。
最終的な答えは、そのポリシーの違反を隠蔽することができる。
強力なコントローラーは99.2%のタスクを完了しますが、38.8%のケースですべての政策制約を尊重します。
仕上げは忠実さを暗示しない。
WebRiderは、委譲されたポリシーを意図的な契約として形式化し、そのギャップを埋めます。-- 目標、制約、エビデンス義務、回答フォーム、そして、Webページが変化しても保持しなければならないタスクローカルなペルソナコントロールの運用記録です。
WebRiderは階層的なアーキテクチャを採用しており、トップ層コントローラは契約を維持し、中間層は保護された実行可能なアクションとして意図を認識し、ツール層はブラウザ、検索、マップツールを介してこれらのアクションを実行する。
当社のベンチマークであるRiderBenchは、42の公開Webサイトで4,096件のライブWeb契約に基づいてこの設計を評価し、内部契約状態と可視ユーザエクスペリエンスの両方を監査し、ロールアウトがそのポリシーを保持し、ステップがペルソナ一貫性があるかどうかを判断する。
ガードされたミドルインタフェースは、高品質なトレーニング信号としても機能し、このインタフェースを通じて訓練された8Bアクションポリシーモデルは、固定されたコントローラの下で実行可能のみのベースラインより優れている。
ブラウジングパスを第1級のオブジェクトにすることで、WebRiderは、最終回答決定とアクション実現を混同することなく、監査可能、人的判断可能、学習可能なシステムを実現する。
データセットURL:hf.co/datasets/WebRider/WebRider。
関連論文リスト
- Agent Security Needs Redefinition through a Holistic Framework [46.88917910966891]
被告は、命令が悪意あるように見えるかどうかを問う。ベンチマークは、エージェントが有害な鳴き声を行うかどうかを問う。
我々は,エージェントの軌道全体にわたって連続的に評価されなければならない4つの特性を通じて,コンテキストセキュリティを運用する。
論文 参考訳(メタデータ) (2026-07-24T06:43:09Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity? [54.701199583505144]
アプリケーション間アクセスは、ほとんど見落とされたプライバシーリスクを生み出す。
我々はAgentCIBenchを紹介します。これは、このリスクを決定論的に評価されたシナリオに変換する評価ハーネスです。
我々は15のフロンティアエージェントを評価し、驚くほど高い失敗率を見出す。
論文 参考訳(メタデータ) (2026-06-22T11:36:58Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - SPILLage: Agentic Oversharing on the Web [13.930845226612767]
LLMはオープンウェブ全体でユーザーのタスクを自動化し始めており、しばしばEメールやカレンダーなどのユーザーリソースにアクセスしている。
私たちは、Webエージェントが、ライブWebサイト全体にわたってタスクを代行するときに、どのようにユーザーリソースを扱うのかを尋ねる。
本稿では,Web上のアクションのエージェントトレースを通じて,非意図的なタスク関連ユーザ情報の開示を行うNatural Agentic Over sharingを形式化する。
論文 参考訳(メタデータ) (2026-02-13T23:02:50Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - SteP: Stacked LLM Policies for Web Actions [17.038201462039453]
本稿では,Web アクションのためのスタック型 LLM ポリシー (SteP) を提案する。
StePは、状態が制御状態を表すポリシーのスタックであるマルコフ決定プロセスを定義する。
我々は、WebArena、MiniWoB++、CRMなど、複数のベースラインとWeb環境に対してStePを評価する。
論文 参考訳(メタデータ) (2023-10-05T17:40:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。