論文の概要: Guides That Cause Actions: An Offline Study of Guide-Action Mutual Reinforcement in Multimodal Web Agents
- arxiv url: http://arxiv.org/abs/2609.27353v1
- Date: Wed, 23 Sep 2026 04:49:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.887922
- Title: Guides That Cause Actions: An Offline Study of Guide-Action Mutual Reinforcement in Multimodal Web Agents
- Title(参考訳): 行動を引き起こすガイド:マルチモーダルWebエージェントにおけるガイドアクション相互強化のオフライン研究
- Abstract要約: WebMREは541のタスクと5,293ステップのオフラインベンチマークである。
各ステップは、人間指向のガイド文と接地行動とをペアリングし、相互強化効果の最初の研究を可能にする。
我々の微調整モデルはGPT-5.5、Claude Opus 4.8、Gemini 3.5 Flashより優れています。
- 参考スコア(独自算出の注目度): 10.719117088315338
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Web agents are usually evaluated in live environments, where environment state and judge models drift between runs, so the same checkpoint rarely reproduces the same score, making controlled studies of training phenomena impractical. We present WebMRE, an offline benchmark of 541 tasks and 5,293 steps derived from successful WebArena trajectories, with fully audited test labels and a deterministic protocol that scores a checkpoint identically on every run without any environment. Each step pairs a human oriented guide sentence with a grounded action, enabling the first study of the mutual reinforcement effect between them in web agents. Averaged over three seeds the effect holds for both models in both decoding orders and grows with scale: jointly decoding a guide lifts element selection over an action only reference by 0.9 and 0.2 points for Qwen3.5-4B and by 1.7 and 2.2 points for Qwen3.5-9B. A mediation analysis shows that the guide is a causal channel rather than commentary: forcing the gold guide as a decoding prefix lifts action accuracy from .422 to .684, another step's guide collapses it to .055, and a paraphrase that renames the target still recovers half of the gain, so the channel carries instruction meaning and not only the label string. The same channel yields an offline reward that only a replayable protocol makes computable, though optimizing it from a strong checkpoint brings no gain yet. Our fine tuned models outperform GPT-5.5, Claude Opus 4.8, and Gemini 3.5 Flash, run zero shot, on every offline metric.
- Abstract(参考訳): ウェブエージェントは通常、環境状態と判断モデルが走行間でドリフトしている環境で評価されるため、同じチェックポイントが同じスコアを再現することは滅多になく、訓練現象の制御された研究は現実的ではない。
WebMREは541のタスクと5,293のステップからなるオフラインベンチマークであり、完全に監査されたテストラベルと、環境のないすべてのランで同一のチェックポイントをスコアする決定論的プロトコルを備える。
各ステップは、人間指向のガイド文と接地行動とをペアリングし、Webエージェント間での相互強化効果の最初の研究を可能にする。
ガイドは、Qwen3.5-4Bで0.9点と0.2点、Qwen3.5-9Bで1.7点と2.2点のアクションのみに対して、要素選択を持ち上げる。
金のガイドをデコードプレフィックスとして強制すると、アクション精度が .422 から .684 に上がり、別のステップのガイドが .055 に崩壊し、ターゲットをリネームするパラフレーズがまだゲインの半分を回復しているため、チャネルは指示の意味を持ち、ラベル文字列のみではない。
同じチャンネルは、リプレイ可能なプロトコルだけが計算可能とするオフラインの報酬を与えるが、強力なチェックポイントからそれを最適化することは、まだ利益をもたらすことはない。
我々の微調整モデルはGPT-5.5、Claude Opus 4.8、Gemini 3.5 Flashより優れています。
関連論文リスト
- Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World [0.0]
LLMルータは、各要求を最も安価な適切なモデルに合わせることで効率を約束し、マルチステップエージェント内のステップごとに適用されるようになっている。
しかし、エージェントルータはシングルターンルータのように評価され、ログ付きトラジェクトリを再生し、他のモデルの出力を置換することで評価される。
我々は,SWE-benchエージェントを制御点にフォークし,環境を再構築し,各フォークを異なるモデルで継続し,サンプリングと再生を分離する同モデル制御フォークと比較する。
論文 参考訳(メタデータ) (2026-08-08T17:07:11Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Internal-State Probes Read the Situation, Not the Action: Three Negative Results for Pre-Action Misalignment Monitoring [1.3636639880574484]
内部の読み出しは、それらのアクションが生成される前に有害なテキストやツールアクションを特定する場合、エージェントシステムを監視するのに役立つ。
Qwen2.5-Coder-32B-Instruct fine-tune/base direction, Llama-3.1-8B-Instruct probes at the last token of unsafe prefills, Gemma-3-27B-IT emotion-concept vectors for projection and steering。
論文 参考訳(メタデータ) (2026-06-29T15:18:36Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - AgentAtlas: Beyond Outcome Leaderboards for LLM Agents [0.025718125188898048]
AgentAtlasは、診断語彙および監査プロトコルとしてのエージェント評価を再設定する。
i)6状態制御-決定分類(Act / Ask / Refuse / Stop / Confirm / Recover)、(ii)一次誤差源と下流衝撃を持つ軌道障害語彙、(iv)8つのモデルで評価された合成1,342-itemに関する実証的プロトコル研究。
論文 参考訳(メタデータ) (2026-05-19T22:05:12Z) - Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline [2.4832413743954618]
本稿では,AI会議要約をインスタンス化した,生成型AIアプリケーションのための再利用可能な評価パイプラインを提案する。
このシステムは、ソースの取り込み、構造化された参照構成、候補生成、構造化されたスコアリング、レポートの5段階にわたるタスク固有のセマンティクスから再利用可能なオーケストレーションを分離する。
オフラインループをCity_council, private_data, whitehouse_press_briefingsにまたがる114のミーティングの型付きデータセットでベンチマークする。
論文 参考訳(メタデータ) (2026-04-23T07:02:11Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Detection Transformer with Stable Matching [48.963171068785435]
もっとも重要な設計は, 肯定的な事例の分類スコアを監督するために, 位置測定値のみを使用することである。
本原理では,DTRの分類損失とマッチングコストに位置測定値を統合することで,簡易かつ効果的な2つの修正を提案する。
12エポックおよび24エポックのトレーニング設定の下でResNet-50バックボーンを用いてCOCO検出ベンチマークで50.4および51.5APを達成する。
論文 参考訳(メタデータ) (2023-04-10T17:55:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。