論文の概要: Binding Drift in Multi-Step Tool-Augmented Agents
- arxiv url: http://arxiv.org/abs/2607.18316v1
- Date: Fri, 17 Jul 2026 20:00:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.1797
- Title: Binding Drift in Multi-Step Tool-Augmented Agents
- Title(参考訳): 多段工具強化剤における結合ドリフト
- Abstract要約: 以前の研究によると、シングルステップアクションでは、エージェントは正しいツールを選択し、間違ったエンティティに24~26%の時間でバインドする。
それらは正しいままで、別のエンティティに静かに漂うのか、最初から間違っていれば、伝播し、複合するのか?
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-augmented language-model agents execute multi-step workflows over external systems, resolving an entity once and then acting on it across subsequent steps. Prior work shows that in single-step actions, agents select the correct tool but bind it to the wrong entity 24-26% of the time. We study what happens to entity bindings over time: do they stay correct, silently drift to a different entity, or, if wrong from the start, propagate and compound? We formalize binding drift (correct at step 1, wrong later) as distinct from error propagation (wrong at step 1, carried forward), and score them on disjoint workflow sets so the two cannot be conflated. In a controlled multi-step testbed (200 workflows, 580 entity-binding-scored steps, four enterprise domains, eight model backends spanning small to frontier), we find: (1) under controlled error injection, an entity lock (the intuitive "persist the first binding" fix) amplifies wrong actions from 907 to 2,746 (3.0x; bootstrap 95% CI [2.8, 3.3]), because it faithfully carries the seeded wrong entity into every later step; (2) the amplification reaches 8.5x on the most affected model (Claude Opus 4.5); (3) a practical LLM-based re-verifier (a single cheap second model call re-reading the original instruction) reduces wrong actions by 79% (0.21x; CI [0.18, 0.25]), closing the gap to within 1 percentage point of an oracle upper-bound (0.20x); and (4) in the natural (non-injected) setting, baseline agents drift on 18% of eligible workflows, with the per-step error rate rising across steps. Persistence and re-verification are not interchangeable: a defense that eliminates drift can worsen propagation, and a practical re-verifier nearly matches oracle recovery.
- Abstract(参考訳): ツール拡張された言語モデルエージェントは、外部システム上でマルチステップワークフローを実行し、エンティティを一度解決し、その後ステップで処理する。
以前の研究によると、シングルステップアクションでは、エージェントは正しいツールを選択し、間違ったエンティティに24~26%の時間でバインドする。
それらは正しいままで、別のエンティティに静かに漂うのか、最初から間違っていれば、伝播し、複合するのか?
我々は、結合ドリフト(ステップ1で正しい)をエラー伝播(ステップ1で引き起こされる)とは異なるものとして定式化し、それらを不連結なワークフローセットでスコアし、この2つを混同できないようにする。
制御された多段階テストベッド(200のワークフロー、580のエンティティバインディングされたステップ、4つのエンタープライズドメイン、8つのモデルバックエンド)では、(1)制御されたエラー注入の下で、エンティティロック(直感的な“最初のバインディング”フィックス)が907から2,746までの間違ったアクションを増幅する(3.0x;ブートストラップ95% CI [2.8, 3.3])。
漂流を除去する防御は伝播を悪化させ、実際の再検証はオラクルの回復とほぼ一致する。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows [23.621239974604205]
APIFlow-Benchは、長期依存のREST-APIパフォーマンスのための、完全に監査可能なベンチマークである。
サブタスクによってサブタスクとして,合成APIの世界を前方に生成する。
すべての応答キーと44,362個の未修正実行書き起こしをリリースします。
論文 参考訳(メタデータ) (2026-08-29T08:12:11Z) - Invocation-Level Reliability of Tool-Using Agents [0.7874708385247353]
クリーンな教師強化コンテキストと,モデル独自のフリーランニングコンテキストの両方の下で,その2つを分離する,正しい起動率を測定する。
深さ6では、モデル自身のクリーンコンテキスト能力の約70%が、以前の失敗に失われる。
論文 参考訳(メタデータ) (2026-08-23T09:04:59Z) - The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World [0.0]
LLMルータは、各要求を最も安価な適切なモデルに合わせることで効率を約束し、マルチステップエージェント内のステップごとに適用されるようになっている。
しかし、エージェントルータはシングルターンルータのように評価され、ログ付きトラジェクトリを再生し、他のモデルの出力を置換することで評価される。
我々は,SWE-benchエージェントを制御点にフォークし,環境を再構築し,各フォークを異なるモデルで継続し,サンプリングと再生を分離する同モデル制御フォークと比較する。
論文 参考訳(メタデータ) (2026-08-08T17:07:11Z) - Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent [0.0]
アーキテクチャが検証ループをインストールする1つのプロダクションシステムについて検討する。
ループの端から端までを計測し、経験的検証器混同行列を生成する。
論文 参考訳(メタデータ) (2026-07-19T03:20:33Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering [70.99933391739154]
我々は、エージェントが既に持っている情報に対して繰り返し理由付けを行う2つの障害モードと、最近の観察を統合したり、新たな証拠を取得することなくツールコールを発行する2つの障害モードに焦点を当てる。
本稿では,活性化ステアリングによるTACT (Think-Act via activation Steering) を導入し,動作不良として現れる前に残留流中のエージェントの漂流を検知・緩和する。
具体的には、軌道のステップを過度に考え、過剰に実行し、あるいは校正し、隠れた状態が2つの *drift 軸* に沿って線形に分離できることを発見し、それぞれの障害モードに向かって校正された振る舞いを指示する。
論文 参考訳(メタデータ) (2026-05-07T10:24:27Z) - ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning [5.523132953818281]
本稿では,LLM推論のためのシステムであるReFlectについて述べる。
6つの推論領域にまたがる制御された実験により、100個の監査された反射ブロックのうち90個の問題にフラグを付けない、プロンプトレベルの自己批判が公式テンプレートを生成することが示された。
我々のReFlectハーネスは, GPT-4o-miniで41%, Claude Sonnet 4.5で56%のタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-05-07T06:29:34Z) - When Agents Disagree With Themselves: Measuring Behavioral Consistency in LLM-Based Agents [0.0]
ReActスタイルのエージェントは、同じ入力でも平均10回の実行毎に2.0--4.2の異なるアクションシーケンスを生成する。
一貫性のある動作を持つタスクは80-92%の精度を達成するが、一貫性のないタスクは25-60%しか達成しない。
この結果から,実行中の動作の整合性を監視することにより,早期のエラー検出とエージェント信頼性の向上が期待できることがわかった。
論文 参考訳(メタデータ) (2026-02-12T06:15:14Z) - When Domain Pretraining Interferes with Instruction Alignment: An Empirical Study of Adapter Merging in Medical LLMs [0.6345523830122167]
大規模言語モデルは、ドメイン適応と命令アライメントを組み合わせる際に驚くべきアダプタ干渉を示す。
医学LLMのための2段階のLORAパイプラインについて検討し、ドメイン指向事前トレーニング(PT)と教師付き微調整(SFT)を個別に訓練し、後にマージした。
論文 参考訳(メタデータ) (2026-01-26T10:54:06Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z) - Language Models are Super Mario: Absorbing Abilities from Homologous Models as a Free Lunch [72.97553348776425]
スーパーバイザード・ファインチューニング (SFT) LMの能力に影響を与えることなく、ほとんどのデルタパラメータを設定するためにDAREを導入する。
次に、DAREを汎用プラグインとして使用し、複数のSFTモデルのデルタパラメータを分散し、それらを単一のモデルにマージする。
また、DAREを使用して、Open Leaderboardで70億のパラメータを持つモデルの中で、第1位にランクインした統合LMを作成します。
論文 参考訳(メタデータ) (2023-11-06T13:43:07Z) - TIES-Merging: Resolving Interference When Merging Models [95.59265307318752]
転送学習は、ダウンストリーム性能の改善、収束の高速化、サンプル効率の向上など、大きな利点をもたらす可能性がある。
モデルマージは、追加のトレーニングを行うことなく、複数のタスク固有のモデルを単一のモデルに組み合わせるソリューションとして登場した。
既存のマージ手法は、しばしば異なるモデルのパラメータ間の干渉を無視し、複数のモデルのマージ時に大きなパフォーマンス低下を引き起こす。
本稿では,モデル統合における新たな3つのステップとして,微調整時に少量だけ変化したパラメータをリセットし,符号衝突を解消し,最終的な一致した符号に一致したパラメータのみをマージするTIES-Mergingを提案する。
論文 参考訳(メタデータ) (2023-06-02T17:31:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。