論文の概要: Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use
- arxiv url: http://arxiv.org/abs/2607.01084v1
- Date: Wed, 01 Jul 2026 15:40:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.968587
- Title: Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use
- Title(参考訳): エージェントはオープンワールドに一般化できるか? ツール使用における静的トレーニングの脆弱性
- Authors: Song-Lin Lv, Weiming Wu, Rui Zhu, Zi-Jian Cheng, Lan-Zhe Guo,
- Abstract要約: 我々は、クエリ、アクション、観察、ドメイン次元の分散シフトを特徴とするOpenAgentを定式化した。
分析の結果, エージェントがスーパーバイザード・ファイン・チューニング(SFT)と強化学習(Reinforcement Learning)の両方で訓練された場合, 性能劣化の程度が異なることが判明した。
本研究では,実環境におけるエージェントの堅牢性向上と実用性向上の基盤となる,SFTの妨害に基づく介入戦略であるPerturbation-Augmented Fine-Tuningを提案する。
- 参考スコア(独自算出の注目度): 14.813603277906623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Large Language Model (LLM) agents demonstrate proficiency in static benchmarks, their deployment in real-world scenarios is hindered by the dynamic nature of user queries, tool sets, and interaction dynamics. To address this generalization gap, we formalize OpenAgent (Tool-Use Agent in Open-World), a problem setting characterized by distributional shifts across query, action, observation, and domain dimensions. To systematically diagnose its impact, we construct a controlled sandbox environment where we define fine-grained environmental shifts across a four-tier hierarchy, Perception, Interaction, Reasoning, and Internalization, and conduct a comprehensive series of experiments. Our analysis yields a series of key insights, demonstrating that agents trained via both Supervised Fine-Tuning(SFT) and Reinforcement Learning suffer from varying degrees of performance degradation when confronting open environmental shifts. Building on these insights, we propose Perturbation-Augmented Fine-Tuning, a disturbance-based intervention strategy for SFT that lays the foundation for enhancing agent robustness and utility in realistic environments. Our code will be released at: https://github. com/LAMDA-NeSy/OpenAgent.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは静的ベンチマークで習熟度を示すが、実際のシナリオへの展開は、ユーザクエリやツールセット、インタラクションダイナミクスの動的な性質によって妨げられている。
この一般化ギャップに対処するため,OpenAgent (Tool-Use Agent in Open-World) を定式化した。
我々は,その影響を体系的に診断するために,4階層階層(知覚,相互作用,推論,内部化)にわたるきめ細かい環境変化を定義し,総合的な実験を行う制御サンドボックス環境を構築した。
本分析は, 環境変化に直面すると, エージェントが各種の性能劣化に悩まされることを実証する。
これらの知見に基づいて,現実的な環境におけるエージェントの堅牢性と有用性を高める基盤となる,SFTの妨害に基づく介入戦略であるPerturbation-Augmented Fine-Tuningを提案する。
私たちのコードは次の通りリリースされます。
OpenAgent.com/LAMDA-NeSy/OpenAgent.com
関連論文リスト
- Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments [68.02342920827135]
エージェント学習プロセスに環境欠陥を明示的に組み込んだエージェント学習フレームワークであるNoisyAgentを提案する。
実世界のシナリオでは,ユーザインタラクションにおけるあいまいさと可変性を捉えるユーザノイズと,ツール実行における障害や異常を反映するツールノイズという,2つの主要なインタラクションノイズ源を識別する。
広汎な実験により,本手法は騒音および動的環境下でのエージェントの堅牢性を常に改善することを示した。
論文 参考訳(メタデータ) (2026-05-26T16:02:00Z) - AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions [78.49000936275773]
我々は、一般的な汚職下でのコンピュータ利用エージェントの堅牢性を評価するために設計されたベンチマークであるAgentHijackを紹介する。
MLLMをベースとした各種デスクトップタスクを評価し, 汚職の小さな事例であっても, 大幅な性能劣化が生じることを確認した。
本稿では,動作の要約と環境チェックに責任を負う見物人として,アクションジェネレータと接地機能を統合したフレームワークであるAgent Hijack-Agentを提案する。
論文 参考訳(メタデータ) (2026-05-25T11:09:22Z) - IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools [23.270402833986605]
IndusAgentはオープン語彙異常検出のためのツール拡張エージェントフレームワークである。
IndusAgentは既存のすべての手法の中で最先端のゼロショット性能を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-20T03:52:21Z) - Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics [16.09809323840653]
オフラインでトレーニングされた世界モデルは、動的に変化するにつれて、よく分布するが劣化するが、発見に基づくエージェントは、より堅牢であることを示す。
企業環境では、エージェントは固定された内部化ダイナミクスのみに頼るのではなく、実行時に関連するトランジションロジックを発見するメカニズムを組み込むことを示唆している。
論文 参考訳(メタデータ) (2026-05-12T14:22:10Z) - AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition [72.24180896265192]
本稿では,騒音環境下でのエージェントモデルのロバスト性を評価するためのフレームワークであるAgentNoiseBenchを紹介する。
まず、実世界のシナリオにおけるバイアスと不確実性の詳細な分析を行う。
次に,環境騒音をユーザノイズとツールノイズの2つの主要なタイプに分類する。
この分析に基づいて,既存のエージェント中心ベンチマークに制御可能なノイズを注入する自動パイプラインを開発した。
論文 参考訳(メタデータ) (2026-02-11T20:33:10Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - CuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RL [35.086788669916594]
大規模言語モデルベースのエージェントは、複雑なツール拡張環境にますますデプロイされている。
既存のアプローチは通常、新しい環境で失敗する前提である事前定義されたタスクコレクションを仮定する。
そこで我々はCuESを提案する。CuESはキュリオシティ駆動環境基盤合成フレームワークで、多様で実行可能で有意義なタスクを自律的に生成する。
論文 参考訳(メタデータ) (2025-12-01T06:11:37Z) - Agent-Environment Alignment via Automated Interface Generation [10.469261669159367]
大言語モデル(LLM)エージェントは、対話的な意思決定タスクにおいて印象的な推論能力を示している。
エージェントの内部の期待と、発行されたアクションの影響と、環境における実際の状態遷移との間には、しばしばミスマッチが発生します。
我々は,環境の静的情報とエージェントに返されるステップワイズ観測の両方を強化するインタフェースであるtextbfALIGNを提案する。
論文 参考訳(メタデータ) (2025-05-27T11:44:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。