論文の概要: RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
- arxiv url: http://arxiv.org/abs/2609.15364v2
- Date: Fri, 18 Sep 2026 21:46:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:28:59.805212
- Title: RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
- Title(参考訳): RSIAgent:新しい環境における再帰的自己改善のための自律的な探索
- Abstract要約: 自己改善のためのトレーニング不要なマルチエージェントフレームワークである textbfRSIAgent を紹介する。
RSIAgentは、環境を継続的に探索するためにカリキュラム、アクター、検証エージェントをコーディネートする。
結果のメモリは凍結され、モデルパラメータを更新することなく、ダウンストリームタスクのために直接再利用できる。
- 参考スコア(独自算出の注目度): 34.99497452417199
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Digital agents must often adapt to new environments whose interfaces, tools, and failure modes are not fully captured by pretrained models. We introduce \textbf{RSIAgent}, a training-free multi-agent framework for recursive self-improvement through autonomous memory construction. RSIAgent coordinates curriculum, actor, and verifier agents to continually explore the environment, validate outcomes, and retain environment-specific knowledge, including reusable causal relationships between actions, conditions, and consequences. It further adopts a \textbf{broad-then-deep} exploration strategy, combining parallel broad recursive self-exploration for discovering diverse environment structures with focused deep self-exploration for uncovering hard cases, hidden constraints, boundary conditions, and previously unknown causal dependencies. The resulting memory is frozen and can be directly reused for downstream tasks without updating model parameters. Experiments on OSWorld-v2 and Agent's Last Exam show that RSIAgent substantially improves strong open-source models, enabling Kimi-K3 and GLM-5.3 to outperform frontier closed-source models including GPT-6.
- Abstract(参考訳): デジタルエージェントは、インターフェース、ツール、障害モードが事前訓練されたモデルによって完全にキャプチャされない新しい環境に適応する必要がある。
本稿では,自動メモリ構築による再帰的自己改善のためのトレーニング不要なマルチエージェントフレームワークである「textbf{RSIAgent}」を紹介する。
RSIAgentはカリキュラム、アクター、検証エージェントをコーディネートし、環境を継続的に探索し、結果を検証し、行動、条件、結果の間の再利用可能な因果関係を含む環境固有の知識を保持する。
さらに、さまざまな環境構造を発見するために並列に広範に再帰的な自己探索と、ハードケースの発見、隠された制約、境界条件、そしてこれまで未知の因果関係の発見に焦点をあてた自己探索を組み合わせた、‘textbf{broad-then-deep} 探索戦略も採用している。
結果のメモリは凍結され、モデルパラメータを更新することなく、ダウンストリームタスクのために直接再利用できる。
OSWorld-v2 と Agent's Last Exam の実験では、RSIAgent は強力なオープンソースモデルを大幅に改善し、Kimi-K3 と GLM-5.3 は GPT-6 を含むフロンティアクローズソースモデルより優れていた。
関連論文リスト
- ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use [14.813603277906623]
我々は、クエリ、アクション、観察、ドメイン次元の分散シフトを特徴とするOpenAgentを定式化した。
分析の結果, エージェントがスーパーバイザード・ファイン・チューニング(SFT)と強化学習(Reinforcement Learning)の両方で訓練された場合, 性能劣化の程度が異なることが判明した。
本研究では,実環境におけるエージェントの堅牢性向上と実用性向上の基盤となる,SFTの妨害に基づく介入戦略であるPerturbation-Augmented Fine-Tuningを提案する。
論文 参考訳(メタデータ) (2026-07-01T15:40:25Z) - APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents [54.213455157510445]
自己進化型エージェントは、モデルウェイト更新を必要とせず、エピソード間でメモリとリフレクションを蓄積することによって学習する。
メモリが大きくなるにつれて、行動は慣れ親しんだハイリワードルーチンに集中し、より良い選択肢を発見する機会を減らす。
戦略マップを通じて明確な戦略空間を構築し維持する自律的政策展開(APEX)を提案する。
論文 参考訳(メタデータ) (2026-05-20T14:29:27Z) - PECMAN: Perception-enabled Collaborative Multi-Agent Navigation in Unknown Environments [0.6372261626436676]
我々はSMART-3Dを未知の環境で認識可能な協調マルチエージェントナビゲーション(PECMAN)に拡張する。
PECMANは、各エージェントが環境変化に反応し、それぞれのツリーを変形して、その経路を計画する、分散ツリーモルファスと共有認識戦略に基づいて構築される。
PECMANはチーム補完時間を最大52%削減し、100%近い成功率を維持している。
論文 参考訳(メタデータ) (2026-05-10T05:44:48Z) - Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL [0.8546394944138487]
我々は、テキストベースの世界モデリングを、初期状態に分解可能な遷移力学問題として定式化する。
我々は、9つのオープンソース環境と12のフロンティアモデルファミリーにまたがる239,403の基底状態行動軌跡をキュレートする。
我々は,決定論的状態チェックを備えたGRPOトレーニングフレームワークを導入し,3つのOOD環境上でゼロショット転送処理を行う。
論文 参考訳(メタデータ) (2026-05-07T00:40:32Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting [92.57796055887995]
本稿では,言語モデルエージェントの強化学習から後視体験のリプレイに適応するプロンプトフレームワークECHOを紹介する。
ECHOは失敗した試みで達成できた代替目標のために最適化された軌道を生成する。
我々は、テキストベースのナビゲーションと計画ベンチマークであるXMiniGridのステートフルバージョンと、協調的な情報収集企業シミュレーションであるPeopleJoinQAについて、ECHOを評価した。
論文 参考訳(メタデータ) (2025-10-11T18:11:09Z) - ARE: Scaling Up Agent Environments and Evaluations [22.98982051873728]
本稿では,スケーラブルな環境構築のための研究プラットフォームであるMeta Agents Research Environments (ARE)を紹介する。
AREは、複雑で多様な環境を構築するための単純な抽象化を提供する。
また、AREで構築され、汎用エージェント能力を測定するために設計されたベンチマークであるGaia2を提案する。
論文 参考訳(メタデータ) (2025-09-21T16:59:45Z) - Online Robust Multi-Agent Reinforcement Learning under Model Uncertainties [10.054572105379425]
十分に訓練されたマルチエージェントシステムは、実環境にデプロイされた時にフェールする可能性がある。
DRMGは、定義された環境不確実性のセットに対して最悪のケースパフォーマンスを最適化することで、システムのレジリエンスを高める。
本稿では、DRMGにおけるオンライン学習の先駆者であり、エージェントは事前データなしで環境相互作用から直接学習する。
論文 参考訳(メタデータ) (2025-08-04T23:14:32Z) - No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery [53.08822154199948]
非教師なし環境設計(UED)手法は、エージェントがイン・オブ・アウト・ディストリビューションタスクに対して堅牢になることを約束する適応的カリキュラムとして近年注目を集めている。
本研究は,既存のUEDメソッドがいかにトレーニング環境を選択するかを検討する。
本研究では,学習性の高いシナリオを直接訓練する手法を開発した。
論文 参考訳(メタデータ) (2024-08-27T14:31:54Z) - Attribute-Guided Adversarial Training for Robustness to Natural
Perturbations [64.35805267250682]
本稿では,属性空間への分類器の露出を最大化するために,新しいサンプルを生成することを学習する逆学習手法を提案する。
我々のアプローチは、ディープニューラルネットワークが自然に発生する摂動に対して堅牢であることを可能にする。
論文 参考訳(メタデータ) (2020-12-03T10:17:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。