論文の概要: Learning What to Investigate Next: Meta-Reasoning for Long-Horizon Research Agents
- arxiv url: http://arxiv.org/abs/2610.02525v1
- Date: Thu, 01 Oct 2026 21:54:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.096722
- Title: Learning What to Investigate Next: Meta-Reasoning for Long-Horizon Research Agents
- Title(参考訳): 次に何を調査するかを学ぶ:長期研究エージェントのためのメタ推論
- Abstract要約: 反復研究エージェントのためのメタ推論について紹介する。
外部ループメタレゾナーは、永続的な研究記録からコンテキストをキュレートし、次の調査のために作業命令を書き、エピソードを終了する。
新たなインナーループエグゼキュータは、各作業順序を実行し、メタ推論アクション間の遷移の一部を実行する。
- 参考スコア(独自算出の注目度): 27.286448302878284
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon research agents must decide both how to investigate and what to investigate next as evidence accumulates. This is hard to learn because such decisions are sparse in long execution traces, and their consequences may emerge several investigations later. We introduce Meta-reasoning for Iterative Research Agents (MIRA), a hierarchical architecture separating research allocation from execution. An outer-loop meta-reasoner curates context from a persistent research record, then writes a work order for the next investigation or ends the episode. A fresh inner-loop executor carries out each work order, making execution part of the transition between meta-reasoning actions. Without policy training, MIRA improves long-horizon inference and allocates additional compute more effectively in theorem proving and open-ended neural-architecture research. Its decision boundaries also provide natural units for credit assignment. At each boundary, we train a generative critic to forecast expected remaining return from partial states, outperforming token-level alternatives. Cross-environment pretraining improves forecasting and adaptation, yielding a transferable prior for valuing partial progress. We use this prior to initialize MIRA-AC, a generative actor-critic jointly trained to forecast remaining return and choose the next investigation, without a separate critic model. MIRA-AC concentrates policy optimization on meta-reasoning decisions, enabling efficient long-horizon reinforcement learning without directly optimizing the longer execution traces they initiate. Training MIRA-AC on the model's own proxy hill-climbing signals improves gold performance across four autoresearch environments; the actor transfers with cross-environment value initialization. Together, these results show that meta-reasoning can be learned as an explicit policy for directing long-horizon autonomous research.
- Abstract(参考訳): ロングホライゾンの研究機関は、証拠が蓄積するにつれてどのように調査するか、次に何を調査するかを判断しなければならない。
このような決定は長い実行トレースでは不十分であり、その結果は後にいくつかの調査が行われる可能性があるため、これは理解が難しい。
本稿では,MIRA(Meta-reasoning for Iterative Research Agents)について紹介する。
外部ループメタレゾナーは、永続的な研究記録からコンテキストをキュレートし、次の調査のために作業命令を書き、エピソードを終了する。
新たなインナーループエグゼキュータは、各作業順序を実行し、メタ推論アクション間の遷移の一部を実行する。
ポリシートレーニングがなければ、MIRAは長期水平推論を改善し、定理証明やオープンエンドニューラルネットワーク研究において、さらなる計算をより効果的に割り当てる。
その決定境界はまた、クレジット割り当てのための自然な単位も提供する。
それぞれの境界において、生成的批評家に予測される部分的状態からの復帰を予測させ、トークンレベルの代替よりも優れた性能を発揮するよう訓練する。
クロス環境事前訓練は予測と適応を改善し、部分的な進歩を評価するために転送可能な事前を与える。
我々は、MIRA-ACを創発的アクター・批評家が共同で訓練し、残ったリターンを予測し、別の批評家モデルなしで次の調査を選択するために、この手法を前もって使用した。
MIRA-ACは、メタ推論決定にポリシー最適化を集中させ、開始する長い実行トレースを直接最適化することなく、効率的な長距離強化学習を可能にする。
MIRA-ACをモデル自身のプロキシヒルクライミング信号でトレーニングすることで、4つの自動検索環境におけるゴールドのパフォーマンスが向上する。
これらの結果から, メタ推論は, 長期自律研究を導くための明確な政策として学べることが示唆された。
関連論文リスト
- MOAE: Multi-Objective Agent Evolution with Pareto-Preserving Search [5.257073134713488]
多目的エージェント進化(Multi-Objective Agent Evolution)は、完全エージェントロールアウト上のパレート保存進化探索として反復的インコンテキスト洗練を組織する。
この結果から,MOAE はタスク性能と軌道品質を安定的に向上すると同時に,適合したロールアウト予算下での安全性を維持していることがわかった。
論文 参考訳(メタデータ) (2026-09-05T09:31:34Z) - Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning [82.3676770818744]
大型言語モデル(LLM)を"Connect the Dots"(CoD)に接続するためのフレームワークを提案する。
LLMベースのAIエージェントが環境にデプロイされると、環境を継続的に探索しながら、タスクの長いシーケンスを解決する。
本稿では,詳細な信用代入を伴うGRPOスタイルのRLアルゴリズムを含む,CoDフレームワークの概念実証実装を提案する。
論文 参考訳(メタデータ) (2026-06-18T09:38:45Z) - RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards [76.17893114021757]
長い形式のレポートを計画し、調査し、エビデンスを評価し、合成する深層研究システムには、根本的な答えがなく、多くのツール強化された決定にまたがる。
本研究では,ルーブリックは最終回答評価者だけでなく,ポリシーの実行,判断フィードバック,エージェントメモリを構成する共有インターフェースとして機能すべきである,と論じる。
我々は、段階的な政策分解とリフレクションに基づくメタ政治進化を組み合わせたルーリック誘導強化学習フレームワークEMを導入する。
論文 参考訳(メタデータ) (2026-05-11T17:40:38Z) - Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization [14.566152113959555]
既存の手法の鍵となる制限は、通常、未分化の探査戦略を採用することである。
本研究では,LLMエージェントが不確実性が高い場合にのみ適応的に探索できる探索対応強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-09T14:44:18Z) - RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents [144.5598958575922]
Re-TRACはクロス軌道探索を行うエージェントフレームワークである。
Re-TRAC は BrowseComp とフロンティア LLM で連続して ReAct を 15-20% 上回っていることを示す。
論文 参考訳(メタデータ) (2026-02-02T18:58:07Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - IterResearch: Rethinking Long-Horizon Agents via Markovian State Reconstruction [107.49922328855025]
IterResearchは、マルコフ決定過程として長期研究を再構築する、新しい反復的深層研究パラダイムである。
6つのベンチマークで平均+14.5ppの既存のオープンソースエージェントよりも大幅に改善されている。
これは効果的なプロンプト戦略として機能し、ロングホライゾンタスクにおけるReActよりも19.2ppのフロンティアモデルを改善する。
論文 参考訳(メタデータ) (2025-11-10T17:30:08Z) - ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning [53.817538122688944]
Reinforced Meta-thinking Agents (ReMA) を導入し,Large Language Models (LLMs) の推論からメタ思考行動を求める。
ReMAは、推論プロセスを2つの階層的なエージェントに分解する。戦略上の監視と計画を生成するハイレベルなメタ思考エージェントと、詳細な実行のための低レベルな推論エージェントである。
単ターン実験による実験結果から、ReMAは複雑な推論タスクにおいて単エージェントRLベースラインよりも優れることが示された。
論文 参考訳(メタデータ) (2025-03-12T16:05:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。