論文の概要: What is Missing from AI Post-Training AI: An Empirical Analysis
- arxiv url: http://arxiv.org/abs/2608.19072v1
- Date: Wed, 19 Aug 2026 16:17:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.458971
- Title: What is Missing from AI Post-Training AI: An Empirical Analysis
- Title(参考訳): AIのポストトレーニングAIに欠けていること:実証分析
- Abstract要約: この図は実行レベル能力と戦略レベル能力という2つの異なる能力を混在させています。
エージェントのトレーニング戦略は、さまざまなタスクにおいて、最初からロックインされていることが分かりました。
次に,欠席経験,指導の欠如,推論の不十分な3つの自然な説明と介入のエスカレートについて検討した。
- 参考スコア(独自算出の注目度): 74.56398070411755
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents can now post-train an LLM end-to-end. They can write code, launch training, evaluate checkpoints, and improve downstream performance, raising the prospect of AI-for-AI. We argue that this picture conflates two distinct capabilities: execution-level capability, iterating within a selected training strategy; and strategy-level capability, revising the high-level judgment as experimental evidence accumulates. Analyzing a large corpus of publicly released post-training trajectories, we find that across different tasks, the agent's training strategy is locked in at the very beginning, and the entire remaining budget is spent on local adjustments within the selected strategy. We then examine three natural explanations--missing experience, missing guidance, and insufficient reasoning--with escalating interventions. Extensive experiments show that (1) an experience-driven scaffold improves execution across the board (+12.6 points on GSM8K and +40.8 on HumanEval) but leaves the strategy static; (2) human guidance effectively redirects the initial strategy, yet the agent falls back into local adjustment loops once training starts; and (3) additional inference compute pays off on easier tasks but yields almost no gain on the hardest one. In conclusion, what agents lack is neither experience, guidance, nor reasoning compute, but a mechanism for spontaneously reevaluating their strategy during execution.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、LLMのエンドツーエンドをポストトレーニングすることができる。
コードを書き、トレーニングをローンチし、チェックポイントを評価し、ダウンストリームのパフォーマンスを改善し、AIのためのAIの見通しを高めることができる。
この図は、実行レベル能力、選択したトレーニング戦略内で反復する能力、そして、実験的な証拠が蓄積されるにつれて、高いレベルの判断を改訂する戦略レベル能力の2つの特徴を混同している、と我々は主張する。
公開後軌道の大規模コーパスを解析した結果,エージェントの訓練戦略は開始時点でロックインされ,残りの予算は選択した戦略内の局所的な調整に費やされていることがわかった。
次に,欠席経験,指導の欠如,推論の不十分な3つの自然な説明と介入のエスカレートについて検討した。
総合的な実験の結果,(1)体験駆動足場はボード全体の実行を改善する(GSM8K+12.6点,+40.8点,HumanEval+40.8点)。
結論として、エージェントに欠けているのは、経験、ガイダンス、推論計算ではなく、実行中の戦略を自発的に再評価するメカニズムである。
関連論文リスト
- FML-bench: A Controlled Study of AI Research Agent Strategies from the Perspective of Search Dynamics [24.125726163497742]
FML-Benchは10ドメインにわたる18の基本的なML研究タスクのベンチマークである。
エージェント戦略と実行インフラストラクチャを分離し、12のプロセスレベルの行動メトリクスを定義する。
機会が密集している場合には欲求探索がより効果的になる傾向にあり、機会が不足している場合には、木探索と進化戦略がより効果的になる傾向にある。
論文 参考訳(メタデータ) (2026-05-17T10:30:38Z) - From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning [5.703029996279753]
現在のポストトレーニング手法は、人間が実際にどのように問題を解決するかと一致しない。
本研究では,2段階の認知過程を明示的に反映した認知に着想を得た枠組みを提案する。
論文 参考訳(メタデータ) (2026-01-29T16:00:48Z) - Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals [0.0]
教師なし事前学習は、強化学習エージェントに事前知識を付与し、下流タスクでの学習を加速することができる。
本稿では,文脈内学習者と対向目標生成戦略を組み合わせた教師なしメタ学習手法ULEEを提案する。
論文 参考訳(メタデータ) (2026-01-27T17:10:29Z) - On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models [73.10315509190623]
最近の強化学習技術は、言語モデルにおいて顕著な推論改善をもたらした。
ポストトレーニングが、事前トレーニング中に取得したものを超えて、モデルの推論能力を真に拡張するかどうかは不明だ。
プレトレーニング,ミッドトレーニング,およびRLベースのポストトレーニングの因果的貢献を分離する,完全に制御された実験フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-08T18:12:10Z) - COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context [17.575806280348797]
小さなエラーはステップにまたがって複雑で、最先端のモデルでさえしばしばコヒーレンスを幻覚または失う。
本稿では,戦術的実行,戦略的監視,文脈的組織を3つの特殊コンポーネントに分離する軽量階層型フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-09T20:14:26Z) - Agent Learning via Early Experience [93.83579011718858]
言語エージェントの長期的な目標は、彼ら自身の経験から学び、改善することであり、最終的には複雑な現実世界のタスクにおいて人間より優れています。
現在のエージェントのほとんどは、専門家データによる教師付き微調整に依存しており、スケールと一般化が不十分である。
本研究では,(1)環境力学における政策の基盤として収集された状態を利用するインプリシット・ワールド・モデリング,(2)エージェントが最適な行動から学習し,推論と意思決定を改善するための自己回帰という2つの手法について検討する。
論文 参考訳(メタデータ) (2025-10-09T17:59:17Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy [47.42940885853956]
A$3$TはAutonomousを実現するフレームワークである。
法律の様式における代理人軌道の
AlfWorldでは、A$3$Tで訓練されたエージェントが1発成功率96%、100%成功率4回を達成している。
論文 参考訳(メタデータ) (2024-03-21T17:43:44Z) - Hierarchical Decomposition of Prompt-Based Continual Learning:
Rethinking Obscured Sub-optimality [55.88910947643436]
大量のラベルのないデータを実際に扱うためには、自己教師付き事前トレーニングが不可欠である。
HiDe-Promptは、タスク固有のプロンプトと統計のアンサンブルで階層的なコンポーネントを明示的に最適化する革新的なアプローチである。
実験では,HiDe-Promptの優れた性能と,継続学習における事前学習パラダイムへの頑健さを実証した。
論文 参考訳(メタデータ) (2023-10-11T06:51:46Z) - Coach-assisted Multi-Agent Reinforcement Learning Framework for
Unexpected Crashed Agents [120.91291581594773]
本稿では,予期せぬクラッシュを伴う協調型マルチエージェント強化学習システムの公式な定式化について述べる。
本稿では,教師支援型多エージェント強化学習フレームワークを提案する。
私たちの知る限りでは、この研究はマルチエージェントシステムにおける予期せぬクラッシュを初めて研究したものです。
論文 参考訳(メタデータ) (2022-03-16T08:22:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。