論文の概要: Shockingly Simple Self-retrospection Improves Agentic Models Without RL
- arxiv url: http://arxiv.org/abs/2609.35741v1
- Date: Mon, 28 Sep 2026 17:54:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 19:17:14.887985
- Title: Shockingly Simple Self-retrospection Improves Agentic Models Without RL
- Title(参考訳): RLを使わずにエージェントモデルを改善する衝撃的単純自己検査法
- Abstract要約: 本研究は,説明のみの訓練がその後の行動に与える影響を分離するために,レトロスペクティブ・オンリー・ファインチューニングについて検討する。
Qwen3.5-4B を用いたソフトウェア工学実験では、ROFT は成功と失敗の混合したベースモデルの試行に関する問題で訓練されている。
また、64のサンプルベースモデル試みが失敗する個々のタスクの解決も学べる。
- 参考スコア(独自算出の注目度): 56.88703385147974
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: People learn not only by repeating successful actions, but also by recounting and explaining their experiences, revising their understanding to guide future behavior. Can a language-model agent improve its future actions by training only on explanations of its own experience? We investigate this question by studying Retrospection-Only Fine-Tuning (ROFT), a minimal online procedure designed to isolate the effect of explanation-only training on subsequent behavior. The agent attempts a task, observes available feedback, generates a retrospective explanation, and is fine-tuned with a next-token prediction loss on the explanation tokens alone. The procedure uses neither an external teacher nor a reward-based policy update. In software-engineering experiments with Qwen3.5-4B, ROFT is trained on problems with mixed successful and unsuccessful base-model attempts. On held-out SWE-bench Verified and Pro, it reaches 49.2% and 26.8% solve rates after 20 updates without using a verifier, compared with GRPO's 48.0% and 25.3% after 40 updates in the evaluated runs, and makes faster early progress in training time and sampled attempts. It also learns to solve individual tasks on which all 64 sampled base-model attempts failed, showing that learning can begin without any initially successful trajectories. Behavioral analyses find that ROFT indirectly assigns credit to actions, encouraging good actions and discouraging incorrect ones. Moreover, prompting retrospections to emphasize more direct solutions yields shorter subsequent attempts even without an explicit length penalty. Together, these findings show that learning to explain can also improve learning to do, establishing self-generated retrospections as useful training targets and motivating further study of explanation-to-action transfer.
- Abstract(参考訳): 人々は、成功した行動を繰り返すだけでなく、自分の経験を振り返り、説明し、将来の行動を導くための理解を再考することで学ぶ。
言語モデルエージェントは、自身の経験を説明するだけで訓練することで、将来の行動を改善することができるのか?
本稿では,説明のみのトレーニングがその後の行動に与える影響を分離するための最小限のオンライン手順であるレトロスペクティブ・オン・ファインチューニング(ROFT)について検討する。
エージェントはタスクを試み、利用可能なフィードバックを観察し、ふりかえりの説明を生成し、説明トークンだけで次のトーケン予測損失で微調整される。
この手順では、外部の教師も報酬ベースのポリシー更新も使用しない。
Qwen3.5-4B を用いたソフトウェア工学実験では、ROFT は成功と失敗の混合したベースモデルの試行に関する問題で訓練されている。
ホールドアウトされたSWE-bench Verified and Proでは、検証器を使わずに20回の更新で49.2%、26.8%の解決率に達し、評価された40回の更新でGRPOの48.0%、25.3%と評価された。
また、64のサンプルベースモデル試みが失敗する個々のタスクの解決も学べる。
行動分析により、ROFTは間接的に行動に信用を割り当て、良い行動を奨励し、誤った行為を阻止する。
さらに、より直接的な解を強調するようふりかえりを促せば、明示的な長さのペナルティがなくても、短い試行が得られる。
これらの結果から,自己生成的振り返りを有用なトレーニングターゲットとして確立し,説明から行動への伝達のさらなる研究を動機づけることによって,説明への学習も改善できることが示唆された。
関連論文リスト
- VRL-Bench: Benchmarking agents on computer control tasks under finite trial budgets [15.535835926612988]
リフレクションは言語強化学習を導入し、失敗した試行を後の試みを導くテキストに変えた。
有限の試行予算下での試行錯誤学習の公平な評価のためのハーネスであるVRL-Benchを紹介する。
論文 参考訳(メタデータ) (2026-09-11T03:54:02Z) - Reflective Recovery: A Self-Supervised Method for Reasoning by Learning from Mistakes [70.64622557376505]
リフレクティブリカバリは、推論中のミスを認識し、修正するようにモデルに教える。
AIME 2025では30.0%から37.5%、Minervaでは37.6%から47.8%に精度が向上している。
論文 参考訳(メタデータ) (2026-07-24T02:51:42Z) - Reinforcement Learning via Self-Distillation [37.078107691613155]
大規模言語モデルは、コードや数学などの検証可能な領域で強化学習を施して、ポストトレーニングされている。
検証可能な報酬(RLVR)を用いた強化学習の現在の手法は、試みごとにスカラーな結果報酬からのみ学習し、深刻な信用割り当てボトルネックを生み出す。
我々は、この設定をリッチフィードバックによる強化学習として定式化し、自己蒸留政策最適化(SDPO)を導入する。
SDPOは、トークン化されたフィードバックを、外部教師や明示的な報酬モデルなしで、密集した学習信号に変換する。
論文 参考訳(メタデータ) (2026-01-28T17:45:12Z) - Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations [103.16279860448874]
新たな二分探索強化報酬(RAR)を用いたオンライン強化学習手法を提案する。
オープンエンド世代では、バイナリRARは幻覚率を39.3%減少させる。
短い形式の質問応答では、モデルは、パラメトリック知識の不足に直面した時に、戦略的に"I don't know"を出力して、控えめに学習する。
論文 参考訳(メタデータ) (2025-10-20T16:45:43Z) - Exploring Expert Failures Improves LLM Agent Tuning [74.0772570556016]
本稿では,失敗した専門家の軌道から有益な行動を識別する専門的失敗の探索(EEF)を提案する。
EEFは、未解決のいくつかのサブタスクをうまく解決し、エージェントチューニング性能を改善する。
論文 参考訳(メタデータ) (2025-04-17T17:53:54Z) - Learning from Failures in Multi-Attempt Reinforcement Learning [35.7935476159768]
実験結果から,多目的タスクで訓練された小さなLLMであっても,より多くの試行で評価すると,精度が著しく向上することがわかった。
その結果,従来のシングルターンタスクと比較して,マルチタスクタスクで訓練されたLLMは,数学ベンチマークで若干性能が向上していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T02:53:39Z) - Solving Offline Reinforcement Learning with Decision Tree Regression [0.0]
本研究は, オフライン強化学習問題に対して, 回帰タスクとして再検討することで, 新たなアプローチを提案する。
我々は、リターン条件付きとリターン重み付き決定ツリーポリシーの2つの異なるフレームワークを紹介します。
オフラインRLに対するこの改定されたアプローチに固有の単純化にもかかわらず、我々のエージェントは、少なくとも確立された手法と同等の性能を示す。
論文 参考訳(メタデータ) (2024-01-21T23:50:46Z) - PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via
Relabeling Experience and Unsupervised Pre-training [94.87393610927812]
我々は、フィードバックと非政治学習の両方の長所を生かした、非政治的、インタラクティブな強化学習アルゴリズムを提案する。
提案手法は,従来ヒト・イン・ザ・ループ法で検討されていたよりも複雑度の高いタスクを学習可能であることを実証する。
論文 参考訳(メタデータ) (2021-06-09T14:10:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。