論文の概要: RSI-Master: Structuring Experiments to Guide Autonomous Model Improvement
- arxiv url: http://arxiv.org/abs/2609.35561v1
- Date: Mon, 28 Sep 2026 16:28:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.073208
- Title: RSI-Master: Structuring Experiments to Guide Autonomous Model Improvement
- Title(参考訳): RSI-Master: 自律的なモデル改善をガイドするための構造化実験
- Abstract要約: 再帰的自己改善(RSI)は、AIシステムが自身の能力向上に参加することを可能にする。
この設定は2つの課題に直面している。エージェントはハッキングを通じてオープンな実験行動を利用することができ、反復的な実験は戦略のロックインにつながる可能性がある。
ステップワイズ動作の正規化,ハッキング行為の回避,研究方向の構造化探索の促進という,2つの課題に対処するRSI-Masterを紹介した。
- 参考スコア(独自算出の注目度): 45.085860726821245
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recursive self-improvement (RSI) seeks to enable AI systems to participate in improving their own capabilities. A concrete pathway is autonomous model development, where agents iteratively explore post-training strategies to improve a base model. This setting faces two challenges: agents may exploit open-ended experimental actions through hacking, and repeated experimentation may lead to strategy lock-in, where an early direction is refined rather than reconsidered. We introduce RSI-Master, which addresses the two challenges at two levels: regularize step-wise actions, avoiding hacking behaviors, and promote well-structured exploration of research directions, avoiding strategy lock-in. RSI-Master consists of an Experiment OS, which enables regularized experimental actions and maintains persistent, traceable experimental records, and Reviewer-Guided Research Orchestration, which organizes Workers and Reviewers in a dynamically growing research DAG. Workers explore diverse research directions and Reviewers compare evidence across related experiments for subsequent explorations. On PostTrainBench with Qwen3-4B-Base, it averages 54.49 versus 46.53 for the strongest agent baseline, with a 0.0\% hacking rate. Scaling to 35B model, RSI-Master surpasses the human-developed Instruct model on LiveCodeBench-v6 (41.21 vs. 37.36) and SciCode, and reaches a nonzero score on HorizonMath, a benchmark of unsolved research problems on which most frontier models score near zero.
- Abstract(参考訳): 再帰的自己改善(RSI)は、AIシステムが自身の能力向上に参加することを可能にする。
具体的な経路は自律的なモデル開発であり、エージェントはベースモデルを改善するためのトレーニング後の戦略を反復的に探求する。
この設定は2つの課題に直面している: エージェントはハッキングを通じてオープンな実験行動を利用することができ、繰り返しの実験は戦略ロックインにつながる可能性がある。
ステップワイズ動作の正規化,ハッキング行為の回避,研究方向の構造化探索の促進,戦略ロックインの回避という2つのレベルに対処するRSI-Masterを紹介した。
RSI-Masterは、定期的な実験行動を可能とし、永続的でトレース可能な実験記録を維持できるExperiment OSと、動的に成長する研究DAGで労働者とレビュアーを組織するReviewer-Guided Research Orchestrationで構成されている。
労働者は多様な研究方向を探索し、審査員はその後の調査のために関連する実験で証拠を比較する。
ポストトレインベンチとQwen3-4Bベースでは、最強のエージェントベースラインでは54.49対46.53で、ハッキング率は0.0\%である。
35Bモデルにスケールすると、RSI-MasterはLiveCodeBench-v6 (41.21 vs. 37.36) とSciCodeで人間が開発したインストラクトモデルを超え、HorizonMathでゼロスコアに達した。
関連論文リスト
- Deep Research as Rubric for Reinforcement Learning [35.642522713903794]
オープンエンドのルーブリックを構築するための2段階のフレームワークを提案する。
DR-rubric-8Bはフロンティアモデルなしでブートストラップ生成をサポートする。
実験によると、DR-rubricは1K -- 3Kのトレーニングインスタンスで強力な競争性能を達成する。
論文 参考訳(メタデータ) (2026-05-31T08:25:04Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget [48.98166525828929]
Exploration-Enhanced Policy Optimization (EEPO)は、適応的アンラーニングを伴う2段階のロールアウトによる探索を促進するフレームワークである。
EEPOは5つの推論ベンチマークでGRPOを上回っ、Qwen2.5-3Bで24.3%、Llama3.2-3B-Instructで33.0%、Qwen3-8B-Baseで10.4%という平均的な相対的な上昇を達成した。
論文 参考訳(メタデータ) (2025-10-07T12:02:03Z) - Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning [46.610146536866445]
大規模言語モデル(LLM)は、推論能力の出現を促進するために強化学習(RL)の可能性を強調している。
本稿では,一般的な推論のための探索ボトルネックを解消するために,Scaffolded Reinforcement Learning (RuscaRL)を提案する。
我々は、RuscaRLがQwen2.5-7B-InstructをHealthBench-500で23.6から50.3に大幅に向上し、GPT-4.1を上回っていることを示した。
論文 参考訳(メタデータ) (2025-08-23T08:47:31Z) - ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context [66.15505423059234]
ASTROは,検索アルゴリズムのような推論のために,言語モデルをトレーニングするためのフレームワークである。
ASTROをLlama 3モデルのモデルに適用し,MATH-500では16.4%,AMC 2023では26.9%,AIME 2024では20.0%,絶対的な性能向上を達成した。
論文 参考訳(メタデータ) (2025-07-01T04:10:15Z) - ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning [78.42927884000673]
ExACTは、エージェントアプリケーションのためのo1のようなモデルを構築するために、テスト時間検索と自己学習を組み合わせるアプローチである。
リフレクティブモンテカルロ木探索(Reflective Monte Carlo Tree Search, R-MCTS)は、AIエージェントがその場で意思決定空間を探索する能力を高めるために設計された新しいテストタイムアルゴリズムである。
次に,探索学習(Exploratory Learning)という,外部探索アルゴリズムに頼らずに,エージェントに推論時間での探索を教える新しい学習戦略を紹介する。
論文 参考訳(メタデータ) (2024-10-02T21:42:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。