論文の概要: MetaRSI / RSI2: A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves
- arxiv url: http://arxiv.org/abs/2609.06396v2
- Date: Wed, 09 Sep 2026 11:06:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.2469
- Title: MetaRSI / RSI2: A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves
- Title(参考訳): MetaRSI / RSI2:再帰的自己改善システムのためのメタ再帰的自己改善システム
- Authors: Zihan Tan, Leixin Sun, Zitong Shi, Yitao Liu, Jiajun Wu, Nathaniel Brooks, Jiaru Qian, Xiaoran Shang, Suyuan Huang, Yi Ding, Yangxu Liao, Mukai Li, Qiushi Sun, Shudong Liu, Xuankun Rong, Xiaohang Yu, Zhuo Chen, Hejia Geng, Chenxin Li, Aozhou Wang, Zengji Tu, Robert Tang, Yuxin Zhan, Eric Jiang, Yuxin Wu, Jianqing Zhang, Xiao Liang, Fang Wu, Haochi Zhang, Alexander Marlow, Guancheng Wan,
- Abstract要約: 再帰的な自己改善により、システムは自身の失敗からモデル構築機械を改善することができる。
しかし、RSIは、科学のQAや数学のようなコーディングと形式的なベンチマークにのみ検証されている。
RSIは次に、科学的、工学的、メタ科学的な領域にまたがって運用されなければならない、と我々は主張する。
本稿では,MetaRSI-v1を提案する。改良は,1つの統一パラダイム上での3つの型付き演算子のスケジュール構成である。
- 参考スコア(独自算出の注目度): 65.60481414910728
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recursive self-improvement (RSI) lets a system improve the model-building machinery from its own failures, so every later model inherits the gain. Yet RSI has been validated almost exclusively on coding and formal benchmarks such as science QA and mathematics. This format bound limits RSI to improvement within a machine-checkable slice, not general capability where questions are open and correctness is settled by argument, replication, or measurement. We argue RSI must next operate across real, diverse scientific, engineering, and meta-scientific domains, not where formal evaluation is merely tractable. To that end we present MetaRSI-v1, where improvement is the scheduled composition of three typed operators over one unified paradigm. Data-RSI amplifies existing competence and marks its boundary; Harness-RSI edits a five-slot scaffold without touching weights; Model-RSI internalizes capability into parameters through bounded training. Sharing one loop kernel and artifact vocabulary, they make data, scaffold, and model changes composable rather than exclusive. A two-axis optimizer jointly decides operator order and each operator's proposal policy, while a meta-level policy revises the schedule across terms. We validate MetaRSI-v1 under the field's standard evaluations, on code and closed-form science, with no external teacher: the target model plays every role in its own loop. MetaRSI-v1 reframes self-improvement from a single-surface edit to a composition across the full model-production pipeline, opening two paths: a model route internalizing capability through training, and a harness route leaving weights untouched and thus extending self-improvement to any model reachable through an interface, with Data-RSI redefined as the shared substrate feeding both. The framework further yields refutable laws on where loops exist, how operators compose, and what supervision buys.
- Abstract(参考訳): 再帰的自己改善(Recursive self-improvement、RSI)は、システムが自身の失敗からモデル構築機械を改善できるようにする。
しかし、RSIは、科学のQAや数学のようなコーディングと形式的なベンチマークにのみ検証されている。
このフォーマットはRSIをマシンチェック可能なスライス内での改善に制限する。
RSIは次に、科学的、工学的、メタ科学的な領域にまたがって運用されなければならない、と我々は主張する。
そこで我々は,MetaRSI-v1を提案する。改良は,1つの統一パラダイム上での3つの型付き演算子のスケジュール構成である。
Data-RSIは既存の能力を高め、その境界をマークし、Harness-RSIは重量に触れずに5スロットの足場を編集する。
1つのループカーネルとアーティファクトの語彙を共有することで、データや足場、モデルの変更を排他的ではなく構成可能にします。
2軸オプティマイザは、演算子順序と各演算子の提案ポリシーを共同で決定し、メタレベルポリシは項間でスケジュールを更新する。
我々は,メタRSI-v1を,コードとクローズドフォームの科学に基づいて,外部教師を伴わずに,現場の標準的な評価の下で検証する。
MetaRSI-v1は、単一表面の編集から完全なモデル生成パイプライン全体にわたる構成への自己改善を再構築し、トレーニングによるモデルルートの内在化機能と、ウェイトを未タッチで残すハーネスルートの2つのパスを開放する。
この枠組みはさらに、ループが存在する場所、オペレータの構成方法、そして監督者が何を買うかに関する、難解な法則を課している。
関連論文リスト
- Telemetry and Concealment in Self-Adapting Generative AI: Logging Architecture, Adversarial Model Hiding, and the Limits of Detection [0.0]
自己適応型生成AIシステムは、ポイントインタイムの検証が不十分である。
このようなモデルに対する厳密なテレメトリアーキテクチャを開発し、離散時間と連続時間で同時に運用する。
我々はこれをモデルハイディング問題として定式化し、パートIアーキテクチャに対する6つの異なる攻撃戦略の体系的な分類を提供する。
論文 参考訳(メタデータ) (2026-08-10T03:20:06Z) - One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement [37.27419953581617]
大きな言語モデル(LLM)は、しばしば潜伏する推論機能を利用することができない。
本稿では推論時間アライメントタスクとして推論誘発を扱うモジュラーフレームワークReQueRを提案する。
論文 参考訳(メタデータ) (2026-04-28T09:52:21Z) - AgenticRS-EnsNAS: Ensemble-Decoupled Self-Evolving Architecture Search [10.111487060179252]
この記事では、Ensemble-Decoupled Architecture Searchを紹介します。
シングルラーナー評価からシステムレベルの性能を予測する。
候補毎の検索コストをO(M)からO(1)に削減し、O(M)のデプロイメントコストは評価された勝者に限られる。
論文 参考訳(メタデータ) (2026-03-20T14:57:15Z) - A Generalizable Framework for Building Executable Domain-Specific LLMs under Data Scarcity: Demonstration on Semiconductor TCAD Simulation [20.174394305112198]
低リソース環境下でコンパクトで実行可能なドメイン固有LLMを構築するためのフレームワークを提案する。
半導体コンピュータ支援設計(TCAD)のためのTcadGPTのインスタンス化によるフレームワークの実証
1.5Mの合成QAペアとIR駆動のDPOデータセットを使用して、TcadGPTはSDE実行可能性テストにおいて85.6%のセマンティック精度と80.0%の構文パスレートを達成した。
論文 参考訳(メタデータ) (2026-01-15T07:13:34Z) - MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic Retrieval [50.30107119622642]
大規模言語モデル(LLM)は推論と生成において優れているが、本質的には静的事前学習データによって制限されている。
Retrieval-Augmented Generation (RAG)は、LLMを外部知識に基盤を置くことでこの問題に対処する。
MarAG-R1は、LLMが複数の検索機構を動的に調整できる強化学習型マルチツールRAGフレームワークである。
論文 参考訳(メタデータ) (2025-10-31T15:51:39Z) - Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models [86.88657425848547]
大型推論モデル(LRMs)はすでに長い連鎖推論のための潜在能力を持っている。
我々は、自動生成の自己検証タスクを使用して、モデルに推論、帰納、誘拐の3つのメタ能力を持たせることを明確にした。
我々の3つのステージ・パイプラインの個別アライメント、パラメータ空間のマージ、ドメイン固有の強化学習は、命令調整ベースラインと比較して10%以上のパフォーマンス向上を実現します。
論文 参考訳(メタデータ) (2025-05-15T17:58:33Z) - Reinforced Model Merging [53.84354455400038]
本稿では,タスク統合に適した環境とエージェントを含むRMM(Reinforced Model Merging)という,革新的なフレームワークを提案する。
評価プロセス中にデータサブセットを利用することで、報酬フィードバックフェーズのボトルネックに対処し、RMMを最大100倍高速化する。
論文 参考訳(メタデータ) (2025-03-27T08:52:41Z) - Chain-of-Skills: A Configurable Model for Open-domain Question Answering [79.8644260578301]
検索モデルは、現実世界の知識集約的なタスクに欠かせない要素である。
最近の研究はカスタマイズされたメソッドに焦点を合わせ、モデルの転送可能性とスケーラビリティを制限している。
本稿では,各モジュールがデータセット間で再利用可能なキースキルに対応するモジュールレトリバーを提案する。
論文 参考訳(メタデータ) (2023-05-04T20:19:39Z) - Understanding Dynamics of Nonlinear Representation Learning and Its
Application [12.697842097171119]
暗黙的非線形表現学習のダイナミクスについて検討する。
我々は,データ構造アライメント条件がグローバル収束に十分であることを示す。
我々はデータ構造アライメント条件を満たす新しいトレーニングフレームワークを作成した。
論文 参考訳(メタデータ) (2021-06-28T16:31:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。