論文の概要: When Is Enough Enough in Self-Evolving LLM Systems?
- arxiv url: http://arxiv.org/abs/2610.04756v1
- Date: Sat, 03 Oct 2026 20:47:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 17:07:26.86541
- Title: When Is Enough Enough in Self-Evolving LLM Systems?
- Title(参考訳): 自己進化型LLMシステムで十分すぎるのはいつか?
- Abstract要約: 自己進化的なシステムがいつ停止すべきか、そして停止したら出力すべきものは何か、という2つの基本的な疑問を研究します。
オンラインシーケンシャルテスト問題を定式化し、自己進化型LLMシステムによってすでに生成されているペアリング評価結果を用いて、任意の値の再起動検出器を構築することで、最初の課題に対処する。
結果として得られる手順はプラグアンドプレイであり、基礎となる自己進化アルゴリズムを変更する必要はない。
- 参考スコア(独自算出の注目度): 10.500839801147015
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-evolving large language model (LLM) systems repeatedly propose, evaluate, and incorporate updates to prompts, skills, or other persistent artifacts. Despite their growing effectiveness, these systems typically operate under a predetermined iteration or compute budget, without a principled criterion to determine when further evolution is no longer worthwhile. This can lead to two undesirable consequences: unnecessary computation after performance has saturated and the risk of returning late updates that overfit or exploit the evaluation signal. These issues motivate us to study two fundamental questions: when should a self-evolving system stop, and what should it output once it stops? We address the first by formulating an online sequential testing problem and constructing an anytime-valid restart detector using the per-item paired evaluation outcomes already produced by self-evolving LLM systems. We address the second by formulating a change-point estimation problem and using the estimated transition to select an earlier artifact for output. The resulting procedure is plug-and-play and requires no modification of the underlying self-evolving algorithms. Across two self-evolving frameworks, three LLM model families, and five benchmarks, our method substantially reduces computation costs while maintaining comparable unseen-test performance. For example, on SearchQA with SkillOpt and DeepSeek V4 Flash, our method stops at round 4 rather than the full budget of 40, reducing token usage by 91.6% while achieving 82.43% unseen-test accuracy versus 82.00% under the full-budget run.
- Abstract(参考訳): 自己進化型大規模言語モデル(LLM)システムは、繰り返しプロンプト、スキル、その他の永続的なアーティファクトの更新を提案し、評価し、取り入れる。
有効性は高まるが、これらのシステムは一般的に所定のイテレーションや計算予算の下で運用される。
これは、2つの望ましくない結果をもたらす可能性がある。パフォーマンスが飽和した後の不要な計算と、評価信号に過度に適合または悪用する遅延更新を返すリスクである。
これらの問題は、いつ自己進化的なシステムが停止すべきか、そしてそれが停止したら出力すべきことは何か、という2つの基本的な疑問を研究する動機になります。
オンラインシーケンシャルテスト問題を定式化し、自己進化型LLMシステムによってすでに生成されているペアリング評価結果を用いて、任意の値の再起動検出器を構築することで、最初の課題に対処する。
本稿では, 変化点推定問題を定式化し, 推定遷移を用いて, 初期の成果物を出力として選択することで, 2番目の問題に対処する。
結果として得られる手順はプラグアンドプレイであり、基礎となる自己進化アルゴリズムを変更する必要はない。
2つの自己進化フレームワーク、3つのLLMモデルファミリ、5つのベンチマークにおいて、本手法は、同等の未確認性能を維持しながら、計算コストを大幅に削減する。
例えば、SkillOptとDeepSeek V4 FlashのSearchQAでは、40の予算ではなくラウンド4で停止し、トークン使用率を91.6%削減し、フル予算で82.00%に対して82.43%の未テスト精度を達成した。
関連論文リスト
- Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z) - Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling [55.026048429595384]
テストタイムスケーリングは、Large Language Models (LLMs) の推論性能を向上させるが、かなりの計算コストを発生させる。
トークン効率とレイテンシを同時に向上する動的自己整合性フレームワークであるSeerSCを提案する。
論文 参考訳(メタデータ) (2025-11-12T13:57:43Z) - S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning [51.84977135926156]
S$2$Rはモデルに推論時の自己検証と自己正当性を教えることによってLLM推論を強化する効率的なフレームワークである。
以上の結果から,Qwen2.5-math-7Bの精度は51.0%から81.6%に向上した。
論文 参考訳(メタデータ) (2025-02-18T13:40:22Z) - Scaling Test-Time Compute Without Verification or RL is Suboptimal [70.28430200655919]
RL法や検索法に基づく検証器ベース (VB) 手法による微調整は, 一定量の計算・データ予算を条件として, 蒸留・クローニングに基づく検証器フリー (VF) 手法よりもはるかに優れていることを示す。
我々は,3/8Bの事前学習型LLMのドクティクスと数学推論の両問題に対して,我々の理論を実証的に相関させ,テスト時間計算のスケーリングには検証が不可欠であることを確認した。
論文 参考訳(メタデータ) (2025-02-17T18:43:24Z) - Efficiently Scaling LLM Reasoning with Certaindex [25.549811985276488]
テストタイム推論アルゴリズムは、精度を向上することなく、多くのトークンを無駄に生成することができる。
本稿では,アルゴリズムに依存しない測定値であるCertaindexを導入する。
Certaindexは軽量で、早期終了による推論プログラムの推論を加速し、動的トークン割り当てを可能にする。
論文 参考訳(メタデータ) (2024-12-30T14:57:53Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。