論文の概要: Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation
- arxiv url: http://arxiv.org/abs/2607.22653v1
- Date: Fri, 26 Jun 2026 13:44:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.008886
- Title: Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation
- Title(参考訳): 言語モデルはセムセルに収束するか? テキスト緩和としての帰納的自己精製
- Abstract要約: 我々は、デフォルト温度と決定論的デコーディングの両方の下で、50のICML 2025抽象に対して10ステップの洗練トラジェクトリを生成する。
正規化編集距離, 精度および近似固定点, 単語数安定性, 指数緩和, 外部LCM-as-a-judge評価を解析した。
- 参考スコア(独自算出の注目度): 0.6509233267425589
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly used in recursive refinement workflows, where an initial draft is repeatedly revised by the same model. Despite their growing use, the long-term dynamics of such workflows remain poorly understood. Does repeated refinement continue to improve outputs indefinitely, or does it converge toward a stable textual form? We study recursive self-refinement as a dynamical process in which repeated LLM revision drives text toward a model-preferred soft fixed-point region. Using GPT-5.5, we generate 10-step refinement trajectories for 50 ICML 2025 abstracts under both default-temperature and deterministic decoding, and additionally evaluate 15 ICML 2020 abstracts. We analyze normalized edit distance, exact and approximate fixed points, word-count stability, exponential relaxation, and external LLM-as-a-judge evaluation. Across all settings, refinement trajectories rapidly saturate. Most edits occur within the first few iterations, after which trajectories enter a soft fixed-point region with only minor surface-level changes. Deterministic decoding reaches exact fixed points earlier and exhibits smaller residual fluctuations than default-temperature decoding, while both achieve universal approximate convergence. The average edit magnitude follows a consistent exponential relaxation pattern, suggesting convergence toward a model-preferred textual equilibrium rather than open-ended optimization. External evaluation indicates that converged abstracts improve clarity, conciseness, and scientific style while preserving technical meaning. These findings support a dynamical-systems view of LLM self-refinement and motivate practical stopping criteria based on edit-magnitude saturation.
- Abstract(参考訳): 大規模な言語モデルは、再帰的な改善ワークフローにおいて、同じモデルによって初期ドラフトが繰り返し修正されるように、ますます使われています。
利用が増えているにもかかわらず、そのようなワークフローの長期的なダイナミクスはいまだに理解されていない。
繰り返し改良は出力を無限に改善し続けるのか、それとも安定したテキスト形式に収束するのか?
本研究では,再帰的自己再定義を動的プロセスとして検討し,LLM修正を繰り返してテキストをモデル優先のソフト固定点領域に向けて駆動する手法を提案する。
GPT-5.5を用いて、デフォルト温度と決定論的デコーディングの両方の下で、50個のICML 2025抽象に対して10ステップの洗練トラジェクトリを生成し、さらに15個のICML 2020抽象化を評価する。
正規化編集距離, 精度および近似固定点, 単語数安定性, 指数緩和, 外部LCM-as-a-judge評価を解析した。
あらゆる設定において、精製軌道は急速に飽和する。
ほとんどの編集は最初の数回のイテレーションで行われ、その後、軌道は小さな表面レベルでのみ変化してソフトな固定点領域に入る。
決定論的復号化はより早く正確な固定点に達し、デフォルト温度の復号化よりも小さな残差変動を示す。
平均編集等級は一貫した指数的緩和パターンに従っており、オープンエンド最適化よりもモデル優先のテキスト平衡への収束を示唆している。
外的評価は、要約された抽象概念が技術的意味を保ちながら明確さ、簡潔さ、科学的スタイルを改善することを示している。
これらの知見は, LLM自己精製の力学系ビューをサポートし, 編集マグニチュード飽和に基づく実践的停止基準を動機付けている。
関連論文リスト
- Recovering Physical Dynamics from Discrete Observations via Intrinsic Differential Consistency [12.266189649117003]
我々は地域の監督をグローバルな構造的制約に置き換える。
この特性からの偏差が2つの目的に作用する時間条件のセカント速度場を訓練する。
トレーニング正則化器として、時間スケールで一貫して構成されるフローに仮説空間を限定する。
論文 参考訳(メタデータ) (2026-05-08T20:24:32Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - Textual Equilibrium Propagation for Deep Compound AI Systems [63.266386654809544]
大規模言語モデル(LLM)は、複合AIシステムの一部としてますます多くデプロイされている。
テキストフィードバックをグローバルに伝達する最近のアプローチ(例:TextGrad)は、そのようなパイプラインを最適化することを可能にするが、システムの深さが大きくなるにつれて性能が低下する。
特に、長距離エージェントは2つの深度スケーリング障害モードを示す: 1) テキストのフィードバックが指数関数的に深度とともに増加し、不当に長いメッセージをもたらし、評価バイアスを増幅するテキストの勾配を爆発させる; 2) 長いコンテキスト能力に制限のあるモデルが部分的なフィードバックを過度に強調し、長いフィードバックの圧縮が下流メッセージの特異性を徐々に低下させるテキストの勾配を消失させる。
論文 参考訳(メタデータ) (2026-01-28T21:41:11Z) - Towards Infinite Length Extrapolation: A Unified Approach [0.0]
大規模言語モデル(LLM)は自然言語処理に革命をもたらしたが、長いシーケンスを処理する能力は、訓練中のコンテキストウィンドウサイズによって根本的に制限されている。
我々は、注目スコアを乗法変換と加法バイアスに分解するものとして、位置符号化手法を再解釈する統一的なフレームワークを使用する。
我々の理論的解析は、無限コンテキスト外挿条件を確立し、ソフトマックスハンドリングが、長距離相関、エントロピー境界性、勾配位置感度を保ちながら、非有界列に対して適切に定義されていることを保証している。
論文 参考訳(メタデータ) (2026-01-03T14:10:23Z) - Optimization Modeling via Semantic Anchored Alignment [30.047608671041104]
SAC-Optは,問題セマンティクスにおいて,解答フィードバックではなく最適化モデルに基づく後方誘導補正フレームワークである。
各ステップで、SAC-Optは元のセマンティックアンカーと生成されたコードから再構成されたアンカーを調整し、ミスマッチしたコンポーネントのみを選択的に修正する。
7つの公開データセットに関する実証的な結果は、SAC-Optが平均モデリング精度を7.8%改善し、ComplexLPデータセットで最大21.9%向上したことを示している。
論文 参考訳(メタデータ) (2025-09-28T12:25:31Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - An Extra RMSNorm is All You Need for Fine Tuning to 1.58 Bits [0.0]
トレーニング後の量子化はメモリと計算を減少させるが、しばしば精度を低下させる。
三進法(2ビット)に量子化をプッシュすると、さらに大きな貯蓄が得られるが、非常に不安定である。
私たちのアプローチは、標準的な言語モデリングベンチマークにおいて、より精巧な知識蒸留パイプラインに適合するか、超越しています。
論文 参考訳(メタデータ) (2025-05-12T21:14:29Z) - LLMRefine: Pinpointing and Refining Large Language Models via Fine-Grained Actionable Feedback [65.84061725174269]
最近の大規模言語モデル(LLM)は、世代品質を改善するために人間のフィードバックを活用している。
LLMの出力を最適化する推論時間最適化手法であるLLMRefineを提案する。
機械翻訳、長文質問応答(QA)、話題要約を含む3つのテキスト生成タスクについて実験を行った。
LLMRefineは、すべてのベースラインアプローチを一貫して上回り、翻訳タスクの1.7 MetricXポイント、ASQAの8.1 ROUGE-L、トピックの要約の2.2 ROUGE-Lの改善を実現している。
論文 参考訳(メタデータ) (2023-11-15T19:52:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。