論文の概要: When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs
- arxiv url: http://arxiv.org/abs/2606.28438v1
- Date: Fri, 26 Jun 2026 07:35:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.559136
- Title: When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs
- Title(参考訳): AIが自身のコードレビュー:コードLLMにおける再帰的な自己学習の崩壊
- Abstract要約: 再帰的な自己学習は、生成されたデータが新鮮な人的データや外部品質管理なしで再利用されるときに、神経生成モデルを劣化させる可能性がある。
我々は、このリスクを、AI生成したコードが実際のリポジトリに入り、後にトレーニングデータになり、リポジトリスケールの自己学習ループを作成するLLMのコードで研究する。
- 参考スコア(独自算出の注目度): 7.798940465229644
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recursive self-training can degrade neural generative models when generated data is reused without fresh human data or external quality control. We study this risk in code LLMs, where AI-generated code can enter real repositories, later become training data, and create a repository-scale self-training loop. While software development traditionally interrupts this loop through pull-request review, tests, compilation, and human approval, AI coding tools now produce code faster than humans can review it, and code review itself is increasingly automated by AI systems. We therefore compare three recursive fine-tuning regimes: no review, Human-gate review using model-independent filters such as compilation and static quality checks, and AI-self-gate review using the code LLM's own signals such as perplexity and binary self-scoring. Across multiple code LLMs and benchmarks, no review collapses fastest, Human-gate filters slow but do not stop collapse, and AI-self-gate filters can look strong early but later lose their filtering effect. In the clearest case, the binary self-gate enters a rubber-stamp regime where acceptance scores rise while benchmark correctness falls. We explain this behavior by formulating review as gated distributional reweighting, proving that AI self-gating degenerates to ungated self-training under a self-confirming acceptance condition, and giving a spectral analysis of representation-level covariance concentration under recursive retraining. These results suggest that stable recursive code LLM training requires exogenous verification rather than model-coupled self-review.
- Abstract(参考訳): 再帰的な自己学習は、生成されたデータが新鮮な人的データや外部品質管理なしで再利用されるときに、神経生成モデルを劣化させる可能性がある。
我々は、このリスクを、AI生成したコードが実際のリポジトリに入り、後にトレーニングデータになり、リポジトリスケールの自己学習ループを作成するLLMのコードで研究する。
従来、ソフトウェア開発はプルリクエストレビュー、テスト、コンパイル、人間による承認を通じてこのループを中断してきたが、AIコーディングツールは、人間がレビューできるよりも早くコードを生成するようになり、コードレビュー自体がAIシステムによって自動化されている。
したがって、再帰的な微調整の仕組みを3つ比較する: レビューなし、コンパイルや静的品質チェックなどのモデル非依存のフィルタを使ったヒューマンゲートレビュー、パープレキシティやバイナリ自己検査のようなLLM独自の信号を用いたAIセルフゲートレビュー。
複数のコードLLMとベンチマークにまたがって、レビューの崩壊は速く、ヒューマンゲートフィルタは遅くても崩壊は止まらず、AIセルフゲートフィルタは早期に強く見えるが、後にフィルタリング効果を失う。
最も明確な場合、二進自己ゲートは、ベンチマークの正しさが低下する間に受容スコアが上昇するゴムスタンプ状態に入る。
本稿では, 自己確認型受入条件下でAIの自己ゲーティング・デジェネレーションが非ゲート型自己学習に結びつくことを証明し, 再帰型再学習下での表現レベルの共分散濃度のスペクトル分析を行うことにより, 評価をゲート型分布再重み付けとして定式化する。
これらの結果から, 安定再帰型LLMトレーニングでは, モデル結合自己レビューよりも外因性検証が必要であることが示唆された。
関連論文リスト
- From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement [56.26277769790695]
RLVR(Reinforcement Learning with Verifiable Rewards)は、推論指向の大規模言語モデル(LLM)の最近の進歩を推進している。
本稿では、RLVRをオープンなタスクに拡張するためのタスク変換に基づくトレーニングパラダイムであるRLSVR(Reinforcement Learning with Self-Verifiable Rewards)を提案する。
ソーシャルデダクションゲームにインスパイアされた自己PlaY強化学習手法SpyRLでRTSVRをインスタンス化する。
論文 参考訳(メタデータ) (2026-07-26T19:04:33Z) - Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework [0.3867363075280543]
提案するクローズドループフレームワークでは,すべてのレビューコメントを永続的な行動規則として符号化する。
このフレームワークは、バージョン管理された命令ファイル、自己レビューチェックリスト、自動検証に設定された蓄積ルールを組み合わせる。
我々のフレームワークは、重み付けの更新なしに永続的なクロスセッション学習を実現し、既存のベンチマークが測定しない経験的な次元(時間とともに振る舞いの整合性)に対処する。
論文 参考訳(メタデータ) (2026-07-13T21:13:46Z) - Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback [8.780008955074967]
自己進化型大規模言語モデル(LLM)は、独自のトレーニングタスクとソリューションを生成し、人事監督への依存を減らすことで学習する。
我々は,LLMの本質的信頼度を軽度不確実性信号として用いて学習を変調するCOSE(Confidence-Orchestrated Self-Evolution)を提案する。
論文 参考訳(メタデータ) (2026-05-27T06:07:10Z) - LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models [35.78769938627291]
我々は、標準の事前学習 LLM をループ化アーキテクチャに変換する後トレーニングフレームワークである textbfLooped Depth Up-Scaling (LoopUS) を導入する。
LoopUS は事前訓練された LLM をエンコーダ、ループ推論ブロック、デコーダに再キャストする。
これらのメカニズムは、標準的な非ループモデルからループ形式に変換し、計算ボトルネックと表現崩壊の両方に対して安定化する。
論文 参考訳(メタデータ) (2026-05-10T11:05:20Z) - Toward Training Superintelligent Software Agents through Self-Play SWE-RL [66.11447353341926]
セルフプレイSWE-RLは、超知能ソフトウェアエージェントのトレーニングパラダイムに向けた第一歩である。
当社のアプローチでは,ソースコードとインストール済みの依存関係を備えたサンドボックスリポジトリへのアクセスのみを必要としています。
我々の成果は、早い段階で、エージェントが現実世界のソフトウェアリポジトリから広範囲にわたる学習経験を自律的に収集する道のりを示唆している。
論文 参考訳(メタデータ) (2025-12-21T00:49:40Z) - LaSeR: Reinforcement Learning with Last-Token Self-Rewarding [54.72617309922891]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLM)の推論能力を高めるためのコアパラダイムとして登場した。
従来、LLMは2つの異なるプロンプトテンプレートを使用してソリューションと自己検証をシーケンシャルに生成し、効率を大幅に低下させる必要があった。
本稿では,従来のRLVR損失をMSE損失で増大させるアルゴリズムであるLaSeR(Reinforcement Learning with Last-Token Self-Rewarding)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:55:11Z) - DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation [68.19756761027351]
拡散大言語モデル(dLLM)は自己回帰(AR)モデルの魅力的な代替品である。
本研究は,それらの認知過程と強化学習手法について考察する。
我々の研究は、dLLM生成のメカニズムについて深い洞察を与え、効果的な拡散ネイティブなRLトレーニングフレームワークを提供します。
論文 参考訳(メタデータ) (2025-06-25T17:35:47Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models [54.14602121129874]
トレーニングデータを自動的に生成する最初のスケーラブルで信頼性の高いAutoIFを導入する。
AutoIFは命令追従データ品質の検証をコード検証に変換する。
論文 参考訳(メタデータ) (2024-06-19T13:29:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。