論文の概要: Regression Accumulation in Multi-Turn LLM Programming Conversations
- arxiv url: http://arxiv.org/abs/2607.01855v1
- Date: Thu, 02 Jul 2026 08:15:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.741923
- Title: Regression Accumulation in Multi-Turn LLM Programming Conversations
- Title(参考訳): マルチTurn LLMプログラミングにおける回帰累積
- Authors: Yonghui, Huang, Lin Ma, Amjed Tahir, Qian Zhang, Liwen Xiao, Lysa Xiao,
- Abstract要約: 回帰累積は6つのモデルにまたがる
後続のコードが以前の要件と競合するクロスTurn Conflictは、主要な障害クラスである。
検証ゲートは、すべてのモデルを一貫して改善する唯一の戦略である。
- 参考スコア(独自算出の注目度): 25.94870617800846
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In LLM-assisted software development, coding is often iterative. We study regression accumulation in multi-turn LLM programming conversations, where later code suggestions may break requirements introduced in earlier turns. Reliability therefore depends not only on satisfying the current request, but also on preserving previously satisfied behavior. We construct 542 tasks from HumanEval+ and MBPP+ and extend each task into an 8-turn requirement-evolution chain. We evaluate six LLMs on 26,016 turn instances (542 x 6 x 8). At each turn, we test whether the current code still passes earlier benchmark tests. We also analyze 384 failure cases from the failure population and build a taxonomy of multi-turn regression bugs through independent four-annotator labeling. Our results show that regression accumulation appears across all six models: 40% to 73% of tasks lose previously correct behavior over the full conversation. Final-turn quality is lower than initial-turn quality across models, especially when later turns add input validation or broader input types. Manual analysis shows that Cross-Turn Conflict, where later code conflicts with earlier requirements, is the main failure class. We further find that Verification Gate, which checks new code against prior tests and triggers rollback and retry, is the only strategy that consistently improves all models, raising final-turn quality from 75.8% to 87.9% on DeepSeek-V3 and from 31.6% to 47.3% on Llama-3.1-8B. These findings suggest that strong single-turn performance can overestimate reliability in multi-turn coding conversations. Future evaluation and tool design should test whether later code suggestions preserve earlier requirements and should include Verification Gate mechanisms.
- Abstract(参考訳): LLM支援ソフトウェア開発では、コーディングはしばしば反復的である。
マルチターンLDMプログラミング会話における回帰蓄積について検討し、後続のコード提案が早期に導入される要求を損なう可能性があることを示す。
したがって、信頼性は、現在の要求を満たすことだけでなく、以前に満たされた振る舞いを保存することにも依存します。
我々はHumanEval+とMBPP+から542のタスクを構築し、各タスクを8ターンの要求進化チェーンに拡張する。
26,016 ターンインスタンス (542 x 6 x 8) で 6 個の LLM を評価した。
各ターンで、現在のコードがまだ以前のベンチマークテストに合格しているかどうかをテストします。
また, 障害集団から384件の障害事例を分析し, 独立4アノテータラベリングによる多ターン回帰バグの分類を構築した。
その結果,6つのモデルすべてに回帰累積が現れることがわかった。タスクの40%から73%は,会話全体に対して前もって正しい行動を失う。
最終ターンの品質は、モデル全体の初期ターン品質よりも低い。
手動分析では、後続のコードが以前の要件と矛盾するクロストゥルン・コンフリクトが主要な障害クラスであることを示している。
さらに、以前のテストに対して新しいコードをチェックし、ロールバックとリトライをトリガーするVerification Gateは、すべてのモデルを継続的に改善する唯一の戦略であり、最終ターン品質は、DeepSeek-V3で75.8%から87.9%、Llama-3.1-8Bで31.6%から47.3%に向上した。
これらの結果から,マルチターン符号化における信頼性を過大評価できる可能性が示唆された。
将来の評価とツール設計は、後続のコード提案が以前の要件を維持しているかどうかを確認し、検証ゲート機構を含めるべきである。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Social Bias in LLM-Generated Code: Benchmark and Mitigation [10.39413030802123]
大きな言語モデル(LLM)は、人口統計学的公正性が重要である人間中心のアプリケーションのためのコードを生成するために、ますます多くデプロイされている。
既存の評価は機能的正当性にのみ焦点が当てられており、LLM生成コードの社会的偏見はほとんど検討されていない。
FMA(Fairness Monitor Agent)は,既存のコード生成パイプラインを修正せずにプラグインするモジュールコンポーネントである。
論文 参考訳(メタデータ) (2026-05-01T04:06:02Z) - Examining LLMs Ability to Summarize Code Through Mutation-Analysis [9.187740569361804]
本稿では,要約がコードのロジックと真に一致するかどうかを直接検査する突然変異に基づく評価手法を提案する。
62プログラム中624件の変異生検評価を合計3つの実験で検証した。
変異の種類や位置は、より弱い効果を示す一方、要約精度は複雑さとともに急激に低下する。
論文 参考訳(メタデータ) (2026-02-19T21:00:49Z) - Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code [76.80306464249217]
本稿では,LLMにより良い理性を教えることを目的としたTeaRを提案する。
TeaRは、注意深いデータキュレーションと強化学習を活用して、コード関連のタスクを通じて最適な推論パスを発見するモデルをガイドする。
我々は、2つのベースモデルと3つの長いCoT蒸留モデルを用いて広範な実験を行い、モデルのサイズは15億から32億のパラメータから、Math、Knowledge、Code、Logical Reasoningにまたがる17のベンチマークにまたがる。
論文 参考訳(メタデータ) (2025-07-10T07:34:05Z) - A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback [30.446511584123492]
大規模言語モデル(LLM)はコード生成において著しく進歩しているが、階層化され多様な制約を持つ複雑なプログラミング命令に従う能力はいまだ探索されていない。
複数次元にわたるコード生成における命令追従の評価を目的とした総合ベンチマークであるMultiCodeIFを紹介する。
我々は14のプログラミング言語から得られた2,021のコードタスクを合成し、進化させ、フィードバック駆動型タスク変種によるマルチターン評価をサポートする。
論文 参考訳(メタデータ) (2025-07-01T11:51:40Z) - A Preliminary Study on the Robustness of Code Generation by Large Language Models [40.01096420024215]
CoderEvalベンチマークを用いて,LLM生成したコードロバスト性に関する実証的研究を行った。
出力の35.2%は、人間が書いたコードよりも堅牢ではなく、条件チェックの欠如による90%以上の欠陥があることがわかった。
このような問題に対処するため,モデルに依存しないフレームワークであるRobGenを提案する。
論文 参考訳(メタデータ) (2025-03-26T03:44:03Z) - Preference Optimization for Reasoning with Pseudo Feedback [100.62603571434167]
提案手法では,解のラベル付けを関連するテストケースに対する評価として行うことで,推論タスクに対する疑似フィードバックを生成する手法を提案する。
本研究では,擬似フィードバックを優先最適化に用いる数学的推論と符号化の両タスクについて実験を行い,両タスク間の改善を観察する。
論文 参考訳(メタデータ) (2024-11-25T12:44:02Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。