論文の概要: Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization
- arxiv url: http://arxiv.org/abs/2605.21537v1
- Date: Wed, 20 May 2026 05:00:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:41.93146
- Title: Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization
- Title(参考訳): Articulate but Wrong: LLMベースのコードモダナイゼーションにおける自己レビューの失敗
- Authors: Gokul Chandra Purnachandra Reddy, Aditya Lolla, Harsha Sanku,
- Abstract要約: 大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
- 参考スコア(独自算出の注目度): 1.0164694825170502
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents are increasingly used to migrate legacy code to modern stacks. We ask a deceptively simple question: when an LLM modernizes legacy code, can the same model be relied upon to recognize when its own output silently changes observable behavior? We run 1,980 real modernization calls across 11 production LLMs from 7 distinct families on a balanced 60-snippet legacy-Python-2 corpus, evaluate every output with a type-strict behavioral oracle, and then ask each model to judge whether its own output preserves behavior. We report four findings. (1) Semantic-preservation drift is prevalent and sharply separable from a cleanly-controlled baseline: semantic-trap snippets drift in 39.7% of attempts versus 7.0% on benign-control code that requires no real modernization (+32.7 percentage points; n=660 each). (2) Drift concentrates on specific snippets that fail across models: pairwise model agreement on which snippets are hard is high (mean Pearson r=0.52), and a small core of numeric-semantics snippets fails for nearly every model and every prompt phrasing. (3) Self-review by the producing model is not a reliable safety net: across all semantic drift cases, 31.7% are silently endorsed by the same model that produced them (83/262), and the per-model self-miss rate is strongly bimodal -- ranging from 0% on five models to 100% on one widely deployed model -- with several models explicitly articulating the very Py2/Py3 semantic distinction that broke their output, then declaring behavior preserved. (4) Drift rate is non-monotone in model capability and price: per-model rates range 5.6%-46.7% and do not track model capability cleanly, indicating the failure is task-structural rather than driven by model scale. All code, prompts, the 60-snippet corpus, the behavioral oracle, the output extractor, and the raw model outputs are released.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
LLMがレガシーコードを近代化するとき、同じモデルを、その出力が観測可能な振る舞いを静かに変更したことを認識できるだろうか?
我々は、バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMに対して1,980のリアルタイムモダナイゼーションコールを実行し、型制限の行動オラクルで全ての出力を評価し、各モデルに対して、それぞれの出力が動作を保存するかどうかを判断する。
我々は4つの発見を報告した。
1) セマンティック保存ドリフトは、クリーンに制御されたベースラインから急激に分離可能である: セマンティックトラップスニペットは39.7%で、実際の近代化を必要としない良性制御コードでは7.0%でドリフトする(+32.7%ポイント、n=660ポイント)。
2) Driftは、モデル間で失敗する特定のスニペットに集中する: スニペットがハードであるペアワイズモデルアグリーメント(Pearson r=0.52)と、ほとんどすべてのモデルとすべてのプロンプトのフレーズに対して、数値・セマンティックスニペットの小さなコアがフェールする。
3) 生成モデルによる自己レビューは信頼性の高い安全ネットではない。すべてのセマンティックドリフトケースにおいて、31.7%は、生成したモデルと同じモデル(83/262)でサイレントに支持されている。
(4) ドリフトレートはモデル能力と価格において非単調であり、モデル毎のレートは5.6%-46.7%であり、モデルスケールによって駆動されるのではなくタスク構造であることを示す。
全コード、プロンプト、60スニペットコーパス、行動オラクル、出力抽出器、生モデルの出力が解放される。
関連論文リスト
- Solve the Loop: Attractor Models for Language and Reasoning [4.8720589853137435]
Looped Transformerは、純粋にフィードフォワード計算に代わる有望な代替手段を提供する。
本稿では、まず、バックボーンモジュールが出力の埋め込みを提案し、次にアトラクターモジュールが固定点を解くことでそれらを洗練するAttractor Modelsを紹介する。
本研究では,Attractor Modelsが,大規模言語モデル事前学習と推論という2つのレシエーションにおいて,既存モデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-12T17:51:26Z) - When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models [2.064923532131528]
デプロイされた言語モデルは、正しいものとフォーマットに準拠した出力を生成する必要がある。
本稿では,GSM8KとMATHという2つの数学的ベンチマークを用いて,この構造化出力信頼性ギャップについて検討する。
対象モデルへのブラックボックスAPIアクセスのみを必要とする反復的なシステムプロンプトであるAloLabを開発した。
論文 参考訳(メタデータ) (2026-05-04T09:07:44Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - Semantic Layers for Reliable LLM-Powered Data Analytics: A Paired Benchmark of Accuracy and Hallucination Across Three Frontier Models [0.0]
解析データベースの自然言語クエリ用にデプロイされたLLMは、2つの障害に悩まされる。
ClickHouseのCleaned Contoso Retailデータセットに対して,100の自然言語質問に対して,3つのフロンティアLSMをベンチマークした。
論文 参考訳(メタデータ) (2026-04-28T02:53:23Z) - How Robustly do LLMs Understand Execution Semantics? [3.2717315277334706]
LLMは驚くべき推論能力を示しているが、それらが内的世界モデルを利用するのか、高度なパターンマッチングに依存しているのかは未解決のままである。
我々は,標準的なプログラム出力予測タスクを用いて,LLMをそのコード理解の堅牢性のレンズを通して研究する。
私たちの発見は、すべてのモデルがコードを理解する方法の限界を示し、コードモデルを評価するために摂動を使うことの価値を確立します。
論文 参考訳(メタデータ) (2026-02-24T19:07:25Z) - AdapTrack: Constrained Decoding without Distorting LLM's Output Intent [53.75852524070165]
言語モデルに基づくコード生成と補完ツールは、時には必要な制約を満たさないコードを生成することがある。
制約に固執するコードを生成するために、制約付き復号法が開発された。
AdapTrackは、モデルの出力インテントを歪めるのを避けるため、制約に準拠するだけでなく、モデルの出力インテントと意味的に一致した結果を生成する。
論文 参考訳(メタデータ) (2025-10-20T10:11:34Z) - Goedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-Correction [95.91743732150233]
一連のオープンソースの言語モデルであるGoedel-Prover-V2は、自動定理の新たな最先端を証明した。
我々は、より複雑な定理をマスターするためにモデルを訓練することの困難さを増す合成タスクを生成する。
Goedel-Prover-V2-32Bは、標準モードのpass@32でMiniF2Fの88.1%、自己補正モードの90.4%を達成する。
論文 参考訳(メタデータ) (2025-08-05T16:28:22Z) - Promises and Pitfalls of Generative Masked Language Modeling: Theoretical Framework and Practical Guidelines [74.42485647685272]
GMLM(Generative Masked Language Models)に焦点を当てる。
我々は,マルコフ連鎖の入力として使用されるマスキングにより,データ分布の条件付き確率に適合するモデルを訓練し,モデルからサンプルを抽出する。
我々は,T5モデルを並列デコーディングに適応させ,最小品質の犠牲を伴って機械翻訳における2~3倍の高速化を実現した。
論文 参考訳(メタデータ) (2024-07-22T18:00:00Z) - The False Promise of Imitating Proprietary LLMs [158.65692029352584]
より弱い言語モデルを安価に改善するための新しい方法は、より強力なモデルからの出力に対してそれを微調整することである。
このアプローチは、より弱いオープンソースモデルを使用して、プロプライエタリなモデルの機能を安価に模倣することを目指している。
まず、様々なベースモデルサイズを用いてChatGPTを模倣する一連のLMを微調整する。
次に、群衆レーダと標準NLPベンチマークを用いてモデルを評価する。
論文 参考訳(メタデータ) (2023-05-25T05:00:12Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。