論文の概要: Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse
- arxiv url: http://arxiv.org/abs/2607.04537v1
- Date: Sun, 05 Jul 2026 22:55:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.974214
- Title: Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse
- Title(参考訳): Obey, Diverge, Collapse: 誤った命令に対する盲目の服従は、コードのLLMを発見不可能なコードセマンティック崩壊に導く
- Authors: Raj Jaiswal, Anany Singh Divy, Savar Bhasin, Adi Bajpai, Tanuja Ganu, Rajiv Ratn Shah,
- Abstract要約: モデルが不適切な命令に抵抗するか従うかを評価するために設計された4つの実験でコード言語モデルを評価する。
モデルは間違った命令を正しく識別し、いずれにせよそれに従う。
このコンプライアンスは、元のバグ以外のエラーを無意識に導入し、後に自己ガイドされた反復的な修正によって、破損したコード状態は回復できない。
- 参考スコア(独自算出の注目度): 22.478506766076304
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code language models are now trusted collaborators in production workflows for debugging, refactoring, and iterative repair, and every benchmark that evaluates them assumes the instructions they act on are correct. We study what happens when that assumption breaks. We evaluate code language models across four experiments designed to assess whether models resist or obey incorrect instructions in single-pass and iterative repair settings, using the RunBugRun dataset of algorithmic Python problems with deterministic test cases. Our findings reveal a striking behavioral pattern: models correctly identify an incorrect instruction as wrong, then follow it anyway. This compliance unknowingly introduces errors beyond the original bug, and the corrupted code state cannot be recovered through subsequent self-guided iterative repair, which fails to converge across passes. We term this Blind Obedience, characterize the Ghost (Unknown) Errors it introduces, quantify the proportion of cases where semantic corruption proves irrecoverable, and show that extended reasoning cannot reverse it. These findings surface behavioral properties invisible to pass-rate evaluation, with direct consequences for code language models deployed in production settings.
- Abstract(参考訳): コード言語モデルは、デバッグ、リファクタリング、反復的な修復のためのプロダクションワークフローにおける信頼性の高いコラボレータとなり、それらを評価するすべてのベンチマークは、彼らが実行している命令が正しいことを前提としている。
私たちはその仮定が壊れたときに何が起こるかを調べます。
決定論的テストケースを用いたアルゴリズムPython問題のRunBugRunデータセットを用いて、単一パスおよび反復的修復設定において、モデルが不正な命令に抵抗するか、従属するかを評価するために設計された4つの実験で、コード言語モデルを評価する。
モデルは間違った命令を正しく識別し、いずれにせよそれに従う。
このコンプライアンスは、元のバグを超えたエラーを無意識に導入し、破損したコード状態は、その後の自己ガイドによる反復的な修復によって回復できないため、パスを越えて収束することができない。
この盲目の服従(Blind Obedience)と呼び、それが導入するゴースト(未知の)エラーを特徴づけ、意味論的腐敗が発見不可能なケースの割合を定量化し、拡張された推論がそれを逆転できないことを示す。
これらの知見は、運用環境にデプロイされたコード言語モデルに直接的な影響を伴って、パスレート評価に見えない振る舞い特性を表面化する。
関連論文リスト
- Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback [13.976149104483449]
PAIR-Benchは、大規模言語モデル(LLM)を評価するためのプログレッシブベンチマークである。
不正確なプログラムや不完全なプログラムを、フィードバック誘導による改善によって、より正しいプログラムに変換する。
モデルがターゲットの障害を修復するかどうかを計測し、ヒントを超えて一般化し、すでに正しい振る舞いを保持し、どのくらいの助けが必要なのかを測定します。
論文 参考訳(メタデータ) (2026-07-01T18:20:27Z) - From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection [0.0]
「大型言語モデル(LLM)における固有の自己補正は、幻覚雪球によるオープンエンド推論タスクでしばしば失敗する」
本研究は,制約付き復号法により構造的反射を純粋に強制することが,追加の訓練を伴わずに誤りの伝播を阻害するかどうかを考察する。
論文 参考訳(メタデータ) (2026-04-07T16:47:37Z) - VIBEPASS: Can Vibe Coders Really Pass the Vibe Check? [46.85901599242161]
emphFault-Triggering Test Generation(FT-Test)とemphFault-targeted Program repair(FPR)の2つの組み合わせタスクを評価した。
故障対象推論は一般的な符号化能力ではスケールしないことがわかった。
自己生成テストが障害の発見に成功すると、結果として得られた修復結果が外部から提供されたテストによってガイドされた修復と一致したり、性能が低下する。
論文 参考訳(メタデータ) (2026-03-16T21:14:28Z) - CodeCircuit: Toward Inferring LLM-Generated Code Correctness via Attribution Graphs [13.488544043942495]
本研究の目的は、コード生成中に論理的妥当性を予測可能な内部デオード可能な信号が、モデル内のニューラルダイナミクスで符号化されているかどうかを検討することである。
複雑な残留流を分解することにより,音の推論と論理的失敗を区別する構造的シグネチャを同定することを目的とする。
Python、C++、Javaでの分析では、固有の正当性信号が多様な構文で堅牢であることが確認されている。
論文 参考訳(メタデータ) (2026-02-06T03:49:15Z) - Corrective Diffusion Language Models [12.724100711773593]
拡散言語モデルにおいて,不正確なトークンに低い信頼度を割り当て,正しいコンテンツを保持しながら反復的にそれらを洗練する能力として定義される補正行動について検討する。
本稿では,目に見える不正確なトークンを明示的に監視し,誤り認識の信頼性と目的の洗練を可能にする,修正指向のポストトレーニング原理を提案する。
論文 参考訳(メタデータ) (2025-12-17T17:04:38Z) - Adapting Language Balance in Code-Switching Speech [60.296574524609575]
大規模な基礎モデルは、コードスイッチングテストケースといまだに苦労しています。
我々は、世代間のコンテキストバイアスを軽減するために、微分可能なサロゲートを使用します。
アラビア語と中国語による実験では、モデルの切り替え位置をより正確に予測できることが示されている。
論文 参考訳(メタデータ) (2025-10-21T15:23:55Z) - Probing for Arithmetic Errors in Language Models [86.8227317662622]
言語モデルの内部アクティベーションは、算術誤差を検出するために使用できる。
単純なプローブはモデルが予測した出力と正解の両方を隠蔽状態から正確に復号できることを示す。
モデル精度を90%以上の精度で予測する軽量エラー検出器を訓練する。
論文 参考訳(メタデータ) (2025-07-16T16:27:50Z) - A Static Evaluation of Code Completion by Large Language Models [65.18008807383816]
単純なプログラミング問題に対するモデル生成コードの機能的正当性を評価するために,実行ベースベンチマークが提案されている。
プログラムを実行せずにエラーを検出するlinterのような静的解析ツールは、コード生成モデルを評価するために十分に研究されていない。
抽象構文木を利用して,Pythonのコード補完における静的エラーを定量化する静的評価フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-05T19:23:34Z) - Understanding Factual Errors in Summarization: Errors, Summarizers,
Datasets, Error Detectors [105.12462629663757]
本研究では、既存の9つのデータセットから事実性エラーアノテーションを集約し、基礎となる要約モデルに従ってそれらを階層化する。
本稿では,この階層化ベンチマークにおいて,最近のChatGPTベースの指標を含む最先端の事実性指標の性能を比較し,その性能が様々な種類の要約モデルで大きく異なることを示す。
論文 参考訳(メタデータ) (2022-05-25T15:26:48Z) - On the Robustness of Language Encoders against Grammatical Errors [66.05648604987479]
我々は、非ネイティブ話者から実際の文法的誤りを収集し、これらの誤りをクリーンテキストデータ上でシミュレートするために敵攻撃を行う。
結果,全ての試験モデルの性能は影響するが,影響の程度は異なることがわかった。
論文 参考訳(メタデータ) (2020-05-12T11:01:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。