論文の概要: On the Lexical Superstition of Large Language Models for Code Comprehension: Re-evaluation on Code of Low Lexical Quality
- arxiv url: http://arxiv.org/abs/2609.26388v1
- Date: Tue, 22 Sep 2026 13:27:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.390475
- Title: On the Lexical Superstition of Large Language Models for Code Comprehension: Re-evaluation on Code of Low Lexical Quality
- Title(参考訳): コード理解のための大規模言語モデルの語彙迷信について:低語彙品質符号の再評価
- Abstract要約: セマンティックスを保存する識別子リネームフレームワークFace/Offを紹介する。
複数のモデルとコード理解タスクの進行的命名条件を評価する。
- 参考スコア(独自算出の注目度): 15.448952982512042
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in large language models (LLMs) have made them widely used for code-related tasks. Identifier names are statistically informative in naturally occurring code, but their information is not always reliable. We investigate whether current LLMs assign disproportionate weight to lexical cues when renaming preserves program structure. We introduce Face/Off, a semantics-preserving identifier-renaming framework, and evaluate progressive naming conditions across multiple models and code-comprehension tasks. Within this framework, lexical overemphasis is pervasive across the evaluated models and primary tasks: performance generally decreases as identifier information is removed or made misleading, and outputs are often directed toward the meanings suggested by misleading names. The pattern persists under representative prompt- and fine-tuning-based interventions, suggesting that lexical overemphasis is an entrenched problem. A type-inference control confirms a boundary: naming effects are smaller when the answer is locally recoverable without the target name. These results do not imply that identifiers are unhelpful; rather, they reveal a systematic vulnerability in how current LLMs balance lexical cues against program structure. Our findings motivate evaluations and modeling methods that preserve the benefits of natural code regularities while keeping conclusions grounded in accurate, formalized code semantics.
- Abstract(参考訳): 大規模言語モデル(LLM)の最近の進歩により、コード関連のタスクに広く使われている。
識別者名は自然発生のコードでは統計的に有意であるが、その情報は必ずしも信頼できるとは限らない。
プログラム構造をリネームする場合に,現在のLLMが不均質な重み付けを語彙的キューに割り当てるかどうかを検討する。
セマンティックス保存型識別子リネームフレームワークであるFace/Offを導入し,複数のモデルおよびコード理解タスクの進行的命名条件を評価する。
このフレームワーク内では、語彙オーバーエンハンシスが評価されたモデルや主要なタスクに広まっており、識別子情報を削除したり誤解を招いたりすると、パフォーマンスは一般的に低下する。
このパターンは、代表的プロンプトと微調整に基づく介入の下で持続し、語彙過剰が絡み合う問題であることを示唆している。
型推論制御は境界を確認する: 応答がターゲット名なしで局所的に回復可能である場合、命名効果は小さくなる。
これらの結果は識別子が不完全なことを示唆するものではなく、現在のLLMがプログラム構造に対して語彙的手がかりのバランスをとる方法の体系的な脆弱性を明らかにしている。
本研究は,コードセマンティクスの正確性に根ざした結論を維持しつつ,自然なコード規則性の利点を保った評価とモデリング手法を動機付けている。
関連論文リスト
- ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation [54.788849448970154]
我々はClarifyCodeBenchを紹介した。ClarifyCodeBenchは、要求のあいまいさを解決するためのLarge Language Modelsの機能を評価するための、インタラクティブなベンチマークだ。
ClarifyCodeBenchを用いて、6つの最先端LCMの体系的評価を行う。
1) 能力の疎結合: 強いコード生成性能は本質的には効果的な要求の明確化に変換されない; 2) 推論パラドックス: 計算思考の増大はコードの正確性を高めるが、あいまいさの識別において限界的な利益をもたらす。
論文 参考訳(メタデータ) (2026-07-01T09:58:59Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - When Better Codebooks Are Not Enough: Predictive Performance and Behavioral Reliability in LLM Political Event Coding [1.0312121265468142]
多くの社会科学研究は、テキストを構造化データに変換するために専門家が書いたコードブックに依存している。
本稿では,この問題を,ソース・ターゲット関係分類の課題である政治イベント符号化において研究する。
より明確な定義でLCMに親しみやすい形式に運用する場合、専門家のコードブックがより効果的になるかどうかを検証する。
論文 参考訳(メタデータ) (2026-06-04T23:51:14Z) - Semantic Reranking at Inference Time for Hard Examples in Rhetorical Role Labeling [5.963398606353896]
修辞的役割ラベルリング(Rhetorical Role Labeling、RRL)は、文書内の各文に機能的な役割を割り当て、法律、医学、科学の領域で広く使われている。
本稿では,ラベルのセマンティクスを活用してハードインスタンスの予測を洗練する推論時セマンティクスのフレームワークRISEを紹介する。
エンコーダベースのアーキテクチャや因果アーキテクチャを含む7つのLMを持つ8つのドメイン固有のRRLデータセットの実験では、ハードな例では、平均で+9.15のマクロF1ポイントが得られた。
論文 参考訳(メタデータ) (2026-05-18T08:03:02Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Readability-Robust Code Summarization via Meta Curriculum Learning [53.44612630063336]
現実の世界では、コードが貧弱な構造や難読化され、モデルのパフォーマンスが著しく低下することが多い。
本稿では,可読性の低いコードに対するコード要約の堅牢性を向上する,新しい微調整手法であるRoFTCodeSumを提案する。
論文 参考訳(メタデータ) (2026-01-09T02:38:24Z) - When Names Disappear: Revealing What LLMs Actually Understand About Code [7.691597373321699]
大規模言語モデル(LLM)は、コードタスクにおいて強力な結果をもたらすが、どのようにプログラムの意味を導き出すかは、まだ不明である。
形式的な振る舞いを定義する構造的意味論と、意図を伝える人間の解釈可能な命名という2つのチャンネルを通じてコードがコミュニケーションすると主張する。
命名チャンネルの削除は、モデルが行ごとの記述に回帰する、要約のような意図レベルのタスクを著しく低下させる。
論文 参考訳(メタデータ) (2025-10-03T16:53:13Z) - Measuring how changes in code readability attributes affect code quality evaluation by Large Language Models [2.3204178451683264]
コード可読性はコード品質の主要な側面の1つであり、識別子名、コメント、コード構造、標準への準拠といった様々な特性に影響を受けています。
本稿では,Large Language Models (LLMs) を用いて,その可読性に関連するコード品質特性を標準化され再現可能で一貫した方法で評価する。
論文 参考訳(メタデータ) (2025-07-05T11:08:03Z) - Memorize or Generalize? Evaluating LLM Code Generation with Code Rewriting [54.48306552577881]
大規模な言語モデル(LLM)は、主にメモリ化(トレーニングデータの大きな部分を複製または再利用する)と一般化(Generalization)を併用している、と我々は主張する。
既存の評価は、表面/構造的類似性を無視し、繰り返しコードの良質な再利用を有害なリコールと記憶タスクの正しさで混同する。
そこで我々は,2つの信号を組み合わせた正規化スコアである覚書リスク指標(MRI)を提案する。 (i) モデルが元の地平解とどのように類似しているか, (ii) 元のタスクから書き換えされたタスクにどの程度の性能が低下するか。
論文 参考訳(メタデータ) (2025-03-04T05:39:24Z) - Towards preserving word order importance through Forced Invalidation [80.33036864442182]
事前学習された言語モデルは単語の順序に敏感であることを示す。
我々は,単語順序の重要性を維持するために強制的無効化を提案する。
実験の結果,強制的無効化は単語順に対するモデルの感度を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2023-04-11T13:42:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。