論文の概要: Underspecification does not imply Incoherence: The Risks of Semantic Collapse in Coding Models
- arxiv url: http://arxiv.org/abs/2607.01953v1
- Date: Thu, 02 Jul 2026 09:43:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.777507
- Title: Underspecification does not imply Incoherence: The Risks of Semantic Collapse in Coding Models
- Title(参考訳): 非特異性は不整合を示唆しない:符号化モデルにおける意味的崩壊のリスク
- Abstract要約: 大きな言語モデル(LLM)は、タスク記述が明確で正確なときにコードを生成するのにますます効果的になっています。
しかし、ユーザが提供するタスク記述は曖昧、不完全、あるいは矛盾しがちであり、意図されたプログラム動作の重要な側面は明確でないままである。
LLMはしばしば、タスク記述の1つの誤った解釈に分解され、一貫性はあるが行動的に不整合なコードを生成する。
- 参考スコア(独自算出の注目度): 6.72873429875663
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large Language Models (LLMs) have become increasingly effective at generating code when task descriptions are clear and precise. Yet, in practice, user-provided task descriptions are often ambiguous, incomplete, or contradictory, leaving critical aspects of the intended program behavior underspecified. In such cases, multiple behaviorally distinct interpretations may satisfy the description equally well, yet semantically differ in ways that matter/affect the user intent. A natural expectation, often assumed by researchers, is that prompt underspecification manifests as incoherence: When asked multiple times, an LLM produces multiple semantically distinct implementations reflecting the ambiguity of the task description. In this paper, we challenge this assumption. We find that LLMs frequently collapse onto a single incorrect interpretation of the task description, consistently generating coherent but behaviorally misaligned code. We term this failure mode detrimental semantic collapse and find that it affects over 10% of tasks in MBPP, 3% in HumanEval, and 32% of LiveCodeBench, all benchmarks assumed to be well-specified. By deliberately injecting underspecification issues in the benchmark prompts, the rate rises to over 5 times, exposing a fundamental blind spot in disambiguation and correctness estimation techniques that rely on incoherence as a proxy for prompt underspecification.
- Abstract(参考訳): 大きな言語モデル(LLM)は、タスク記述が明確で正確なときにコードを生成するのにますます効果的になっています。
しかし、実際には、ユーザが提供するタスク記述は曖昧、不完全、あるいは矛盾することが多く、意図されたプログラムの振る舞いの重要な側面は明確でないままである。
このような場合、複数の行動学的に異なる解釈が記述を等しく満足させるが、意味論的にはユーザの意図に影響を及ぼす方法が異なる。
研究者によってしばしば想定される自然な期待は、素早い不明瞭さが不整合として現れることである: 何度も尋ねると、LCMはタスク記述の曖昧さを反映した複数の意味的に異なる実装を生成する。
本稿では,この仮定に挑戦する。
LLMはしばしば、タスク記述の1つの誤った解釈に分解され、一貫性はあるが行動的に不整合なコードを生成する。
この障害モードの劣化はMBPPのタスクの10%以上、HumanEvalの3%、LiveCodeBenchの32%に影響している。
ベンチマークプロンプトに不明瞭な問題を意図的に注入することで、このレートは5回以上上昇し、不明瞭さと正当性評価の基本的な盲点が明らかになる。
関連論文リスト
- ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation [54.788849448970154]
我々はClarifyCodeBenchを紹介した。ClarifyCodeBenchは、要求のあいまいさを解決するためのLarge Language Modelsの機能を評価するための、インタラクティブなベンチマークだ。
ClarifyCodeBenchを用いて、6つの最先端LCMの体系的評価を行う。
1) 能力の疎結合: 強いコード生成性能は本質的には効果的な要求の明確化に変換されない; 2) 推論パラドックス: 計算思考の増大はコードの正確性を高めるが、あいまいさの識別において限界的な利益をもたらす。
論文 参考訳(メタデータ) (2026-07-01T09:58:59Z) - Small Language Model Helps Resolve Semantic Ambiguity of LLM Prompt [13.863963355859175]
本稿では、明示的なプロンプト曖昧化による事前推論プロンプト最適化機構を提案する。
我々は、プロンプト内のセマンティックリスクを特定し、それらのマルチパースペクティブ一貫性を確認し、セマンティックコンフリクトを解決する。
本手法は, 推理性能を0.02ドルで2.5ポイント向上させる。
論文 参考訳(メタデータ) (2026-04-25T12:13:26Z) - Assessing the Impact of Requirement Ambiguity on LLM-based Function-Level Code Generation [14.755517753769837]
Orchidは、曖昧な要求で特別に設計された最初のコード生成ベンチマークです。
これは、語彙、構文、意味、曖昧さの4つの異なる種類の曖昧さをカバーする1,304の関数レベルタスクからなる。
この結果から,高度モデルにおいて最も顕著な負の効果が観察され,不明瞭さは全ての評価LCMの性能を常に低下させることが示された。
論文 参考訳(メタデータ) (2026-04-23T10:07:33Z) - Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States [14.780400014944926]
大規模言語モデル(LLM)は多くのタスクで高いパフォーマンスを達成するが、自動回帰復号化による高い推論遅延に悩まされる。
トークンの代わりにセマンティックシークエンス全体を検証するセマンティックス(SemanticSpec)を提案する。
論文 参考訳(メタデータ) (2026-02-03T16:30:30Z) - Hidden in Plain Sight: Reasoning in Underspecified and Misspecified Scenarios for Multimodal LLMs [28.913007638707427]
マルチモーダルな大規模言語モデル(MLLM)は、オープンエンドの現実世界の環境にますます多くデプロイされている。
本稿では,現在のMLLMが暗黙の推論シナリオをどのように扱うのかを体系的に分析する。
モデルは、必要な知覚と推論スキルを持っている場合でも、隠れた問題にしばしば遭遇しない。
論文 参考訳(メタデータ) (2025-05-30T21:47:28Z) - A Framework for Evaluating LLMs Under Task Indeterminacy [49.298107503257036]
大規模言語モデル(LLM)の評価は、評価コーパスの各項目に対して単一の正しい応答(ゴールドラベル)があると仮定することが多い。
タスク不確定性の下でLLMを評価するためのフレームワークを開発する。
論文 参考訳(メタデータ) (2024-11-21T00:15:44Z) - Contrastive Instruction Tuning [61.97704869248903]
意味論的に等価な命令-インスタンスペア間の類似性を最大化するために、コントラスト命令チューニングを提案する。
PromptBenchベンチマークの実験によると、CoINはLLMの頑健さを一貫して改善し、文字、単語、文、意味のレベルを平均して2.5%の精度で変化させる。
論文 参考訳(メタデータ) (2024-02-17T00:09:32Z) - Clarify When Necessary: Resolving Ambiguity Through Interaction with LMs [58.620269228776294]
そこで本稿では,ユーザに対して,あいまいさを解消するためのタスク非依存のフレームワークを提案する。
我々は3つのNLPアプリケーション(質問応答、機械翻訳、自然言語推論)にまたがるシステムを評価する。
インテントシムは堅牢であり、幅広いNLPタスクやLMの改善を実証している。
論文 参考訳(メタデータ) (2023-11-16T00:18:50Z) - Simple Linguistic Inferences of Large Language Models (LLMs): Blind Spots and Blinds [59.71218039095155]
我々は,ほとんどの人間が自明に感じる単純な推論タスクにおいて,言語理解能力を評価する。
我々は, (i) 文法的に特定された含意, (ii) 不確実性のある明らかな副詞を持つ前提, (iii) 単調性含意を目標とする。
モデルはこれらの評価セットに対して中程度から低い性能を示す。
論文 参考訳(メタデータ) (2023-05-24T06:41:09Z) - PROMPT WAYWARDNESS: The Curious Case of Discretized Interpretation of
Continuous Prompts [99.03864962014431]
目標タスクの微調整連続プロンプトは、フルモデルの微調整に代わるコンパクトな代替品として登場した。
実際には、連続的なプロンプトによって解決されたタスクと、最も近い隣人との間の「方向」の挙動を観察する。
論文 参考訳(メタデータ) (2021-12-15T18:55:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。