論文の概要: ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation
- arxiv url: http://arxiv.org/abs/2607.00711v1
- Date: Wed, 01 Jul 2026 09:58:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.838126
- Title: ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation
- Title(参考訳): ClarifyCodeBench: コード生成の曖昧な要件を明確にするためのLLMの評価
- Abstract要約: 我々はClarifyCodeBenchを紹介した。ClarifyCodeBenchは、要求のあいまいさを解決するためのLarge Language Modelsの機能を評価するための、インタラクティブなベンチマークだ。
ClarifyCodeBenchを用いて、6つの最先端LCMの体系的評価を行う。
1) 能力の疎結合: 強いコード生成性能は本質的には効果的な要求の明確化に変換されない; 2) 推論パラドックス: 計算思考の増大はコードの正確性を高めるが、あいまいさの識別において限界的な利益をもたらす。
- 参考スコア(独自算出の注目度): 54.788849448970154
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models have emerged as programming assistants. However, the efficacy of code generation is constrained by the quality of input requirements, which are frequently ambiguous, incomplete, or underspecified. While LLMs excel at one-shot code synthesis, their ability to proactively clarify intent remains underexplored, as a critical trait for robust software engineering. Existing benchmarks largely overlook this interactive bottleneck, assuming perfectly specified prompts that do not reflect the iterative nature of requirement elicitation. To bridge this gap, we introduce ClarifyCodeBench, a novel interactive benchmark for evaluating LLMs' capability in resolving requirement ambiguity. Constructed from real-world programming tasks, ClarifyCodeBench features high-quality manual annotations, including N unique ambiguity types, associated clarification questions, and corresponding ground-truth answers. Furthermore, we formalize two rigorous metrics to assess the interaction quality: Turn-discounted Key Question Rate, which penalizes inefficient questioning, and Optimal Round Adherence, which measures the precision of the elicitation process. We conduct a systematic evaluation of six state-of-the-art LLMs using ClarifyCodeBench. Our empirical results yield three critical insights: 1) Capability Decoupling: Strong code generation performance does not inherently translate to effective requirement clarification; 2) The Reasoning Paradox: While increased computational thinking enhances code correctness, it yields marginal gains in identifying ambiguities; 3) The Multi-ambiguity Ceiling: LLMs' clarification performance degrades sharply as the density of ambiguities increases, revealing a significant bottleneck in handling complex, real-world specifications. Our work underscores the necessity for future AI4SE research to transition from static synthesis to interactive elicitation.
- Abstract(参考訳): 大規模言語モデルはプログラミングアシスタントとして登場した。
しかし、コード生成の有効性は、しばしば曖昧、不完全、不特定である入力要求の品質によって制約される。
LLMはワンショットのコード合成に優れていますが、その意図を積極的に明確化する能力は、堅牢なソフトウェアエンジニアリングにとって重要な特徴として、未発見のままです。
既存のベンチマークは、要求推論の反復的な性質を反映しない完全に指定されたプロンプトを仮定して、このインタラクティブなボトルネックを概ね見落としている。
このギャップを埋めるために、私たちはClarifyCodeBenchを紹介します。
ClarifyCodeBenchは、現実世界のプログラミングタスクから構築され、Nの特異なあいまいさタイプ、関連する明確化の質問、それに対応する接地真実の回答など、高品質なマニュアルアノテーションを備えている。
さらに,2つの厳密な指標を定式化して,非効率な質問をペナルティ化するターンカウントキー質問率(Turn-discounted Key Question Rate)と,抽出過程の精度を計測する最適ラウンドアジェンス(Optimal Round Adherence)のインタラクション品質を評価する。
ClarifyCodeBenchを用いて、6つの最先端LCMの体系的評価を行う。
私たちの経験的な結果は3つの重要な洞察をもたらします。
1) 能力の疎結合: 強いコード生成性能は、本質的には効果的な要求の明確化に変換しません。
2) 推論パラドックス(Reasoning Paradox): 計算思考の増大はコードの正しさを高めるが,あいまいさの識別において限界ゲインをもたらす。
3)多言語セリング: LLMの明確化性能はあいまいさの密度が増大するにつれて急激に低下し,複雑で現実的な仕様を扱う上で重要なボトルネックが浮かび上がっている。
我々の研究は、将来のAI4SE研究が静的合成からインタラクティブなエリケーションへ移行する必要性を浮き彫りにしている。
関連論文リスト
- The Imitation Game: When LLMs Learn to Reason Like Programs via Code-Centric Reasoning Data Synthesis [50.473217152006875]
MIMICは、データ合成を推論するための厳密な媒体として実行可能なコードを活用するフレームワークである。
MIMICは、ナラティブ融合、コード誘導テスト合成、動的コードインスツルメンテーションを通じて、アルゴリズムを検証可能な推論軌道に変換する。
提案手法は, 一般的な推論, 複雑な数学的ベンチマーク, きめ細かい決定論的タスクにおいて, 精度を著しく向上させる。
論文 参考訳(メタデータ) (2026-09-13T17:04:16Z) - A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation [59.98516959731531]
抽象推論能力は、抽象ルールを抽出し適用するためのLLMの知性と能力を反映する。
既存のベンチマークは、高価な手作業のアノテーション、そのスケールの制限、あるいは真の推論ではなく暗記のリスク測定に頼っている。
我々はA2RBenchという名の自動パイプラインを導入し、生成、拡張、評価、分析を行う。
論文 参考訳(メタデータ) (2026-05-17T06:14:20Z) - Assessing the Impact of Requirement Ambiguity on LLM-based Function-Level Code Generation [14.755517753769837]
Orchidは、曖昧な要求で特別に設計された最初のコード生成ベンチマークです。
これは、語彙、構文、意味、曖昧さの4つの異なる種類の曖昧さをカバーする1,304の関数レベルタスクからなる。
この結果から,高度モデルにおいて最も顕著な負の効果が観察され,不明瞭さは全ての評価LCMの性能を常に低下させることが示された。
論文 参考訳(メタデータ) (2026-04-23T10:07:33Z) - Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy [62.32144504442516]
SOTA LLMが形式言語の構造的・階層的複雑性を把握できるかどうかは不明である。
ChomskyBench はchomsky Hierarchy のレンズを通して LLM を体系的に評価するためのベンチマークである。
ChomskyBenchは、各レベルで機能をテストするように設計された、言語認識と生成タスクの包括的なスイートで構成されている。
論文 参考訳(メタデータ) (2026-04-03T04:06:39Z) - Operational Robustness of LLMs on Code Generation [2.9232837969697965]
現在、大規模言語モデル(LLM)のためのソフトウェア開発において、プログラムコードを生成するために使われるのが一般的である。
本稿では,LLMがコーディングタスクの記述の変化にどれほど敏感であるかを考察する。
このロバスト性を評価するための既存の技術は、自然言語記述の入力データ空間が離散的であるため、コード生成には適さない。
論文 参考訳(メタデータ) (2026-02-21T11:21:13Z) - OPT-Engine: Benchmarking the Limits of LLMs in Optimization Modeling via Complexity Scaling [13.57588221678224]
大規模言語モデル(LLM)は、最適化モデリングの驚くべき進歩を示している。
自動定式化と問題解決におけるそれらの能力の境界は、まだよく理解されていない。
OPT-ENGINEは、制御可能でスケーラブルな難易度を持つ最適化モデルにおいて、LCMを評価するために設計されたベンチマークフレームワークである。
論文 参考訳(メタデータ) (2026-01-09T09:22:33Z) - Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications [0.6813925418351435]
大規模言語モデル(LLM)はソフトウェア開発において不可欠なツールとなり、要求工学、コード生成、レビュータスクに広く利用されている。
本稿では,LLMが自然言語の要求に適合するかどうかを評価する上で,体系的に失敗していることを明らかにする。
以上の結果から,LCMは要件を満たすことのできないコード実装や潜在的な欠陥を含むコード実装を誤って分類することが多いことが判明した。
論文 参考訳(メタデータ) (2025-08-17T13:07:26Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z) - Can Code Language Models Learn Clarification-Seeking Behaviors? [4.788534218705066]
ClarifyCoderは,合成データ生成と命令調整を行うフレームワークである。
ClarifyCoderは,あいまいなタスクに対して,コミュニケーション率63%,質問率52%を達成した。
論文 参考訳(メタデータ) (2025-04-23T00:34:39Z) - Interactive Agents to Overcome Ambiguity in Software Engineering [61.40183840499932]
AIエージェントは、あいまいで不明確なユーザー指示に基づいて、タスクを自動化するためにますますデプロイされている。
不安定な仮定をし、明確な質問をしないことは、最適以下の結果につながる可能性がある。
対話型コード生成設定において,LLMエージェントが不明瞭な命令を処理する能力について,プロプライエタリモデルとオープンウェイトモデルを評価して検討する。
論文 参考訳(メタデータ) (2025-02-18T17:12:26Z) - Evaluating LLMs' Mathematical and Coding Competency through Ontology-guided Interventions [47.83142414018448]
算術的推論とコード生成という,2つの一般的な推論タスクに注目します。
i) 数学やコーディング問題に対する摂動の一般的なオントロジー, (ii) 摂動を応用するための半自動手法, (iii) 2つのデータセットを紹介する。
混乱した質問に対して、すべてのモデルで大幅なパフォーマンス低下を示します。
論文 参考訳(メタデータ) (2024-01-17T18:13:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。