論文の概要: From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion
- arxiv url: http://arxiv.org/abs/2604.01849v1
- Date: Thu, 02 Apr 2026 10:03:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:10.669627
- Title: From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion
- Title(参考訳): GuessingからPlaceholdingへ - 不確実性を認識したコード補完のためのコスト理論フレームワーク
- Abstract要約: 本研究では,高エントロピー位置において明示的なプレースホルダーを戦略的に出力することにより,ハードコンプリート(HC)を拡張した協調フレームワークを提案する。
我々は、実世界の編集ログからトレーニングデータを構築し、強化学習のためのコストベースの報酬関数を設計することで、このフレームワークをインスタンス化する。
私たちの研究は、不確実性を認識したコード補完のための理論的基盤と実践的なトレーニングフレームワークの両方を提供し、適応的棄権がエンドツーエンドで学習できることを示しています。
- 参考スコア(独自算出の注目度): 11.596110180018838
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Large Language Models (LLMs) have demonstrated exceptional proficiency in code completion, they typically adhere to a Hard Completion (HC) paradigm, compelling the generation of fully concrete code even amidst insufficient context. Our analysis of 3 million real-world interactions exposes the limitations of this strategy: 61% of the generated suggestions were either edited after acceptance or rejected despite exhibiting over 80% similarity to the user's subsequent code, suggesting that models frequently make erroneous predictions at specific token positions. Motivated by this observation, we propose Adaptive Placeholder Completion (APC), a collaborative framework that extends HC by strategically outputting explicit placeholders at high-entropy positions, allowing users to fill directly via IDE navigation. Theoretically, we formulate code completion as a cost-minimization problem under uncertainty. Premised on the observation that filling placeholders incurs lower cost than correcting errors, we prove the existence of a critical entropy threshold above which APC achieves strictly lower expected cost than HC. We instantiate this framework by constructing training data from filtered real-world edit logs and design a cost-based reward function for reinforcement learning. Extensive evaluations across 1.5B--14B parameter models demonstrate that APC reduces expected editing costs from 19% to 50% while preserving standard HC performance. Our work provides both a theoretical foundation and a practical training framework for uncertainty-aware code completion, demonstrating that adaptive abstention can be learned end-to-end without sacrificing conventional completion quality.
- Abstract(参考訳): LLM(Large Language Models)は、コード補完において例外的な習熟度を示しているが、一般的にはハードコンプリート(HC)パラダイムに準拠しており、状況が不十分な場合でも、完全な具体的なコードの生成を誘惑する。
生成した提案の61%は、ユーザのその後のコードと80%以上の類似性を示したにもかかわらず、承認後に編集されたか、拒否された。
提案するアダプティブ・プレースホルダー・コンプリート(Adaptive Placeholder Completion, APC)は,アダプティブ・プレースホルダーを高エントロピーな位置に戦略的に出力することで,IDEナビゲーションを介して直接埋めることができる。
理論的には、不確実性の下でのコスト最小化問題としてコード補完を定式化する。
APC が HC よりも厳密に低い期待コストを達成できる臨界エントロピーしきい値の存在が証明された。
我々は、実世界の編集ログからトレーニングデータを構築し、強化学習のためのコストベースの報酬関数を設計することで、このフレームワークをインスタンス化する。
1.5B--14Bパラメータモデルに対する広範囲な評価により、APCは標準HC性能を維持しながら、期待される編集コストを19%から50%削減することを示した。
我々の研究は、不確実性を認識したコード補完のための理論的基礎と実践的なトレーニングフレームワークの両方を提供し、適応的棄却が従来の完了品質を犠牲にすることなくエンドツーエンドで学習できることを実証している。
関連論文リスト
- SuCo: Sufficiency-guided Continuous Adaptive Reasoning [59.17222918775686]
大型共振モデル(LRM)は、しばしば超長鎖(CoT)を生成する。
この非効率を緩和するための既存の取り組みは、通常、個別の推論モードや固定予算層に依存します。
我々は,CoTトラジェクトリの最短接頭辞として定義された最小サフィシエント CoT (MSC) を導入する。
論文 参考訳(メタデータ) (2026-06-16T08:52:15Z) - Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation [50.23374353859762]
多様な単発デモを収集することで「最大限のカバレッジ」を達成できる。
我々は、この現象を包括的-密度トレードオフとして定式化する。
Anchor-Centric Adaptation (ACA) は、2段階のフレームワークで、まずコアアンカーでの繰り返しデモを通じてポリシースケルトンを安定化し、次に教師力によるエラーマイニングと制約付き残差更新を通じて高リスク境界までカバー範囲を広げる。
論文 参考訳(メタデータ) (2026-05-08T07:35:24Z) - Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning [52.48243762705385]
Chain of Uncertain Rewards (CoUR)は、大きな言語モデル(LLM)を統合して報酬関数の設計と評価を効率化する新しいフレームワークである。
我々は、CoURがより良い性能を実現し、報酬評価のコストを大幅に削減できることを示します。
論文 参考訳(メタデータ) (2026-04-15T05:44:14Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning [11.522192050185568]
大規模言語モデルは,「認知的幻覚」と「認知的崩壊」というシステム的失敗モードに悩まされる
実世界95の中国Aシェア年次レポートから構築したデータセットをベースとした,堅牢な評価フレームワークであるCognitive Complexity Benchmark(CCB)を紹介する。
本稿では,これらの障害に対処するための反復的デュアル・パース・ファイナンシャル・PoTフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T01:33:33Z) - CIFE: Code Instruction-Following Evaluation [3.941243815951084]
我々は1,000のPythonタスクのベンチマークを導入し、それぞれが13のカテゴリにまたがる平均7つの開発者指定制約とペアリングした。
補完的付着度を用いて14個のオープンソース・クローズド・ソース・モデルを評価し,C2Aスコア(C2A Score)を提案する。
その結果、部分的満足度と厳密な満足度の間には実質的なギャップがみられ、強いモデルは90%以上の部分的密着性を達成する一方、厳密な密着性は39-66%に留まった。
論文 参考訳(メタデータ) (2025-12-19T09:43:20Z) - Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving [65.02106674311908]
本稿では,マルチラウンド階層的推論を行う長期水平数学エージェントであるIntern-S1-MOを紹介する。
コンパクトメモリをレムマの形で維持することにより、Intern-S1-MOはレムマリッチ推論空間をより自由に探索することができる。
実験の結果、インターンS1-MOはIMO2025の非幾何学的問題で35点中26点を得ることができ、銀メダリストのパフォーマンスに匹敵することがわかった。
論文 参考訳(メタデータ) (2025-12-11T15:26:28Z) - Certainty-Guided Reasoning in Large Language Models: A Dynamic Thinking Budget Approach [0.15749416770494704]
CGR(Certainty-Guided Reasoning)はトークン使用量を削減するとともに,ベースライン精度を向上させる。
CGRは、確実なしきい値と効率の間の調整可能なトレードオフによって、数百万のトークンを集約的に排除することができる。
信頼性を推論プロセスに統合することにより、CGRは大きな推論言語モデルをより適応的で信頼性があり、リソース効率が良いものにする。
論文 参考訳(メタデータ) (2025-09-09T14:57:15Z) - Additive Distributionally Robust Ranking and Selection [0.8283940114367679]
そこで本研究では,$k + m - 1$の事前仮説クリティカルシナリオのみをサンプリングすることを目的とした,単純な加算割当(AA)手順を提案する。
AAが一貫したものであり、驚くべきことに、最も強い意味で付加性を達成することを証明します。
結果は、DRR&Sの加法構造に対する新しい、そして反直観的な洞察を与える。
論文 参考訳(メタデータ) (2025-09-07T17:36:29Z) - Supervised Optimism Correction: Be Confident When LLMs Are Sure [91.7459076316849]
教師付き微調整とオフライン強化学習の間には,新たな理論的関係が確立されている。
広く使われているビームサーチ法は、許容できない過度な最適化に悩まされていることを示す。
本稿では,トークンレベル$Q$-value推定のための簡易かつ効果的な補助的損失を導入したSupervised Optimism Correctionを提案する。
論文 参考訳(メタデータ) (2025-04-10T07:50:03Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Robust Constrained Reinforcement Learning [21.316736188238806]
制約付き強化学習は、ユーティリティやコストの制約による期待される報酬を最大化することである。
モデル不確実性下での頑健な制約付き強化学習の枠組みを提案する。
目的は、不確実性セットにおけるすべてのMDPに対して、ユーティリティ/コストの制約が満たされることを保証し、不確実性セットに対する最悪の報酬パフォーマンスを最大化することである。
論文 参考訳(メタデータ) (2022-09-14T18:29:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。