論文の概要: Beyond "What to Retrieve": Uncertainty in Retrieval-Augmented Code Generation
- arxiv url: http://arxiv.org/abs/2607.24884v2
- Date: Wed, 29 Jul 2026 08:07:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.717049
- Title: Beyond "What to Retrieve": Uncertainty in Retrieval-Augmented Code Generation
- Title(参考訳): What to Retrive"を超えて: Retrieval-Augmented Code Generationの不確実性
- Abstract要約: リポジトリレベルのコード生成は、その関連性、互換性、完全性が本質的に不確実である不均一な証拠に依存している。
我々は、ソース固有の不確実性を推定し、生成、検証、修復をガイドする不確実性認識フレームワークであるOpenCoderを紹介します。
- 参考スコア(独自算出の注目度): 4.476374205849672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Repository-level code generation relies on heterogeneous evidence whose relevance, compatibility, and completeness are inherently uncertain. Similar-code examples, repository context, and project-specific APIs may provide complementary information, but can also introduce noisy, redundant, or conflicting signals. Existing retrieval-augmented approaches primarily optimize retrieval relevance without explicitly modeling how uncertainty in retrieved evidence affects downstream generation. We introduce OpenCoder, an uncertainty-aware framework that estimates source-specific uncertainty, uses it to filter and rank heterogeneous evidence, and guides generation, verification, and repair. A factorial analysis over API knowledge, repository context, and similar-code evidence reveals no universal additive source ranking; instead, significant cross-source interactions depend on the accompanying evidence and LLM backend. On an expanded 32-task RepoExec-inline evaluation, OpenCoder improves GPT selected-output correctness over Baseline RAG from 56.25\% to 78.13\%. However, it matches a verification-and-repair control, and the corresponding Gemini improvement is not statistically supported, indicating backend-dependent benefits. Target-aware API refinement also substantially improves API-set retrieval. These findings support treating uncertainty as an actionable control signal for repository-level retrieval, verification, and repair.
- Abstract(参考訳): リポジトリレベルのコード生成は、その関連性、互換性、完全性が本質的に不確実である不均一な証拠に依存している。
類似コードの例、リポジトリコンテキスト、プロジェクト固有のAPIは相補的な情報を提供するが、ノイズ、冗長、あるいは競合するシグナルを導入することもできる。
既存の検索拡張アプローチは主に、検索された証拠の不確実性が下流生成にどのように影響するかを明示的にモデル化することなく、検索妥当性を最適化する。
我々は、ソース固有の不確実性を推定する不確実性認識フレームワークであるOpenCoderを紹介し、不均一な証拠をフィルタリングしてランク付けし、生成、検証、修復をガイドする。
API知識、リポジトリコンテキスト、および類似コードエビデンスに関する要因分析では、普遍的な追加的なソースランキングは示されていない。
拡張された32タスクのRepoExec-inline評価において、OpenCoderはベースラインRAGのGPT選択出力精度を56.25\%から78.13\%に改善した。
しかし、これは検証と修復の制御と一致し、対応するGeminiの改善は統計的にサポートされておらず、バックエンドに依存したメリットを示している。
ターゲット対応のAPIリファインメントもAPIセットの検索を大幅に改善する。
これらの知見は, リポジトリレベルの検索, 検証, 修復のための実用的な制御信号として, 不確実性の治療を支援する。
関連論文リスト
- SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering [8.538563236020947]
SAFE-Gは構造対応のFiveence-Guided Generationフレームワークである。
正確な証拠のローカライズと信頼できる推論を可能にする。
従来の手法を8.9%と3.5%で上回っている。
論文 参考訳(メタデータ) (2026-08-22T06:34:53Z) - DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection [16.007199928732614]
DREAはリポジトリレベルの脆弱性検出のための仮説駆動型フレームワークである。
ゴール指向コンテキスト取得は、この設計における検出改善の主な原因である。
RepoPairBenchは,実世界のプロジェクトから検証済みのPython脆弱性修正ペアの,リポジトリを基盤としたベンチマークである。
論文 参考訳(メタデータ) (2026-07-15T04:49:05Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - Towards Dependable Retrieval-Augmented Generation Using Factual Confidence Prediction [0.28932261919131014]
検索プロセスの事実性に関する有意義な信頼度と生成した回答を関連付けることが重要である。
本稿では,新たな2段階の手法を提案する。
我々の研究は、幅広い自然言語産業応用のための新しいタイプの認証されたRAGシステムを確立するのに役立ちます。
論文 参考訳(メタデータ) (2026-05-04T11:28:19Z) - Skill-RAG: Failure-State-Aware Retrieval Augmentation via Hidden-State Probing and Skill Routing [12.09179106162719]
本稿では,隠れ状態のプローバとプロンプトベースのスキルルータを結合した障害対応RAGフレームワークであるSkill-RAGを提案する。
実験により,Skill-RAGは多ターン検索後に持続するハードケースの精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-04-17T07:25:43Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - PruneRAG: Confidence-Guided Query Decomposition Trees for Efficient Retrieval-Augmented Generation [19.832367438725306]
PruneRAGは、安定かつ効率的な推論を行うために構造化されたクエリ分解ツリーを構築する。
我々は,ゴールデンエビデンスを回収するが正しく使用しない事例を定量化するための指標として,エビデンス予測率を定義した。
論文 参考訳(メタデータ) (2026-01-16T06:38:17Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAG [51.120170062795566]
本稿では,問合せが知識境界外にある場合の"I don't know"で応答する機能を備えたRAGシステムを実現するためのDTAを提案する。
DTAは適切な棄権と精度のバランスをとり、検索強化システムの信頼性と信頼性を高める。
論文 参考訳(メタデータ) (2025-05-27T08:21:21Z) - ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation [91.20492150248106]
本研究では,不誠実な生成の背後にある内部メカニズムを解明し,不均等に活性化される中深度フィードフォワードネットワーク(FFN)のサブセットを同定する。
本研究では,不信感関連FFNの活性化を抑制することにより,文脈的忠実度を向上させるフレームワークであるParametric Knowledge Mutingを提案する。
実験結果から,ParamMuteはCoFaithfulQAと確立されたConFiQAベンチマークの両方の信頼度を大幅に向上し,パラメトリックメモリへの依存度を大幅に低下させることが示された。
論文 参考訳(メタデータ) (2025-02-21T15:50:41Z) - TrustRAG: Enhancing Robustness and Trustworthiness in Retrieval-Augmented Generation [31.231916859341865]
TrustRAGは、生成のために取得される前に、悪意のある、無関係なコンテンツを体系的にフィルタリングするフレームワークである。
TrustRAGは、検索精度、効率、攻撃抵抗を大幅に改善する。
論文 参考訳(メタデータ) (2025-01-01T15:57:34Z) - Contrastive Learning to Improve Retrieval for Real-world Fact Checking [84.57583869042791]
ファクト・チェッキング・リランカ(Contrastive Fact-Checking Reranker, CFR)を提案する。
我々はAVeriTeCデータセットを活用し、証拠文書からの人間による回答とクレームのサブクエストを注釈付けする。
データセットの精度は6%向上した。
論文 参考訳(メタデータ) (2024-10-07T00:09:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。