論文の概要: Candidate-Constrained Retrieval-Augmented Generation for LongEval-RAG: System Design and Empirical Analysis
- arxiv url: http://arxiv.org/abs/2607.04008v1
- Date: Sat, 04 Jul 2026 20:07:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.790418
- Title: Candidate-Constrained Retrieval-Augmented Generation for LongEval-RAG: System Design and Empirical Analysis
- Title(参考訳): 長期RAGのための候補制約付き検索生成:システム設計と実証分析
- Authors: Yingdong Yang, Haijian Wu,
- Abstract要約: 本稿では,LongEval-RAGのための候補制約付き検索拡張生成システムを提案する。
プライマリ・オーガナイザ・アセスメントと補足的自己生成診断プロトコルを用いて,10種類のパイプライン変異を評価した。
- 参考スコア(独自算出の注目度): 1.0312968200748118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a candidate-constrained retrieval-augmented generation system for LongEval-RAG, where each query is associated with an organizer-provided candidate set and all retrieved evidence and final citations must remain within that set. The system combines deterministic provenance tracking with passage-based retrieval, deterministic query expansion, pseudo-relevance feedback (PRF), reciprocal rank fusion (RRF), lightweight evidence reranking, citation-aware evidence aggregation, and optional MiniLM sentence reranking. We evaluate ten pipeline variants using a primary organizer evaluation and a supplementary self-generated diagnostic protocol. The primary evaluation shows that the strongest balanced variant is rule-minilm: a rule-based chunking pipeline with query expansion, PRF, RRF, reranking, citation prior, and late MiniLM sentence selection. This variant obtains the highest BERTScore, retrieval precision, nugget coverage, and average grade among our submissions. The result suggests that the main gain does not come from more complex semantic or topic-shift chunking, but from pairing stable rule-based evidence units with sentence-level neural selection before generation. The supplementary LLM-judge evaluation remains useful for early diagnosis and additional analysis, but it emphasizes different systems than the primary gold-answer and nugget-based evaluation, highlighting the need for multi-metric RAG evaluation.
- Abstract(参考訳): 本稿では,LongEval-RAGの候補制約付き検索拡張生成システムを提案する。
このシステムは、決定論的プロヴァンス追跡とパスベースの検索、決定論的クエリ拡張、擬似関連フィードバック(PRF)、相互ランク融合(RRF)、軽量エビデンス更新、引用認識エビデンス集計、オプションのMiniLM文再分類とを組み合わせている。
プライマリ・オーガナイザ・アセスメントと補足的自己生成診断プロトコルを用いて,10種類のパイプライン変異を評価した。
第一の評価では、最強のバランスの取れた変種はルール最小であり、クエリ拡張、PRF、RF、再ランク、引用前、後続のMinimLM文選択を含むルールベースのチャンキングパイプラインである。
この変種は,提案論文の中で,最も高いBERTSスコア,検索精度,ナゲットカバレッジ,および平均グレードを取得する。
この結果は、より複雑な意味論やトピックシフトのチャンクではなく、安定な規則に基づくエビデンスユニットと、生成前の文レベルのニューラルセレクションとのペアリングから得られることを示唆している。
LLM-judge の補助的評価は早期診断と追加分析に有用であるが,本手法は一次ゴールドアンサーおよびナゲットに基づく評価とは異なるシステムを強調し,マルチメトリックRAG 評価の必要性を強調している。
関連論文リスト
- Lost in the Evidence? Reproducing Document Position and Context Size Effects in RAG [3.597778914286147]
Retrieval-Augmented Generation (RAG) システムは、取得した文書がモデルの入力コンテキストに入力されることに依存する。
先行研究は、中年期の喪失や関連する長文現象のような位置に基づく効果を報告している。
トピックサンプリングが分散の主要な原因であることを示し、小さなトピックセットはオーダリング効果を誇張することができる。
また,より現実的なRAGシナリオについて検討した。
論文 参考訳(メタデータ) (2026-05-26T14:44:19Z) - ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking [21.792889952064527]
本稿では,Evidence-Coupled Policy Optimization (ECPO)について紹介する。
ECPOはスケルトンアライメント、引数一貫性、オプショングラフ機能から解釈可能なトラジェクトリ報酬を学習する。
次に、リストワイドランキングユーティリティ、スパンレベル証明書の妥当性、ラベルのない決定論的検証によって計算されたエビデンスサイクル報酬の3つの組み合わせによる制約付きポリシーを最適化する。
論文 参考訳(メタデータ) (2026-05-21T04:42:34Z) - CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging [95.02210956333374]
本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:59:19Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines [48.34524144147475]
LLM(Large Language Models)は、現代の検索やRAG(Retrieval-Augmented Generation)パイプラインにおいて、クエリ再構成を至るところで実現している。
本稿では、アドホック検索とエンドツーエンドRAGをまたいで、クエリ性能予測(QPP)を異種選択のメカニズムとして検討する。
論文 参考訳(メタデータ) (2026-04-24T15:36:40Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning [47.963236269307735]
リランカはRetrieval-Augmented Generationの検索結果の精錬において重要な役割を果たす。
現在のリグレードモデルは通常、ダウンストリーム生成プロセスから切り離された静的な人間アノテートされた関連ラベルに独立して最適化される。
本稿では,LLMの生成品質と直接整合する強化学習フレームワークであるReRanking Preference Optimization(RRPO)を紹介する。
論文 参考訳(メタデータ) (2026-04-02T14:19:47Z) - FAIR-RAG: Faithful Adaptive Iterative Refinement for Retrieval-Augmented Generation [0.0]
本稿では、標準的なRAGパイプラインを動的にエビデンス駆動の推論プロセスに変換する新しいエージェントフレームワークであるFAIR-RAGを紹介する。
本稿では,HotpotQA,2WikiMultiHopQA,MusiQueなどのマルチホップQAベンチマーク実験を行う。
我々の研究は、高度なRAGシステムにおける信頼性と正確な推論を解き明かすためには、明確なギャップ分析による構造化されたエビデンス駆動の洗練プロセスが不可欠であることを示す。
論文 参考訳(メタデータ) (2025-10-25T15:59:33Z) - RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning [64.46921169261852]
RAG-Zevalは、ルール誘導推論タスクとして忠実さと正しさの評価を定式化する、新しいエンドツーエンドフレームワークである。
提案手法は、強化学習による評価者を訓練し、コンパクトなモデルにより包括的および音質評価を生成する。
実験では、RAG-Zevalの優れた性能を示し、人間の判断と最も強い相関性を達成した。
論文 参考訳(メタデータ) (2025-05-28T14:55:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。