論文の概要: A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability
- arxiv url: http://arxiv.org/abs/2608.00705v1
- Date: Sat, 01 Aug 2026 15:05:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.871933
- Title: A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability
- Title(参考訳): マルチホップ要求トレーサビリティのための検索拡張生成のトリプルロバスト性解析
- Authors: Meftun Akarsu, Burak Özdemir, Doğancan Büyükçolak, Recep Kaan Karaman,
- Abstract要約: GraphRAG対ベクトルRAGに関する報告された評決は一致せず、その証拠は典型的には1つのコーパス、埋め込み器、および裁判官と結びついている。
本稿では,5ピペリンアーキテクチャ行列を固定し,組込み器を可変させる3重ロバスト性解析について述べる。
我々は、RAGアーキテクチャのクレームが信頼される前に、このレベルの堅牢性でテストされるべきであると主張している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reported verdicts on GraphRAG versus vector RAG disagree, and the evidence is typically tied to a single corpus, embedder, and judge -- and, we show, to where citation quality is measured. We present a triple-robustness analysis that holds a five-pipeline architecture matrix fixed and varies embedder (local e5-small vs. Azure text-embedding-3-small), corpus (DO-178C typed-edge requirements vs. Wikipedia paragraph chains via MuSiQue), and judge (paired GPT-5.4 x GPT-4.1 on both corpora), over 2x4,440 main-matrix runs, 600 cross-corpus runs, and over 5,000 faithfulness judgments. (C2a) GraphRAG's graph walk floods the context window at precision 0.12-0.23, but the synthesizer cites selectively at precision 0.48-0.65; scoring the retrieved set as the attribution set inverts the architecture ranking, which reconciles part of the disagreement in prior reports. (C1) Answer-level citation winners are corpus- and stratum-conditional but embedder-robust: GraphRAG ties vanilla on short-hop DO-178C queries and wins every MuSiQue stratum, while agentic pipelines lead only on 3+-hop requirements queries. (C2b) Faithfulness is corpus-conditional: on DO-178C it declines with hop distance (trend p<0.05 in three of four judge x embedder combinations); on Wikipedia chains neither judge shows a collapse. (C3) Single-judge LLM faithfulness is fragile to retrieval state: GPT-5.4's self-kappa across embedders is 0.137 (41% verdict change) against a same-day test-retest floor of 0.76, and re-judging frozen inputs eleven weeks later gives kappa <= 0.14 for both judges. A learned router on dense embeddings alone reaches macro-F1 0.86 on hop classification (C4). We argue that RAG architecture claims should be tested at this level of robustness -- including robustness to the citation-measurement point -- before they are trusted.
- Abstract(参考訳): 報告されたGraphRAGとベクトルRAGの評決は一致せず、証拠は典型的には1つのコーパス、埋め込み器、および裁判官と結びついており、引用の質を測定する場所を示している。
本報告では,5ピペリンアーキテクチャ行列を固定し,組込み器(ローカルe5-small vs. Azure text-embedding-3-small),コーパス(DO-178C Typed-edge requirements vs. Wikipedia paragraph chains vs. MuSiQue),ジャッジ(両コーパスでGPT-5.4 x GPT-4.1),メイン行列2x4,440回,クロスコーパス600回,忠実判断5000回以上を収録する。
(C2a)
GraphRAGのグラフウォークは精度0.12-0.23でコンテキストウィンドウを浸水させるが、シンセサイザーは精度0.48-0.65で選択的に引用する。
(C1)
GraphRAGはショートホップのDO-178Cクエリでバニラを結び、すべてのMuSiQue層を勝ち取り、エージェントパイプラインは3つ以上の要求クエリでのみリードする。
(C2b)
DO-178Cではホップ距離(4つの判定 x 埋め込みの組み合わせのうち 3 つに p<0.05 を下す)で減少する。
(C3)
GPT-5.4の自己カッパは0.76の同日検定フロアに対して0.137(41%の評決変更)であり、11週間後に凍結した入力を再び判断すると、両方の裁判官にカッパ <= 0.14 となる。
密埋め込みのみの学習ルータは、ホップ分類のマクロF1 0.86に達する(C4)。
我々は、RAGアーキテクチャの主張が信頼される前に、このレベルの堅牢性(引用測定点への堅牢性を含む)でテストされるべきであると主張する。
関連論文リスト
- InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy [0.9924185669370708]
InvestPhilBenchは8つの認知層にまたがる動的ベンチマークである。
v0.6リリースには118のプライマリソース認証投資原則カードが含まれている。
大規模な再現可能なスコア付けには、Benchmark Automated Scoring Pipelineを紹介します。
論文 参考訳(メタデータ) (2026-06-24T15:53:20Z) - Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents [3.964533007623828]
現代の大規模言語モデル(LLM)エージェントは、行動の時点で決定に関連のある証拠を必要とする。
本稿では、事例コンテキストグラフを構築し、候補単位の決定指向ユーティリティを推定し、選択したエビデンスを型付きメモリカードに圧縮するCICLについて述べる。
CICLは、ツール使用エージェントの意思決定クリティカルコンテキストの測定、ランキング、圧縮のための実用的なレイヤを提供する。
論文 参考訳(メタデータ) (2026-06-06T13:02:28Z) - Hierarchical Certified Semantic Commitment for Byzantine-Resilient LLM-Agent Collaboration [30.310793549183117]
本稿では,BFTにインスパイアされたプロトコルH-CSC(Hierarchical Certified Semantic Commitment)を紹介する。
H-CSCはBFT対応バケット(0.31から2.04度)に低角偏差でコミットし、意図したようにBFTを超えるラウンド(n3f+1)の100%を中止する。
論文 参考訳(メタデータ) (2026-06-05T14:35:58Z) - From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks [41.99844472131922]
基礎モデル弱いラベルに対するベンチマークキャリブレーションを提供する。
理論によって予測される交差は、PCAMではng100、ISICでは20-50、NIH-CXRでは250-500である。
NIH-CXR上の構造付きvs-ランダムノイズ符号フリップは、境界のレートのみの定式化が不完全であることを示す。
論文 参考訳(メタデータ) (2026-05-23T23:15:07Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Controlling Authority Retrieval: A Missing Retrieval Objective for Authority-Governed Knowledge [0.0]
私たちはこれを CAR と呼び、セマンティックアンカー q、すなわち front(cl(A_k(q))) に対して現在アクティブな権限を取得する。
我々は、セキュリティアドバイザリ、SCOTUSオーバーラリングペア、FDA薬物記録の3つの実世界のデータセットを評価した。
GPT-4ominiの実験では、RAGは、パッチが存在するクエリの39%に対して、明示的な"パッチなし"のクレームを生成する。
論文 参考訳(メタデータ) (2026-04-15T23:56:35Z) - OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection [0.0]
本稿では,決定論的シミュレーションエンジンが基底真理を維持し,言語モデルが表面の散文のみを生成する検証可能な合成ベンチマークを提案する。
コーパスは51日の模擬日、2,904回のテレメトリ記録を96.4%のノイズレートで記録し、単面と単日のトリアージ戦略を破るために設計された4つの検出シナリオをカバーしている。
論文 参考訳(メタデータ) (2026-03-23T19:03:53Z) - QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs [29.26861081722613]
我々は, 標準の「LLM-as-a-Judge」プロトコルが, 上学部から初期大学院レベルの数学に適用された場合, 体系的なアライメントギャップに悩まされることを実証した。
QEDBenchは、大学レベルの数学における人間の専門家とのアライメントを測定するための、最初の大規模デュアルルーブリックアライメントベンチマークである。
我々は,Claude Opus 4.5,DeepSeek-V3,Qwen 2.5 Max,Llama 4 Maverickなどのフロンティア評価が有意な正のバイアスを示すことを明らかにした。
論文 参考訳(メタデータ) (2026-02-24T07:23:28Z) - BiRQA: Bidirectional Robust Quality Assessment for Images [49.74447451098852]
フル参照画像品質評価(FR IQA)は、画像圧縮、復元、生成モデリングにおいて重要である。
本稿では、双方向の多スケールピラミッド内で4つの高速補完特徴を処理するコンパクトFR IQA計量モデルであるBiRQAを提案する。
5つのパブリックFR IQAベンチマークでは、BiRQAは以前のSOTAモデルよりも3倍高速で動作しながら、以前の状態(SOTA)より優れ、あるいは一致している。
論文 参考訳(メタデータ) (2026-02-23T20:52:56Z) - ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks [12.396822247035578]
目的抽出とメタ認知のためのベンチマークであるexMTを提案する。
マルチターン書き起こしが与えられた場合、モデルは1文ベース目標と自己報告された自信を出力しなければならない。
正確性は金の目標と類似性によって評価され、300の校正項目で1度閾値付けされる。
論文 参考訳(メタデータ) (2025-08-23T03:32:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。