論文の概要: LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2607.27353v1
- Date: Wed, 29 Jul 2026 18:09:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.301123
- Title: LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation
- Title(参考訳): LayerRAG-Bench: エージェント検索強化ジェネレーションのためのクロスレイヤ信頼性ベンチマーク
- Authors: Musa Shams,
- Abstract要約: エージェント検索拡張生成システムは、エビデンス、ツール契約、認可、セッション状態層に失敗しながら、根拠となる答えを生成することができる。
LayerRAG-Benchは8つのエンタープライズドメイン、240のタスク、9の障害シナリオ、2のコントラクトモード、38,880のライブタスクレベルのレコードを備えた、コントロールされたクロスレイヤ信頼性ベンチマークである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic retrieval-augmented generation systems can produce answers that appear grounded while failing at the evidence, tool-contract, authorization, or session-state layer. We introduce LayerRAG-Bench, a controlled cross-layer reliability benchmark with 8 enterprise domains, 240 tasks, 9 fault scenarios, 2 contract modes, and 38,880 live task-level records across nine models from OpenAI, Anthropic, and Gemini. Schema normalization raises schema-drift success from 0.000 to 0.913, but stale evidence, missing tool output, denied permissions, and wrong-session context are not recovered by schema normalization. Groundedness-only evaluation also produces substantial false positives under stale and wrong-session evidence. These results support a layer-specific evaluation principle: a reliability intervention should be credited for repairing its target layer without being mistaken for a universal fix.
- Abstract(参考訳): エージェント検索拡張生成システムは、エビデンス、ツール契約、認可、セッション状態層に失敗しながら、根拠となる答えを生成することができる。
LayerRAG-Benchは8つのエンタープライズドメイン、240のタスク、9の障害シナリオ、2つのコントラクトモード、OpenAI、Anthropic、Geminiの9つのモデルにわたる38,880のライブタスクレベルのレコードを備えた、コントロールされたクロスレイヤ信頼性ベンチマークである。
スキーマ正規化はスキーマドリフトの成功を0.000から0.913に引き上げるが、古いエビデンス、ツール出力の欠如、拒否されたパーミッション、誤ったセッションコンテキストはスキーマ正規化によって回復されない。
基底性のみの評価は、古い証拠や誤った証拠の下でかなりの偽陽性をもたらす。
これらの結果は層固有の評価原則を支持しており、信頼性の介入は、普遍的な修正を間違えることなく、対象層を修復したとして認定されるべきである。
関連論文リスト
- Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems [0.10210859604701106]
セルフヒーリングエージェントオーケストレータは、信頼性をランタイム境界制御問題として扱う。
セルフヒーリングは98.8%のタスク成功を達成し、リトライオンリーでは94.5%、フルリプランでは93.8%を達成している。
論文 参考訳(メタデータ) (2026-05-31T19:27:22Z) - Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation [0.0]
自然言語からインフラストラクチャ・アズ・コード(IaC)を生成するには、プロバイダのスキーマ、依存関係の計画、組織的なポリシの制約を満たす必要がある。
Rego v1ポリシを備えた186タスクのAWS/TerraformベンチマークであるIaC-Eval v2で評価されたTerraform生成のための7つのエージェント戦略に関する検証初の実験的研究を示す。
論文 参考訳(メタデータ) (2026-05-29T12:43:27Z) - Do Coding Agents Understand Least-Privilege Authorization? [14.240332406666779]
我々は、現在のモデルが認証境界自体を推測できるかどうか検討する。
We show that frontier model often off permissions by the execution chain while giving unuseed or sensitive accesss。
そこで我々は,まずカバレッジ指向のポリシを生成し,各エントリをグラウンドと感度で監査する,十分性-高度分解法を提案する。
論文 参考訳(メタデータ) (2026-05-14T14:05:58Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - LatentAudit: Real-Time White-Box Faithfulness Monitoring for Retrieval-Augmented Generation with Verifiable Deployment [19.317475241300397]
オープン・ウェイト・ジェネレータから中~後期の残ストリームアクティベーションをプールするホワイトボックス監査機であるLatentAuditを紹介する。
残差ストリーム幾何は、使用可能な忠実度信号を持ち、この信号がアーキテクチャの変化を生き延び、同じ規則が公衆の検証にも適用可能であることを示す。
論文 参考訳(メタデータ) (2026-04-07T02:55:32Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI [0.0]
トラジェクトリガードはシームズ・リカレント・オートエンコーダであり、コントラスト学習によるタスク・トラジェクトリアライメントと、再構成によるシーケンシャル・アライメントを共同で学習するハイブリッド・ロス機能を備えている。
32ミリ秒のレイテンシで、当社のアプローチは LLM Judge のベースラインよりも17-27倍高速で動作し、実運用環境におけるリアルタイムの安全性検証を可能にします。
論文 参考訳(メタデータ) (2026-01-02T00:27:11Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。