論文の概要: TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation
- arxiv url: http://arxiv.org/abs/2607.03447v1
- Date: Fri, 03 Jul 2026 16:01:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.621351
- Title: TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation
- Title(参考訳): TRIAGE:信頼できる検索機器とグラフ評価
- Abstract要約: 本稿では,自動文書グラウンドグラフRAGのためのステージアウェア・インスツルメンテーション・フレームワークであるTRIAGEを紹介する。
TRIAGEは、KG実装、KG検証、KG使用の3段階に、ステージ固有の独立した解釈可能なメトリクスを付加する。
使用時にこれらのメトリクスは、最初の障害リンクが障害をローカライズする必要な条件の診断チェーンを形成する。
- 参考スコア(独自算出の注目度): 0.12999413717930816
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Knowledge graphs (KGs) that underpin Graph-based Retrieval-Augmented Generation (Graph-RAG) are increasingly built automatically by LLM-driven extraction rather than curated by experts. Proper evaluation would require instrumenting all pertinent stages: extraction, graph construction, and inference, coherently enough to localize failures, so that a failure at one stage is not discovered as a wrong answer at the end. We introduce TRIAGE, a stage-aware instrumentation framework for automated, document-grounded graph-RAG that asks not only whether the underlying graph can be trusted but at what cost it can be queried. TRIAGE attaches stage-specific, independently interpretable metrics to three stages: the KG Implementation (triple confidence, source coverage, and schema and canonicalization checks), the KG Validation by expert (graph-level structural quality, with correctness and completeness computed only as offline calibration when a reference is available), and the KG Usage (retrieval coverage, faithfulness, and retrieval cost); the deployed metrics need no gold annotations, the gold-requiring ones serving only as offline calibration. At usage time these metrics form a diagnostic chain of necessary conditions whose first broken link localizes the failure, and the diagnosis maps to the stage levers that can remedy it: extraction, graph and schema, or retrieval. TRIAGE is a theoretical framework with a proof of concept and a reproducible evaluation protocol.
- Abstract(参考訳): グラフベースの検索型生成(Graph-RAG)を支える知識グラフ(KG)は、専門家がキュレートするのではなく、LCMによる抽出によって自動的に構築される。
適切な評価では、抽出、グラフ構築、推論といった関連するすべてのステージを計測し、失敗をローカライズするのに十分な一貫性を持たせる必要がある。
TRIAGEは,基盤となるグラフが信頼できるかどうかだけでなく,どのコストでクエリできるのかを問う,自動文書グラウンドグラフ-RAG用のステージアウェアインスツルメンテーションフレームワークである。
TRIAGEは、KG実装(3つの信頼性、ソースカバレッジ、スキーマと標準化チェック)、専門家によるKGバリデーション(グラフレベルの構造的品質、参照が利用可能であればオフラインキャリブレーションとして計算される)、KG Usage(検索カバレッジ、忠実さ、検索コスト)、デプロイされたメトリクスは金のアノテーションを必要としない。
使用時にこれらのメトリクスは、最初の障害リンクが障害をローカライズする必要な条件の診断チェーンを形成し、診断はそれを修復可能なステージレバー(抽出、グラフ、スキーマ、検索)にマップする。
TRIAGEは概念実証と再現可能な評価プロトコルを備えた理論フレームワークである。
関連論文リスト
- KGCQual: An Interpretable Framework for Evaluating the Knowledge Graph Construction Quality from Text [6.373904244962351]
本稿では,本質的な知識グラフ品質評価のための新しい解釈可能な指標を提案する。
自動的に抽出されたグラフがいかに「理想」グラフに近似するかを測定する。
複数の最先端の3重抽出システムとデータセットで測定値を評価する。
論文 参考訳(メタデータ) (2026-07-11T08:45:15Z) - When Thinking Before Retrieval Hurts: TraceBound Diagnostics for Adaptive Knowledge-Graph Retrieval [0.0]
TraceBoundは、テキストリッチな知識グラフ上でARKスタイルの検索を行うための軽量なプロファイルおよびトレース条件付き診断プロトコルである。
テキストリッチな知識グラフ上でARKスタイルの検索を行うための軽量なプロファイルおよびトレース条件付き診断プロトコルであるTraceBoundを導入することで、この前提について検討する。
論文 参考訳(メタデータ) (2026-07-06T09:16:38Z) - The Confidence Trap: Calibration Attacks for Graph Neural Networks [30.116997325760945]
グラフ上の校正攻撃を研究するためのフレームワークを提案する。
より精度の高いモデルや、より多くのクラスを持つデータセットで訓練されたモデルは、この脅威モデルの下ではより影響を受けやすいことを示す。
私たちのコードはhttps://github.com/CaptainCuong/Graph-Calibration-Attack.gitで公開されています。
論文 参考訳(メタデータ) (2026-06-07T06:16:58Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents [26.16025682022058]
PROBEは、ソフトウェアエンジニアリングエージェントの構造化リカバリのための、障害対応フレームワークである。
PROBEは、リポジトリレベルのソフトウェア修復、エンタープライズワークフローのリカバリ、AIOpsサービス緩和の3つの設定で評価します。
論文 参考訳(メタデータ) (2026-05-09T06:02:08Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - SSKG Hub: An Expert-Guided Platform for LLM-Empowered Sustainability Standards Knowledge Graphs [45.81070868196074]
本稿では,サステナビリティ標準を監査可能な知識グラフに変換するプロトタイプとインタラクティブなWebプラットフォームであるSSKG Hubを紹介する。
このシステムは、自動化された標準識別、チャンキング、標準固有のプロンプト、堅牢な3重解析、および証明可能なNeo4jストレージを統合している。
ロールベースのガバナンスフレームワークは、リードオンリーのゲストアクセス、エキスパートレビュー、メタエキスパート認定、管理監督をカバーしている。
論文 参考訳(メタデータ) (2026-02-28T14:24:55Z) - LLM-Powered Text-Attributed Graph Anomaly Detection via Retrieval-Augmented Reasoning [20.426942100536003]
テキスト分散グラフ(TAG)の異常検出は、不正検出、侵入監視、誤情報解析などの応用において重要な役割を果たす。
本稿では,TAGのノード検出のための総合ベンチマークであるTAG-ADを紹介する。
本稿では,LLMに基づくゼロショット異常検出フレームワークであるRAG(Research-augmented Generation)を提案する。
論文 参考訳(メタデータ) (2025-11-16T05:21:14Z) - MIRNet: Integrating Constrained Graph-Based Reasoning with Pre-training for Diagnostic Medical Imaging [67.74482877175797]
MIRNetは、自己教師付き事前学習と制約付きグラフベースの推論を統合する新しいフレームワークである。
TongueAtlas-4Kは,22の診断ラベルを付した4,000枚の画像からなるベンチマークである。
論文 参考訳(メタデータ) (2025-11-13T06:30:41Z) - Test-Time Graph Search for Goal-Conditioned Reinforcement Learning [56.13800388912632]
オフライン目標条件強化学習(GCRL)は、テスト時にユーザが指定した目標に到達するポリシーを訓練する。
GCRLタスクを解決するための軽量な計画手法であるTTGS(Test-Time Graph Search)を導入する。
TTGSは任意の状態空間距離やコスト信号を受け入れ、データセット状態の上に重み付きグラフを構築し、凍結ポリシーが実行する一連のサブゴールを高速に検索する。
論文 参考訳(メタデータ) (2025-10-08T17:20:53Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking [63.84117489519164]
知識グラフ質問 回答システムは、複雑なマルチホップ推論を評価するために高品質なベンチマークに依存している。
広く使われているにもかかわらず、WebQSPやCWQのような一般的なデータセットは、重要な品質問題に悩まされている。
我々はこれらの落とし穴を体系的に解決するLLM-in-the-loopフレームワークであるKGQAGenを紹介する。
本研究は,KGQA評価を推し進めるスケーラブルなフレームワークとして,より厳密なベンチマーク構築とKGQAGenの位置づけを提唱する。
論文 参考訳(メタデータ) (2025-05-29T14:44:52Z) - Weak Supervision Performance Evaluation via Partial Identification [46.73061437177238]
Programmatic Weak Supervision (PWS) は、地上の真理ラベルに直接アクセスすることなく、教師付きモデルトレーニングを可能にする。
本稿では,モデル評価を部分的同定問題としてフレーミングすることで,この問題に対処する新しい手法を提案する。
提案手法は,従来の弱監督評価手法において,ラベル付きデータを必要とせず,重要な指標に信頼性のあるバウンダリを導出する。
論文 参考訳(メタデータ) (2023-12-07T07:15:11Z) - Towards Self-Interpretable Graph-Level Anomaly Detection [73.1152604947837]
グラフレベルの異常検出(GLAD)は、コレクションの大多数と比べて顕著な相違を示すグラフを識別することを目的としている。
本稿では,異常なグラフを検出し,同時に情報的説明を生成する自己解釈グラフaNomaly dETectionモデル(SIGNET)を提案する。
論文 参考訳(メタデータ) (2023-10-25T10:10:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。