論文の概要: RECTIFY: An Interactive Workbench for Post-Evaluation RAG Diagnosis, Repair, and Verification
- arxiv url: http://arxiv.org/abs/2609.16764v1
- Date: Tue, 15 Sep 2026 07:37:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.390291
- Title: RECTIFY: An Interactive Workbench for Post-Evaluation RAG Diagnosis, Repair, and Verification
- Title(参考訳): RECTIFY: 評価後のRAG診断、修復、検証のためのインタラクティブワークベンチ
- Abstract要約: RECTIFYはインタラクティブなStreamlitワークベンチで、評価されたRAGケースを監査可能な修復に変換する。
制御されたRAGベンチマークでは、RECTIFYはBM25、高密度、ハイブリッド検索にまたがる解釈可能な障害プロファイルをサーフェスする。
さらなる分析により、フィルター前処理は不要な修復候補を減らすことが示されている。
- 参考スコア(独自算出の注目度): 1.564663326217051
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Retrieval-Augmented Generation (RAG) evaluators can identify failures such as weak retrieval, poor grounding, incomplete answers, and unsupported generation, but they rarely help developers decide what to repair next. We present RECTIFY, an interactive Streamlit workbench that turns evaluated RAG cases into auditable repair workflows. RECTIFY filters cases that do not require repair, routes remaining failures into actionable families and finegrained repair slices, and generates editable repair cards that developers can approve, reject, or verify through sandbox reruns. On a controlled RAG benchmark, RECTIFY surfaces interpretable failure profiles across BM25, dense, and hybrid retrieval: BM25 mainly triggers noisy-retrieval repairs, while dense and hybrid retrieval leave smaller sets of multi-part underretrieval and underused-evidence cases. Additional analyses show that pre-filtering reduces unnecessary repair candidates and that slicelevel routing yields more targeted repair cards than broad family-level diagnosis. RECTIFY is publicly available as an open-source Streamlit workbench 1 for helping developers turn evaluation results into inspectable repair decisions.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) 評価器は、弱い検索、貧弱な接地、不完全な回答、サポートされていない生成などの失敗を識別できるが、開発者は次に何を修正するかを決めるのに役立つことは滅多にない。
RECTIFYはインタラクティブなStreamlitワークベンチで、評価されたRAGケースを監査可能な修復ワークフローに変換する。
RECTIFYは、修復を必要としないケースをフィルタリングし、残りの障害を動作可能なファミリーにルートし、きめ細かな修復スライスを作成し、開発者がサンドボックスの再実行を承認、拒否、検証できる編集可能な修復カードを生成する。
RAGベンチマークでは、RECTIFYはBM25全体にわたって解釈可能な障害プロファイルをサーベイし、密集したハイブリッド検索を行う。
追加分析により,前処理により不要な補修候補が減少し,スライスレベルルーティングにより,広範囲な家族レベルの診断よりも標的となる補修カードが得られた。
RECTIFYはオープンソースのStreamlitワークベンチ1として公開されている。
関連論文リスト
- Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction [22.654396704495934]
開発セット障害は、どのリカバリ介入が許容可能かを決定することにより、欠落診断基板の一部を回復することができる。
DARCは、タスクファミリー障害モードをプロファイリングし、共有リカバリライブラリから不正な介入を発生させ、検証者選択によるデプロイメント成功コストポリシーを凍結する、診断誘導型リカバリハーネスである。
論文 参考訳(メタデータ) (2026-08-12T08:14:45Z) - Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes [55.114939648705395]
大規模言語モデル(LLM)は、現実のバグに対して、プログラムの自動修正をますます実用的にしている。
バグ再現テスト(BRT)は、バグレポートを実行可能なバグ固有の信号に変換することで、このギャップを埋めるのに役立つ。
本稿では,ループ内収束基準としてLax信号を用いるコジェネレーションフレームワークであるCoHardenを提案する。
論文 参考訳(メタデータ) (2026-07-22T07:30:07Z) - PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents [62.36339598951133]
PhoenixRepairは、複数の候補編集場所を探索し、より良いパッチを生成するマルチエージェントフレームワークである。
PhoenixRepairはDeepSeek-V3.1の下でSWE-agentよりも7.8%の最大の相対的改善を実現し、MiniMax-M2.5で76.0%のPass@1の最高分解率を達成した。
論文 参考訳(メタデータ) (2026-07-21T08:49:30Z) - MIRAGE: Defending Long-Form RAG Against Misinformation Pollution [87.40537931342082]
我々は、長期RAGのためのトレーニング不要でモデルに依存しない防御システムであるMIRAGEを紹介した。
MIRAGEはNLIベースのクロスドキュメントクレームグラフを構築し、一貫性のあるマルチソースサポートサブセットの条件生成や、検索とパラメトリック応答のブロックにDefended-Claims Gateを適用している。
論文 参考訳(メタデータ) (2026-07-06T13:36:12Z) - EviACT: An Evidence-to-Action Framework for Agentic Program Repair [21.78498442884825]
EviACTは、3つのエビデンス駆動ガードレールを修復段階にわたって調整するエージェントAPRフレームワークである。
最強の報告されたベースラインよりも1.6-6.0ポイントのリゾルバ率を改善する。
ベースラインコストが利用可能なバグ毎のAPIコストは70.1-88.6%低下している。
論文 参考訳(メタデータ) (2026-05-26T16:17:47Z) - Doctor-RAG: Failure-Aware Repair for Agentic Retrieval-Augmented Generation [23.961760006898157]
エージェント検索・拡張生成(Agentic RAG)は,質問応答や複雑な知識推論のパラダイムとして広く採用されている。
既存のアプローチでは、診断分析で停止するか、検索推論パイプライン全体を再実行することで、このような障害に対処するのが一般的である。
本稿では,Agenic RAGの異常を明示的エラーローカライゼーションとプレフィックス再利用によって修正する統合診断・修復フレームワークであるDoctor-RAGを提案する。
論文 参考訳(メタデータ) (2026-04-01T13:13:27Z) - Detect--Repair--Verify for LLM-Generated Code: A Multi-Language, Multi-Granularity Empirical Study [10.18490328199727]
大規模な言語モデルは実行可能なソフトウェアアーチファクトを生成することができるが、そのセキュリティはエンドツーエンドの評価が難しいままである。
本研究では、脆弱性を検出し、修復し、セキュリティおよび機能テストで再チェックするDRVワークフローを通じて、その問題を調査する。
現在の証拠の4つのギャップに対処する: LLMの生成したアーティファクトの試験的なベンチマークの欠如、パイプラインレベルの有効性に関する限られた証拠、修正ガイダンスとしての検出レポートの不確実な信頼性、検証中の不確実な修復信頼性。
論文 参考訳(メタデータ) (2026-03-24T18:18:30Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - RAGVUE: A Diagnostic View for Explainable and Automated Evaluation of Retrieval-Augmented Generation [1.564663326217051]
RAGVUEはRetrieval-Augmented Generation (RAG)システムを評価するためのフレームワークである。
RAGの振る舞いを検索品質、回答の妥当性と完全性、厳格なクレームレベルの忠実さ、および判断の校正に分解する。
RAGVUEは手動のメートル法選択と完全に自動化されたエージェント評価の両方をサポートしている。
論文 参考訳(メタデータ) (2025-12-03T07:42:49Z) - Enhancing Retrieval Augmentation via Adversarial Collaboration [50.117273835877334]
我々は「検索幻覚」に対処するため、Adrial Collaboration RAG(AC-RAG)フレームワークを提案する。
AC-RAGは、知識ギャップを識別するジェネリスト検出器と、正確な解決策を提供するドメイン特化リゾルバという2つの異種エージェントを使用している。
実験により、AC-RAGは検索精度を大幅に向上し、様々な垂直領域における最先端RAG法より優れていることが示された。
論文 参考訳(メタデータ) (2025-09-18T08:54:20Z) - Unanswerability Evaluation for Retrieval Augmented Generation [74.3022365715597]
UAEval4RAGは、RAGシステムが解答不能なクエリを効果的に処理できるかどうかを評価するために設計されたフレームワークである。
我々は、6つの未解決カテゴリを持つ分類を定義し、UAEval4RAGは、多様で挑戦的なクエリを自動的に合成する。
論文 参考訳(メタデータ) (2024-12-16T19:11:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。