論文の概要: AdaTutoRank: Learning to Rerank Document Sets via Adaptive Tutoring Optimization for RAG and Deep Research
- arxiv url: http://arxiv.org/abs/2609.32472v1
- Date: Sat, 26 Sep 2026 11:05:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.599689
- Title: AdaTutoRank: Learning to Rerank Document Sets via Adaptive Tutoring Optimization for RAG and Deep Research
- Title(参考訳): AdaTutoRank: RAGとDeep ResearchのためのAdaptive Tutoring Optimizationを通じてドキュメントセットの参照を学ぶ
- Abstract要約: 本稿では,Adaptive Tutoring Optimization を用いて学習したアダテュートランカ AdaTutoRank を提案する。
AdaTutoRankは、検索コールを減らしながら、全体的なパフォーマンスを最高のものにしている。
- 参考スコア(独自算出の注目度): 18.58709881715068
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Document rerankers determine what evidence reaches the downstream model in RAG and deep research, yet mainstream rerankers select by relevance matching, and individually relevant documents rarely constitute the complete, complementary, non-redundant set a complex information need demands. Prior work rewards a set by its aggregate rubric score, shifting the objective from ranking documents to composing sets. Yet that score is one scalar shared by every document in the set, so the supervision is sparse: a redundant document is rewarded with the rest whenever the set scores well, and a decisive one penalized with the rest whenever it does not; credit assignment leaves contributors indistinguishable from free riders. On-policy distillation could densify this supervision, but existing methods give every rollout the same fixed guidance, too prescriptive for strong rollouts and too abstract for weak ones. We therefore propose AdaTutoRank, a setwise reranker trained with Adaptive Tutoring Optimization (ATO) under a three-level hierarchy of nine rubric dimensions, which supplies silver labels for the cold start, rewards for reinforcement learning, and hints for distillation. ATO draws three hint forms of increasing specificity from the policy's own frozen snapshot: the rubrics alone, a self-selector's sibling-set chosen under rubrics, and a self-reflector's reflection contrasting the rollout with that sibling-set; each rollout receives the form matched to its quality. Re-scoring that rollout under the hint-conditioned frozen teacher and the hint-free snapshot distills the hint's effect into a token-level advantage that complements the group-relative outcome advantage. Across ten benchmarks spanning RAG, deep research, and setwise evaluation, AdaTutoRank attains the best overall performance while issuing fewer retrieval calls.
- Abstract(参考訳): ドキュメント・リランカはRAGとディープ・リサーチにおいて下流モデルにどのような証拠が到達しているかを決定するが、主流のリランカは関連マッチングによって選択される。
事前の作業は、集計されたルーリックスコアによってセットを報酬し、目標をランキングドキュメントから構成セットにシフトする。
しかし、そのスコアはセット内のすべてのドキュメントで共有される1つのスカラーであるため、監督は不十分である: 冗長なドキュメントは、そのセットが適切にスコアされるたびに、残りで報酬が与えられ、決定的な文書は、そうでなければ、残りで罰せられる; クレジットの割り当ては、無料のライダーと区別できないコントリビュータを残している。
オンライン蒸留は、この監督を強化する可能性があるが、既存の方法では、すべてのロールアウトに同じ固定されたガイダンスを与え、強いロールアウトにはあまりにも規範的であり、弱いロールアウトには抽象的すぎる。
そこで,AdaTutoRankを提案する。AdaTutoRankはアダプティブ・チュータリング・最適化(Adaptive Tutoring Optimization, ATO)で訓練された,9つのルーリック次元の3レベル階層の下で,冷間開始時の銀ラベル,強化学習の報奨,蒸留のヒントを提供する。
ルーブリックのみ、ルーブリックの下で選択されたセルフセレクタの兄弟セット、そしてロールアウトとその兄弟セットとを対比したセルフレフレクタの反射である。
ヒント条件付き凍結教師の下でロールアウトしたロールアウトとヒントなしスナップショットは、ヒントの効果をトークンレベルのアドバンテージに蒸留し、グループ相対的な結果のアドバンテージを補完する。
RAG、ディープリサーチ、セットワイズ評価にまたがる10のベンチマークで、AdaTutoRankは、検索コールを減らしながら、全体的なパフォーマンスを最高のものにしている。
関連論文リスト
- Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - AbstRAG: Learning to Abstract for Retrieval Problems [23.379898867224355]
AbstRAGは、クエリ-エビデンスギャップを、式、概念、インテント-エビデンス、イベントタイプコンポーネントに分解する。
21対のブートストラップのコントラストのうち18のnDCG@10よりも優れており、生成精度は1.9%、5.2%、および4.0%向上している。
論文 参考訳(メタデータ) (2026-06-08T13:14:01Z) - GroupRank: A Groupwise Reranking Paradigm Driven by Reinforcement Learning [26.616849067985967]
Groupwiseは、大規模な言語モデルのための新しいパラダイムである。
高品質な検索とランキングデータのための革新的なパイプラインを提案する。
得られたデータは、リランカのトレーニングだけでなく、レトリバーのトレーニングにも利用することができる。
論文 参考訳(メタデータ) (2025-11-10T15:25:31Z) - Query Decomposition for RAG: Balancing Exploration-Exploitation [83.79639293409802]
RAGシステムは複雑なユーザ要求に対処し、それらをサブクエリに分解し、それぞれに関連する可能性のあるドキュメントを取得し、それを集約して回答を生成する。
クエリの分解とドキュメントの検索をエクスプロレーション探索設定で定式化し、一度に1つのドキュメントを検索すると、与えられたサブクエリの有用性についての信念が構築される。
我々の主な発見は、ランク情報と人的判断を用いた文書関連性の推定により、文書レベルの精度が35%向上し、α-nDCGが15%向上し、長文生成の下流タスクの性能が向上するということである。
論文 参考訳(メタデータ) (2025-10-21T13:37:11Z) - RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning [64.46921169261852]
RAG-Zevalは、ルール誘導推論タスクとして忠実さと正しさの評価を定式化する、新しいエンドツーエンドフレームワークである。
提案手法は、強化学習による評価者を訓練し、コンパクトなモデルにより包括的および音質評価を生成する。
実験では、RAG-Zevalの優れた性能を示し、人間の判断と最も強い相関性を達成した。
論文 参考訳(メタデータ) (2025-05-28T14:55:33Z) - Gumbel Reranking: Differentiable End-to-End Reranker Optimization [61.16471123356738]
RAGシステムは関連する文書を識別するためにリランカーに依存している。
注釈付きクエリ-ドキュメントペアが不足しているため、これらのモデルの微調整は依然として難しい。
我々は,トレーニングと推論のギャップを最小限に抑えることを目的とした,リランカーのためのエンドツーエンドのトレーニングフレームワークであるGumbel Re rankを提案する。
論文 参考訳(メタデータ) (2025-02-16T13:23:39Z) - Bridging Relevance and Reasoning: Rationale Distillation in Retrieval-Augmented Generation [45.366826050955105]
本稿では,Rationale DistillatiOnを用いた新規かつ実用的な嗜好アライメントフレームワークであるRADIOを提案する。
まず,Large Language Models (LLMs) の推論能力を活用して,問合せに要する有理を抽出する理性抽出手法を提案する。
その後、抽出された有理性に基づいて文書を再引用する合理性に基づくアライメントプロセスが設計され、その選好を調整するために再帰者を微調整する。
論文 参考訳(メタデータ) (2024-12-11T16:32:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。