論文の概要: TabRank: Chain-of-Thought Distillation for Table Re-Rankers
- arxiv url: http://arxiv.org/abs/2607.25182v1
- Date: Tue, 28 Jul 2026 01:23:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.673117
- Title: TabRank: Chain-of-Thought Distillation for Table Re-Rankers
- Title(参考訳): TabRank: テーブルリランカーのチェーンオブソート蒸留
- Authors: Adarsh Singh, Kushal Raj Bhandari, Jianxi Gao, Soham Dan, Vivek Gupta,
- Abstract要約: Tabular RetrievalのリランカをトレーニングするためのフレームワークであるTabRankを紹介する。
提案手法は,様々なテーブル検索データセットにおける性能を著しく向上させる。
- 参考スコア(独自算出の注目度): 17.799512825169504
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The ability to retrieve relevant tables for answering questions is a key task for structured information retrieval. Multi-stage retrieval systems rely heavily on rerankers to refine candidate lists produced by efficient first-stage retrievers. As a result, neural rerankers and LLM-based reranking methods have become increasingly important due to their superior capacity for semantic understanding and reasoning compared to conventional sparse or dense retrieval models. Recently, Large Reasoning Models (LRMs) equipped with explicit chain-of-thought (CoT) reasoning have shown strong improvements in ranking quality in unstructured passage retrieval. In this work, we present TabRank, a framework for training reasoning rerankers for Tabular Retrieval. We first present a comprehensive dataset of 6728 reasoning traces for tabular reranking on the Natural Questions Tables dataset. We then explore two variants of training a compact reasoning model on these reasoning traces: explicit CoT distillation and conditioning the student reranker on the teacher's reasoning trace within the prompt. We stress-test TabRank on several out-of-distribution generalization settings on diverse domains and multi-table scenarios. Our approach significantly improves performance across a variety of table retrieval datasets, increasing Acc@10 by 30.5% on HybridQA, 15.2% on SQA, 52.9% on TabFact, and 13.1% on TATQA subsets of the Multi-Table QA Benchmark compared to the base model. Notably, TabRank generalizes effectively to multi-table reasoning. Our code, data and models are available at https://github.com/AdarshSingh7647/TabRanker
- Abstract(参考訳): 質問に答えるための関連するテーブルを検索する能力は、構造化情報検索の鍵となるタスクである。
多段階検索システムは、効率的な第1段階検索者によって生成される候補リストを洗練するために、リランカーに大きく依存している。
その結果,従来のスパースモデルや高密度検索モデルと比較して,意味理解や推論能力に優れていたため,ニューラルリランカーやLLMに基づくリグレード手法がますます重要になっている。
近年,明示的なチェーン・オブ・シント(CoT)推論を備えたLarge Reasoning Models (LRMs) は,非構造化経路検索におけるランキング品質の大幅な向上を示している。
本稿ではTabRankについて紹介する。TabRankはTabular Retrievalの推論リランカをトレーニングするためのフレームワークである。
まず,自然質問表(Natural Questions Tables)データセットに表表の再ランク付けのための6728の推論トレースの包括的データセットを提示する。
次に、これらの推論トレースに基づいて、コンパクトな推論モデルを訓練する2つのバリエーションを探る: 明示的なCoT蒸留と、教師の推論トレースに生徒のリランカを条件付けする。
多様なドメインやマルチテーブルのシナリオに対して,いくつかのアウト・オブ・ディストリビューションの一般化設定でTabRankをストレステストする。
提案手法は,HybridQAではAcc@10が30.5%増加し,SQAでは15.2%,TabFactでは52.9%,Multi-Table QAベンチマークでは13.1%向上した。
特にTabRankは、マルチテーブル推論に効果的に一般化する。
私たちのコード、データ、モデルはhttps://github.com/AdarshSingh7647/TabRankerで利用可能です。
関連論文リスト
- TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering [80.93487993878836]
現実世界のクエリの一般的なクラスは暗黙的に予測され、単に検索するのではなく、歴史的パターンから観測されていない回答を推測する必要がある。
これらのクエリには、潜在意図を認識することと、大規模テーブル上での信頼性の高い予測推論という2つの課題がある。
単点予測から意思決定,処理効果分析,複雑な推論に至るまで,4つのサブタスクにわたる779のサンプルからなるベンチマークであるTopBenchを紹介する。
論文 参考訳(メタデータ) (2026-04-30T16:22:51Z) - TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction [14.270578219134997]
提案するTabSieveは,エビデンスの使用を明確化し,監査可能にする,セレクトthen予測フレームワークである。
テーブルとクエリ行が与えられた後、TabSieveはまず、証拠として情報行の小さなセットを選択し、選択されたエビデンスに条件付けられた不足ターゲットを予測する。
75の分類と52の回帰表のホールドアウトベンチマークの実験は、TabSieveがショット予算で一貫してパフォーマンスを改善していることを示している。
論文 参考訳(メタデータ) (2026-02-12T08:28:58Z) - CoReTab: Improving Multimodal Table Understanding with Code-driven Reasoning [14.419739466403172]
MMTabのような既存のマルチモーダルテーブル理解のためのデータセットは、主に、明示的なマルチステップ推論の監督なしに、短い事実回答を提供する。
スケーラブルで解釈可能で、自動検証可能なアノテーションを生成するコード駆動推論フレームワークであるCoReTabを紹介します。
我々は、テーブル質問応答、事実検証、テーブル構造理解にまたがる17のMMTabベンチマークにおいて、CoReTabでトレーニングされた結果のモデルを評価する。
論文 参考訳(メタデータ) (2026-01-27T04:49:30Z) - ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios [42.9161992743627]
本稿では、エネルギーや自動車といった30の産業領域にまたがる1,932のテーブルを含む大規模バイリンガルベンチマークであるReasonTabQAを紹介する。
また、テーブル認識による検証可能な報酬を利用して論理的推論経路を生成する強化学習手法であるTabCodeRLを導入する。
論文 参考訳(メタデータ) (2026-01-12T07:36:06Z) - CRAFT: Training-Free Cascaded Retrieval for Tabular QA [11.984180880537936]
TQA(Table Question Answering)は、大きなコーパスから関連するテーブルを取得して、自然言語クエリに応答する。
textbfCRAFT$は、まずスパース検索モデルを使用して候補テーブルのサブセットをフィルタリングするカスケード検索手法である。
textbfCRAFT$は、最先端(SOTA)スパース、密度、ハイブリッドレトリバーよりも優れた検索性能を実現する。
論文 参考訳(メタデータ) (2025-05-21T00:09:34Z) - RAG over Tables: Hierarchical Memory Index, Multi-Stage Retrieval, and Benchmarking [63.253294691180635]
現実世界のシナリオでは、純粋なテキスト以外では、かなりの量の知識がテーブルに格納される。
まず、階層型メモリインデックス、多段階検索、グラフ認識プロンプトからなるテーブルコーパス対応RAGフレームワークT-RAGを提案する。
論文 参考訳(メタデータ) (2025-04-02T04:24:41Z) - Reasoning-Aware Query-Focused Summarization over Multi-Table Data [1.325953054381901]
大規模言語モデル(LLM)を利用したエンドツーエンド生成フレームワークであるQueryTableSummarizer++を提案する。
本手法では,中間シリアライズステップの必要性を排除し,クエリ関連要約を直接生成する。
ベンチマークデータセットの実験では、QueryTableSummarizer++がBLEU、ROUGE、F1スコアで最先端のベースラインを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2024-12-12T06:04:31Z) - Chain-of-Table: Evolving Tables in the Reasoning Chain for Table
Understanding [79.9461269253121]
そこで我々は、中間思考のプロキシとして、図表データを推論チェーンで明示的に使用するChain-of-Tableフレームワークを提案する。
Chain-of-TableはWikiTQ、FeTaQA、TabFactベンチマークで最新のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-01-09T07:46:26Z) - TAP4LLM: Table Provider on Sampling, Augmenting, and Packing Semi-structured Data for Large Language Model Reasoning [55.33939289989238]
テーブルベースタスクにおいて,大規模言語モデル(LLM)を効果的に活用するための汎用プリプロセッサスイートとして,TAP4LLMを提案する。
1)大きなテーブルをクエリセマンティクスに基づいて管理可能なサブテーブルに分解するテーブルサンプリング、(2)外部ソースやモデルから追加の知識でテーブルを拡張するテーブル拡張、(3)テーブルパッキングとシリアライゼーションによりテーブルをLLMの理解に適したさまざまなフォーマットに変換する。
論文 参考訳(メタデータ) (2023-12-14T15:37:04Z) - OmniTab: Pretraining with Natural and Synthetic Data for Few-shot
Table-based Question Answering [106.73213656603453]
最小限のアノテーションによるテーブルベースのQAモデルを構築した。
本稿では、自然データと合成データの両方を消費する全能事前学習手法を提案する。
論文 参考訳(メタデータ) (2022-07-08T01:23:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。