論文の概要: InterTab: Interleaved Visual-Structure Alignment for Multi-Modal Table Reasoning
- arxiv url: http://arxiv.org/abs/2609.32660v1
- Date: Sat, 26 Sep 2026 14:18:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 21:36:41.964602
- Title: InterTab: Interleaved Visual-Structure Alignment for Multi-Modal Table Reasoning
- Title(参考訳): InterTab:マルチモーダルテーブル推論のためのインターリーブ型視覚構造アライメント
- Abstract要約: 表画像は、しばしばテキストシリアライゼーションで失われる構造情報を保存する。
現在のマルチモーダル大言語モデル(MLLM)は、推論の前にイメージ全体をエンコードしているため、疑問が広がるにつれて行、列、セルレベルの証拠を拾うことはできない。
textbfInterTabは、textbfTableイメージ上のCoT推論のための構造認識フレームワークである。
- 参考スコア(独自算出の注目度): 38.91873494395728
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Table images preserve structural information that are often lost in text serialization, and reasoning over them requires locating relevant rows, columns, and cells step by step. Current multimodal large language models (MLLMs) encode the whole image once before reasoning, so they cannot pick up row-, column-, and cell-level evidence as the question unfolds. Encoder-side table structure and generic interleaved visual chain-of-thought still do not bind each reasoning step to that structure. We propose \textbf{InterTab}, an \textbf{Inter}leaved structure-aware framework for CoT reasoning over \textbf{Tab}le images, interleaves chain-of-thought with tool calls that crop structure-aligned table regions. First, we build InterTab-22K, includes reasoning trajectories in which each step is tied to both a structural location and a bounding box. InterTab is trained in two stages: supervised structure-aware alignment (SSA) on InterTab-22K teaches the model to interleave reasoning with structure-aligned crops, and active localization optimization (ALO) further optimizes answer correctness, localization IoU, and output format, while penalizing missing or excessive tool calls. Experiments on nine table benchmarks show that InterTab improves the average accuracy of its backbone from 68.28% to 73.17% and achieves the best average performance among all compared methods. Code and data will be released soon.
- Abstract(参考訳): テーブルイメージは、しばしばテキストシリアライゼーションで失われる構造情報を保存し、それらに対する推論には、関連する行、列、セルを段階的に配置する必要がある。
現在のマルチモーダル大言語モデル(MLLM)は、推論の前にイメージ全体をエンコードしているため、疑問が広がるにつれて行、列、セルレベルの証拠を拾うことはできない。
エンコーダ側テーブル構造と一般的なインターリーブされた視覚連鎖は、その構造に各推論ステップを結合しない。
本稿では,CoT推論のための構造認識フレームワークである \textbf{InterTab} を提案する。
まず、InterTab-22Kを構築し、各ステップが構造的位置とバウンディングボックスの両方に結び付けられている推論軌道を含む。
InterTabは2つの段階でトレーニングされている: InterTab-22K上の教師付き構造認識アライメント(SSA)は、構造整列作物との推論をインターリーブするモデルを教え、アクティブな局所化最適化(ALO)は、欠落または過剰なツールコールをペナルライズしながら、回答の正しさ、ローカライゼーションIoU、出力フォーマットをさらに最適化する。
9つのテーブルベンチマークの実験では、InterTabは背骨の平均精度を68.28%から73.17%に改善し、比較したすべてのメソッドの中で最高の平均性能を達成する。
コードとデータはまもなくリリースされる。
関連論文リスト
- StrucTab: A Structured Optimization Framework for Table Parsing [33.4550862402289]
StrucTabは、中間構造監督と報酬分解によって学習されたテーブル解析モデルである。
モデリングレベルでは、解析プロセスを人間にインスパイアされたサブタスクに分解することで、StrucTabはシーケンシャルな推論戦略を通じてそれらを段階的に統一する。
最適化レベルでは、分解された報酬を利用して安定かつ情報的最適化信号を提供する統一RLフレームワークUni-TabRLを導入する。
論文 参考訳(メタデータ) (2026-06-29T07:41:39Z) - DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates [2.7885016877286897]
DenTabは、高品質なHTMLアノテーションを備えた歯科用推定値から2000個のトリミングされたテーブルイメージのデータセットである。
我々は、14の視覚言語エグゼキュータモデル(VLM)と2つのOCRベースラインを含む16のシステムをベンチマークした。
本稿では,算術的質問を決定論的実行にルーティングするテーブルルータパイプラインを提案する。
論文 参考訳(メタデータ) (2026-04-17T14:33:51Z) - Multimodal Tabular Reasoning with Privileged Structured Information [67.40011423365712]
ブリッジインfOrmation (sc Turbo) を用いたタブウラー推論(TabUlar Reasoning)について紹介する。
sc TurboはDeepSeek-R1をベースにした構造対応の推論トレースジェネレータの恩恵を受ける。
sc Turboは、複数のデータセットで最先端のパフォーマンス(+7.2%対以前のSOTA)を達成する。
論文 参考訳(メタデータ) (2025-06-04T15:46:30Z) - UniTabNet: Bridging Vision and Language Models for Enhanced Table Structure Recognition [55.153629718464565]
我々は、画像からテキストへのモデルに基づくテーブル構造解析のための新しいフレームワークUniTabNetを紹介する。
UniTabNetは、画像とテキストのモデルを使ってテーブルセルを分離し、物理デコーダと論理デコーダを統合して完全なテーブル構造を再構築する。
論文 参考訳(メタデータ) (2024-09-20T01:26:32Z) - TRACE: Table Reconstruction Aligned to Corner and Edges [7.536220920052911]
そこで我々は,テーブルがセルで構成され,各セルがエッジからなる境界で構成されているテーブルの自然特性を解析した。
ボトムアップ方式でテーブルを再構築する新しい手法を提案する。
シンプルな設計はモデルを訓練しやすくし、以前の2段階の手法よりも少ない計算を必要とする。
論文 参考訳(メタデータ) (2023-05-01T02:26:15Z) - SEMv2: Table Separation Line Detection Based on Instance Segmentation [96.36188168694781]
SEMv2(SEM: Split, Embed, Merge)と呼ばれるテーブル構造認識器を提案する。
本稿では,テーブル分離ラインのインスタンスレベルの識別問題に対処し,条件付き畳み込みに基づくテーブル分離ライン検出戦略を提案する。
SEMv2を包括的に評価するために、iFLYTABと呼ばれるテーブル構造認識のためのより困難なデータセットも提示する。
論文 参考訳(メタデータ) (2023-03-08T05:15:01Z) - TRUST: An Accurate and End-to-End Table structure Recognizer Using
Splitting-based Transformers [56.56591337457137]
本稿では,TRUSTと呼ばれるテーブル構造認識手法を提案する。
変換器は、大域的な計算、完全メモリ、並列計算のためにテーブル構造認識に適している。
我々はPubTabNetやSynthTableなど,いくつかの人気のあるベンチマークで実験を行い,新しい最先端の結果を得た。
論文 参考訳(メタデータ) (2022-08-31T08:33:36Z) - Robust (Controlled) Table-to-Text Generation with Structure-Aware
Equivariance Learning [24.233552674892906]
制御されたテーブル・トゥ・テキスト生成は、テーブルのハイライトされた部分の自然言語記述を生成する。
構造認識型自己認識機構で表を符号化する等分散学習フレームワークを提案する。
我々の技術は、既存のテーブル・ツー・テキスト生成モデルに自由にプラグインでき、T5ベースのモデルを改善し、ToTToとHiTabのパフォーマンスを改善しました。
論文 参考訳(メタデータ) (2022-05-08T23:37:27Z) - Identifying Table Structure in Documents using Conditional Generative
Adversarial Networks [0.0]
多くの産業や学術研究において、情報は主に構造化されていない文書の形で伝達される。
本稿では,まず,テーブルイメージを標準化されたスケルトンテーブル形式にマッピングするために,条件付き生成逆数ネットワークを用いたトップダウンアプローチを提案する。
次に、xy-cutプロジェクションと遺伝的アルゴリズムを用いた潜在テーブル構造を導出する。
論文 参考訳(メタデータ) (2020-01-13T20:42:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。