論文の概要: StrucTab: A Structured Optimization Framework for Table Parsing
- arxiv url: http://arxiv.org/abs/2606.29905v1
- Date: Mon, 29 Jun 2026 07:41:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.097995
- Title: StrucTab: A Structured Optimization Framework for Table Parsing
- Title(参考訳): StrucTab: テーブル解析のための構造化最適化フレームワーク
- Authors: Gengluo Li, Shangpin Peng, Chengquan Zhang, Binghong Wu, Hao Feng, Weinong Wang, Pengyuan Lyu, Huawen Shen, Xingyu Wan, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou,
- Abstract要約: StrucTabは、中間構造監督と報酬分解によって学習されたテーブル解析モデルである。
モデリングレベルでは、解析プロセスを人間にインスパイアされたサブタスクに分解することで、StrucTabはシーケンシャルな推論戦略を通じてそれらを段階的に統一する。
最適化レベルでは、分解された報酬を利用して安定かつ情報的最適化信号を提供する統一RLフレームワークUni-TabRLを導入する。
- 参考スコア(独自算出の注目度): 33.4550862402289
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Table parsing aims to convert table images into structured, machine-readable representations, a task requiring the joint perception of complex spatial layouts and textual content. While recent vision-language models (VLMs) enable end-to-end parsing, they typically rely on direct supervision of the final output, thereby bypassing the explicit intermediate reasoning that is crucial for understanding complex table structures. Furthermore, attempts to optimize these models using reinforcement learning (RL) are often hindered by unstable or ambiguous reward designs, limiting potential performance gains. To address these limitations, we propose StrucTab, a table parsing model learned through intermediate structural supervision and reward decomposition. At the modeling level, by decomposing the parsing process into human-inspired subtasks, such as row-column counting and merged-cell analysis, StrucTab progressively unifies them through a sequential reasoning strategy. At the optimization level, we introduce Uni-TabRL, a unified RL framework that leverages decomposed rewards (validity, structure, and content) to provide stable and informative optimization signals. Finally, at the evaluation level, we present TableVerse-5K, a large-scale, challenging benchmark encompassing diverse, real-world table scenarios. Extensive experiments demonstrate the state-of-the-art performance of StrucTab across all evaluated public benchmarks and significant improvements on TableVerse-5K, validating the effectiveness of explicit structural modeling and decomposed reward optimization. Code and benchmark are publicly available at https://github.com/VirtualLUOUCAS/StrucTab.
- Abstract(参考訳): テーブル解析は、テーブルイメージを構造化された機械可読表現に変換することを目的としている。
最近の視覚言語モデル(VLM)は、エンドツーエンドのパースを可能にするが、通常は最終的な出力の直接的な監督に依存し、複雑なテーブル構造を理解するのに不可欠な明示的な中間的推論をバイパスする。
さらに、強化学習(RL)を用いてこれらのモデルを最適化しようとする試みは、不安定または曖昧な報酬設計によってしばしば妨げられ、潜在的な性能向上を制限する。
これらの制約に対処するため、中間構造監督と報酬分解によって学習したテーブル解析モデルStrucTabを提案する。
モデリングレベルでは、行列カウントやマージセル分析など、解析プロセスを人間にインスパイアされたサブタスクに分解することで、StrucTabはシーケンシャルな推論戦略を通じてそれらを段階的に統一する。
最適化レベルでは、分割された報酬(妥当性、構造、内容)を利用して安定かつ有益な最適化信号を提供する統一RLフレームワークUni-TabRLを導入する。
最後に、評価レベルでは、多様な実世界のテーブルシナリオを含む大規模で挑戦的なベンチマークであるTableVerse-5Kを紹介する。
大規模な実験は、すべての評価された公開ベンチマークにおけるStrucTabの最先端性能とTableVerse-5Kの大幅な改善を示し、明示的な構造モデリングの有効性と分解された報酬最適化の有効性を検証した。
コードとベンチマークはhttps://github.com/VirtualLUOUCAS/StrucTabで公開されている。
関連論文リスト
- ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering [55.55968342644846]
テーブルのシリアライゼーションは、複雑なテーブル質問応答において、LLM(Large Language Models)にとって重要なボトルネックであり続けている。
既存のシリアライゼーションメソッドは明示的な階層をキャプチャできず、スキーマの柔軟性が欠如している。
本稿では,AdaSTRとDuTRの2つの主要モジュールを含むASTRA(Adaptive Semantic Tree Reasoning Architecture)を提案する。
複雑なテーブルベンチマーク実験により,本手法がSOTA(State-of-the-art)性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-10T06:09:41Z) - InstructTable: Improving Table Structure Recognition Through Instructions [18.36576098544595]
テーブル構造認識(TSR)は、広く実用化されている。
伝統的な視覚中心モデルは、重要なセマンティックサポートを欠いているが、視覚情報のみに依存している。
ビジョン誘導テーブル命令はこれらの制限に対処する。
論文 参考訳(メタデータ) (2026-04-03T08:44:45Z) - TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment [70.83664203825235]
TDATR(Table Detail-Aware Table Recognition)は、テーブルの詳細学習とセルレベルの視覚アライメントにより、エンドツーエンドのTRを改善する。
データセット固有の微調整なしで、7つのベンチマークで最先端または高い競争性能を達成する。
論文 参考訳(メタデータ) (2026-03-24T05:45:02Z) - OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling [62.3458279176813]
ソフトウェア工学のフォーマリズムのレンズを通して推論を具体化する新しいフレームワークであるオブジェクト指向世界モデリング(OOWM)を提案する。
OOWMはクラスダイアグラムを使用して、厳密なオブジェクト階層に視覚的知覚を基盤とし、アクティビティダイアグラムを使用して、計画を実行可能な制御フローに運用する。
論文 参考訳(メタデータ) (2026-02-25T16:01:07Z) - Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance [43.49944599088126]
複雑なレイアウトと密結合構造情報により、LVLM(Large Vision-Language Models)ではテーブルイメージ上の推論が依然として困難である。
既存のソリューションは、しばしば高価な教師付きトレーニング、強化学習、あるいは外部ツールに依存し、効率とスケーラビリティを制限します。
最小限のアノテーションと外部ツールなしでテーブル推論にLVLMを適用するにはどうすればよいのか?
論文 参考訳(メタデータ) (2026-02-03T13:08:31Z) - CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning [67.18702329644526]
CoT Referringは、構造化されたチェーン・オブ・シークレット・トレーニングデータ構造を通じて、モデル推論をモダリティにわたって強化する。
トレーニングデータを再構築して、新たな出力フォームを実行し、既存のデータセットに新たなアノテーションを提供します。
また、検出とセグメント化機能を統合MLLMフレームワークに統合し、新しい適応重み付き損失で学習して性能を最適化する。
論文 参考訳(メタデータ) (2025-10-03T08:50:21Z) - Same Content, Different Representations: A Controlled Study for Table QA [15.896655757672441]
リアルタイム設定におけるテーブル質問回答(Table QA)は、構造化されたデータベースとテキストフィールドを含む半構造化されたテーブルの両方で操作する必要がある。
既存のベンチマークは固定データ形式に結びついており、表現自体がモデルパフォーマンスに与える影響を体系的に検討していない。
コンテント定数を一定に保ちながら構造を変化させることによりテーブル表現の役割を分離する最初の制御された研究について述べる。
論文 参考訳(メタデータ) (2025-09-26T22:33:19Z) - TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding [52.59372043981724]
TableDARTはトレーニング効率のよいフレームワークで、事前トレーニングされた単一モダリティモデルを再利用することでマルチモーダルビューを統合する。
さらに,テキストモデルと画像モデルからの出力を解析し,モーダル間知識統合のための新しいエージェントを提案する。
論文 参考訳(メタデータ) (2025-09-18T07:00:13Z) - TableZoomer: A Collaborative Agent Framework for Large-scale Table Question Answering [26.00027389659854]
TableZoomerは、テーブル質問応答(TQA)タスクのためのプログラミングベースのエージェントフレームワークである。
2)列選択とエンティティリンクを通じてサブテーブルスキーマを動的に生成するクエリ対応テーブルズーム機構,(3)クエリを実行可能なコードに変換するプログラム・オブ・ソート(PoT)戦略により,数値幻覚を緩和する。
論文 参考訳(メタデータ) (2025-09-01T09:53:01Z) - Multimodal Tabular Reasoning with Privileged Structured Information [67.40011423365712]
ブリッジインfOrmation (sc Turbo) を用いたタブウラー推論(TabUlar Reasoning)について紹介する。
sc TurboはDeepSeek-R1をベースにした構造対応の推論トレースジェネレータの恩恵を受ける。
sc Turboは、複数のデータセットで最先端のパフォーマンス(+7.2%対以前のSOTA)を達成する。
論文 参考訳(メタデータ) (2025-06-04T15:46:30Z) - Optimization Techniques for Unsupervised Complex Table Reasoning via Self-Training Framework [5.351873055148804]
自己学習フレームワークは複雑な論理を持つ多様な合成データを生成する。
我々は「テーブル・テキスト・マニピュレータ(Table-Text Manipulator)」を用いて、共同テーブル・テキスト推論シナリオの処理を最適化する。
UCTRSTは、異なるタスクやドメインにおける教師付きモデルパフォーマンスの90%以上を達成する。
論文 参考訳(メタデータ) (2022-12-20T09:15:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。