論文の概要: Q&A on Any Spreadsheet Requires Interpreting Its Grid Structure
- arxiv url: http://arxiv.org/abs/2609.20732v1
- Date: Thu, 17 Sep 2026 17:22:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.39946
- Title: Q&A on Any Spreadsheet Requires Interpreting Its Grid Structure
- Title(参考訳): グリッド構造を解釈する必要のあるスプレッドシートに関するQ&A
- Abstract要約: 本稿では,任意のスプレッドシートをセルロールアノテーションを用いて解釈可能なチャンクに分割する新しいフレームワークを提案する。
我々は,スプレッドシートからLLMへのボトルネックに対処するには,個別の細胞分類を超えて移動する必要があることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic cell annotation improves chunking interpretability for spreadsheets in LLM-driven RAG systems, aiding answer generation through enriched context rather than improved retrieval accuracy. We propose a novel framework of splitting any spreadsheet into interpretable chunks using cell role annotation. Our framework beats the state of the art, yet it faces a hard ceiling. Spreadsheets are fundamentally two-dimensional unstructured data with continuous relationships and infinite potential cell roles. Because classification models are restricted to finite, pre-defined classes, they cannot perfectly capture this structural nuance, even with human-level annotation. We show that addressing the spreadsheet-to-LLM bottleneck requires moving beyond discrete cell classification. Instead, the field must develop dimensionality-reduction techniques to directly flatten 2D unstructured spreadsheets into 1D unstructured text. Text chunks would be easier for downstream RAG to interpret and generate from.
- Abstract(参考訳): セマンティックセルアノテーションは, LLM駆動RAGシステムにおけるスプレッドシートのチャンキング解釈性を向上し, 検索精度を向上させるのではなく, リッチコンテキストによる回答生成を支援する。
本稿では,任意のスプレッドシートをセルロールアノテーションを用いて解釈可能なチャンクに分割する新しいフレームワークを提案する。
私たちのフレームワークは最先端に勝っているが、厳しい天井に直面している。
スプレッドシートは基本的に2次元の非構造データであり、連続的な関係と無限の可能性を持つ。
分類モデルは有限で定義済みのクラスに制限されているため、人間レベルのアノテーションであっても、この構造的ニュアンスを完全に捉えることはできない。
我々は,スプレッドシートからLLMへのボトルネックに対処するには,個別の細胞分類を超えて移動する必要があることを示す。
その代わりに、フィールドは2次元の非構造化のスプレッドシートを直接1次元の非構造化のテキストに平らにする次元還元技術を開発する必要がある。
テキストチャンクは、下流のRAGが解釈し、生成しやすくなる。
関連論文リスト
- SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning [13.891450098227573]
本論文では,スプレッドシート推論と自動化のためのグラフ誘導型,メモリ駆動型フレームワークであるSheetsを提案する。
Sheetは、メモリ上のタスク関連情報を維持しながら、ワークシート内およびワークシート間の構造的関係を明示的にモデル化する。
論文 参考訳(メタデータ) (2026-08-14T16:39:16Z) - SemStruct: Contextualizing Semantic Embeddings with Structural Information for Schema Matching [20.959946127503354]
グラフニューラルネットワーク(GNN)の構造帰納バイアスと冷凍PLMのセマンティックパワーを結合するフレームワークであるSemStructを提案する。
テーブルを、列と値が列で連結されたノードである異種グラフとしてモデル化し、GNNが構造全体にわたってあいまいなコンテキストを伝播できるようにする。
論文 参考訳(メタデータ) (2026-05-29T01:45:45Z) - TabEmb: Joint Semantic-Structure Embedding for Table Annotation [3.03279900330493]
テーブルアノテーションは、下流のNLPアプリケーションで使えるWebおよびエンタープライズテーブルを作るのに不可欠である。
既存のモデルは、2Dテーブルを1Dトークンシーケンスに線形化し、事前訓練された言語モデルでエンコードすることで学習する。
本研究では,構造モデリングからセマンティックエンコーディングを分離することで,これらの制約を直接ターゲットとするTabEmbを提案する。
論文 参考訳(メタデータ) (2026-04-21T00:25:49Z) - TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment [70.83664203825235]
TDATR(Table Detail-Aware Table Recognition)は、テーブルの詳細学習とセルレベルの視覚アライメントにより、エンドツーエンドのTRを改善する。
データセット固有の微調整なしで、7つのベンチマークで最先端または高い競争性能を達成する。
論文 参考訳(メタデータ) (2026-03-24T05:45:02Z) - How Do Language Models Understand Tables? A Mechanistic Analysis of Cell Location [53.68149869349268]
細胞位置の原子的タスクを分離することにより,テーブル理解の過程を解明する。
モデルは、座標を解くために離散をカウントする順序機構を介して標的セルを特定することを実証する。
我々は,原子配置中に同定された同一のアテンションヘッドを多重化することにより,モデルがマルチセル位置タスクに一般化できることを明らかにする。
論文 参考訳(メタデータ) (2026-02-09T11:47:34Z) - Generative Retrieval for Book search [106.67655212825025]
書籍検索のための効率的な生成検索フレームワークを提案する。
データ拡張とアウトライン指向の書籍エンコーディングの2つの主要コンポーネントがある。
プロプライエタリなBaiduデータセットの実験では、GBSが強力なベースラインを上回ることが示されている。
論文 参考訳(メタデータ) (2025-01-19T12:57:13Z) - SRFUND: A Multi-Granularity Hierarchical Structure Reconstruction Benchmark in Form Understanding [55.48936731641802]
階層的に構造化されたマルチタスク形式理解ベンチマークであるSRFUNDを提案する。
SRFUNDはオリジナルのFUNSDとXFUNDデータセットの上に洗練されたアノテーションを提供する。
データセットには、英語、中国語、日本語、ドイツ語、フランス語、スペイン語、イタリア語、ポルトガル語を含む8つの言語が含まれている。
論文 参考訳(メタデータ) (2024-06-13T02:35:55Z) - SEMv2: Table Separation Line Detection Based on Instance Segmentation [96.36188168694781]
SEMv2(SEM: Split, Embed, Merge)と呼ばれるテーブル構造認識器を提案する。
本稿では,テーブル分離ラインのインスタンスレベルの識別問題に対処し,条件付き畳み込みに基づくテーブル分離ライン検出戦略を提案する。
SEMv2を包括的に評価するために、iFLYTABと呼ばれるテーブル構造認識のためのより困難なデータセットも提示する。
論文 参考訳(メタデータ) (2023-03-08T05:15:01Z) - Robust (Controlled) Table-to-Text Generation with Structure-Aware
Equivariance Learning [24.233552674892906]
制御されたテーブル・トゥ・テキスト生成は、テーブルのハイライトされた部分の自然言語記述を生成する。
構造認識型自己認識機構で表を符号化する等分散学習フレームワークを提案する。
我々の技術は、既存のテーブル・ツー・テキスト生成モデルに自由にプラグインでき、T5ベースのモデルを改善し、ToTToとHiTabのパフォーマンスを改善しました。
論文 参考訳(メタデータ) (2022-05-08T23:37:27Z) - Visual Understanding of Complex Table Structures from Document Images [32.95187519339354]
本稿では,テーブル内におけるセル固有のアライメントをキャプチャするオブジェクト検出に基づく新しいディープモデルを提案する。
また,新しい直線グラフに基づく定式化を導出することにより,構造認識の改善も目指している。
我々のフレームワークは、ベンチマークデータセットの平均F1スコアを2.7%改善する。
論文 参考訳(メタデータ) (2021-11-13T14:54:33Z) - SpreadsheetCoder: Formula Prediction from Semi-structured Context [70.41579328458116]
行ベースと列ベースの両方のフォーマットで表されるコンテキストを表現するために,BERTベースのモデルアーキテクチャを提案する。
我々はスプレッドシートの大きなデータセットでモデルをトレーニングし、SpreadsheetCoderが42.51%の予測精度でトップ1の予測を達成できることを実証した。
ルールベースのシステムと比較すると、SpreadsheetCoder 82%は、Google Sheetsで公式を作成する上で、より多くのユーザを支援する。
論文 参考訳(メタデータ) (2021-06-26T11:26:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。