論文の概要: FRAGMENT: Factorized Graph Representations for Document Generation and Editing via Entity-Aware Transformations
- arxiv url: http://arxiv.org/abs/2608.18679v1
- Date: Wed, 19 Aug 2026 08:29:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.343589
- Title: FRAGMENT: Factorized Graph Representations for Document Generation and Editing via Entity-Aware Transformations
- Title(参考訳): FRAGMENT:エンティティ・アウェア・トランスフォーメーションによる文書生成と編集のための因子グラフ表現
- Abstract要約: ピクセルやトークンレベルで動作している生成モデルは、しばしば空間レイアウト、テキストコンテンツ、論理構造依存を効果的に捉えるのに苦労する。
我々は、文書を型付き関係グラフとして表現し、その分布を p(structure, content) = p(structure) * p(content | structure) として分解する生成フレームワーク FRAGMENT を探索する。
DocLayNet、FUNSD、SROIEの実験では、FRAGMENTを代表的自己回帰、レイアウトのみ、グラフベースのベースラインとともに評価している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Structured documents such as invoices, forms, reports, and scientific articles derive meaning from the interplay between spatial layout, textual content, and logical structure. Generative models operating at the pixel or token level often struggle to capture these dependencies effectively. We explore FRAGMENT, a generative framework that represents a document as a typed relational graph and factorizes its distribution as p(structure, content) = p(structure) * p(content | structure). The framework consists of two stages. The first stage, the Architect, is a causally masked Transformer conditioned on document category that autoregressively generates the graph topology and typed spatial relations. The second stage, the Builder, is a GATv2-based graph attention network that enriches the graph with normalized bounding boxes, text, and visual style attributes. Both stages define explicit likelihood models, yielding a tractable document-level likelihood that serves as an anomaly score for forgery detection. For controlled editing, a prompt-conditioned extension injects instruction embeddings into the Builder through cross-attention, enabling semantic and entity-aware modifications. We describe training on DocLayNet and fine-tuning on FUNSD and SROIE. Experiments on DocLayNet, FUNSD, and SROIE evaluate FRAGMENT alongside representative autoregressive, layout-only, and graph-based baselines, providing an empirical analysis of the characteristics and trade-offs of the proposed factorized graph generation framework.
- Abstract(参考訳): 請求書、形式、報告書、科学論文などの構造化された文書は、空間的レイアウト、テキストの内容、論理的構造の間の相互作用から導かれる。
ピクセルやトークンレベルで動作している生成モデルは、これらの依存関係を効果的にキャプチャするのに苦労することが多い。
文書を型付き関係グラフとして表現し、その分布をp(構造, 内容) = p(構造) * p(コンテンツ | 構造)として分解する生成フレームワークであるFRAGMENTについて検討する。
フレームワークは2つのステージで構成されます。
第1段階であるArchitectは、グラフトポロジと型付き空間関係を自動回帰的に生成する文書カテゴリに規定された因果マスク付きトランスフォーマーである。
2番目のステージであるBuilderは、GATv2ベースのグラフアテンションネットワークで、正規化されたバウンディングボックス、テキスト、ビジュアルスタイルの属性でグラフを強化する。
どちらの段階も明示的な可能性モデルを定義しており、偽造検出の異常スコアとして機能する、抽出可能な文書レベルの可能性を与える。
制御された編集のために、プロンプト条件付き拡張は、クロスアテンションを通じてビルダーに命令の埋め込みを注入し、セマンティックおよびエンティティ対応の修正を可能にする。
DocLayNetのトレーニングとFUNSDとSROIEの微調整について述べる。
DocLayNet、FUNSD、SROIEの実験では、FRAGMENTを代表的自己回帰、レイアウトのみ、グラフベースのベースラインと共に評価し、提案した分解グラフ生成フレームワークの特性とトレードオフを実証分析した。
関連論文リスト
- Semantic-Structural Alignment for Generative Pictorial Charts [59.45629259524998]
画像チャートの自動合成のための生成フレームワークを提案する。
2つの並列外部制御信号によって誘導される二重条件生成タスクとしてこの問題をモデル化する。
本手法は,芸術的に魅力的で構造的に整合性のある図表を生成する。
論文 参考訳(メタデータ) (2026-05-05T05:20:46Z) - Graph Construction and Matching for Imperative Programs using Neural and Structural Methods [0.0]
命令型プログラムとそのアノテーションを型付き属性グラフに変換するパイプラインを提案する。
私たちの実験では、C with ACSL、Java with JML、Dafny for C#といったデータセットをカバーしています。
論文 参考訳(メタデータ) (2026-04-29T11:59:53Z) - Hierarchical Graph Topic Modeling with Topic Tree-based Transformer [35.554979581137296]
本稿では,文書内のトピック階層と文書間のグラフ階層を統合する階層型グラフトピックモデリング変換器を提案する。
話題とグラフの階層性の両方を保存するため,ハイパーボリック空間におけるモデルの設計と,ハイパーボリックダブルリカレントニューラルネットワークの提案を行う。
教師なし実験と教師なし実験の両方が、我々のモデルの有効性を検証する。
論文 参考訳(メタデータ) (2025-02-17T01:55:29Z) - A Pure Transformer Pretraining Framework on Text-attributed Graphs [50.833130854272774]
グラフ構造を先行として扱うことで,特徴中心の事前学習の視点を導入する。
我々のフレームワークであるGraph Sequence Pretraining with Transformer (GSPT)はランダムウォークを通してノードコンテキストをサンプリングする。
GSPTはノード分類とリンク予測の両方に容易に適応でき、様々なデータセットで有望な経験的成功を示す。
論文 参考訳(メタデータ) (2024-06-19T22:30:08Z) - A Semantic Mention Graph Augmented Model for Document-Level Event Argument Extraction [12.286432133599355]
Document-level Event Argument extract (DEAE)は、構造化されていないドキュメントから引数とその特定の役割を特定することを目的としている。
DEAEの先進的なアプローチは、事前訓練された言語モデル(PLM)を誘導するプロンプトベースの手法を用いて、入力文書から引数を抽出する。
本稿では,この2つの問題に対処するために,グラフ拡張モデル (GAM) のセマンティック言及を提案する。
論文 参考訳(メタデータ) (2024-03-12T08:58:07Z) - GraphKD: Exploring Knowledge Distillation Towards Document Object
Detection with Structured Graph Creation [14.511401955827875]
ドキュメントにおけるオブジェクト検出は、構造的要素の識別プロセスを自動化するための重要なステップである。
文書画像中の文書オブジェクトを正しく識別し,ローカライズするための,グラフベースの知識蒸留フレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-17T23:08:32Z) - Enhancing Visually-Rich Document Understanding via Layout Structure
Modeling [91.07963806829237]
レイアウトの知識をモデルに注入する新しい文書理解モデルであるGraphLMを提案する。
我々は、FUNSD、XFUND、CORDなど様々なベンチマークでモデルを評価し、最先端の結果を得た。
論文 参考訳(メタデータ) (2023-08-15T13:53:52Z) - Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text
Documents via Semantic-Oriented Hierarchical Graphs [79.0426838808629]
視覚的にリッチなテーブルテキスト文書に答えるTAT-DQAを提案する。
具体的には、離散推論機能を強化した新しいDoc2SoarGraphフレームワークを提案する。
我々は,TAT-DQAデータセットに関する広範な実験を行い,提案したフレームワークは,テストセット上でのエクサクティマッチ(EM)とF1スコアでそれぞれ17.73%,F1スコアで16.91%の最高のベースラインモデルを上回る結果を得た。
論文 参考訳(メタデータ) (2023-05-03T07:30:32Z) - Entity Type Prediction Leveraging Graph Walks and Entity Descriptions [4.147346416230273]
textitGRANDは、RDF2vecの異なるグラフウォーク戦略とテキストエンティティ記述を利用したエンティティ型付けの新しいアプローチである。
提案手法は,細粒度クラスと粗粒度クラスの両方において,KGにおけるエンティティ型付けのためのベンチマークデータセットDBpediaとFIGERのベースラインアプローチよりも優れている。
論文 参考訳(メタデータ) (2022-07-28T13:56:55Z) - Iterative Scene Graph Generation [55.893695946885174]
シーングラフ生成は、オブジェクトエンティティとその対応する相互作用述語を所定の画像(またはビデオ)で識別する。
シーングラフ生成への既存のアプローチは、推定イテレーションの実現を可能にするために、関節分布の特定の因子化を前提としている。
本稿では,この制限に対処する新しいフレームワークを提案するとともに,画像に動的条件付けを導入する。
論文 参考訳(メタデータ) (2022-07-27T10:37:29Z) - FactGraph: Evaluating Factuality in Summarization with Semantic Graph
Representations [114.94628499698096]
文書と要約を構造化された意味表現(MR)に分解するFactGraphを提案する。
MRは、コアセマンティックの概念とその関係を記述し、文書と要約の両方の主要な内容を標準形式で集約し、データの疎結合を減少させる。
事実性を評価するための異なるベンチマークの実験では、FactGraphは以前のアプローチよりも最大15%優れていた。
論文 参考訳(メタデータ) (2022-04-13T16:45:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。