論文の概要: Joint Training Is Not Enough: Conditioned Cross-Granularity Training for Multimodal Document Understanding
- arxiv url: http://arxiv.org/abs/2609.00756v1
- Date: Tue, 01 Sep 2026 05:39:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.404835
- Title: Joint Training Is Not Enough: Conditioned Cross-Granularity Training for Multimodal Document Understanding
- Title(参考訳): 共同トレーニングは十分ではない:マルチモーダル文書理解のための条件付きクロスグラニティトレーニング
- Authors: Chengguang Gan, Yunhao Liang, Hanjun Wei, Qinghao Zhang, Shiwen Ni,
- Abstract要約: 相互強化効果(MRE)は、細かなスパンレベルと粗いドキュメントレベルのタスクが、1つのモデルが両方を扱うときに互いに助け合うかどうかを問う。
3つのコーパス、レシートの2つ、スキャンされたビジネスフォームの1つについて、マルチモーダル文書で検証する。
- 参考スコア(独自算出の注目度): 10.045662399356042
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The Mutual Reinforcement Effect (MRE) asks whether a fine, span-level and a coarse, document-level task help each other when one model handles both. We test it in multimodal document understanding on three corpora, two of receipts and one of scanned business forms, comparing single-task, joint and conditioned training, which puts one granularity's gold output in the other's prompt during training only. We build Doc-MRE, an annotation layer pairing gold field extraction (point) with four document-level facets (line), from a three-judge LLM committee under a pre-registration, validated by blind re-annotation. One predicate, fixed in advance: at a shared recipe, a regime reinforces if it beats the matched single-task model on both granularities. Mixed joint training, the arrangement prior MRE work assumes, reinforces on no corpus at the main scale: it is below both single-task models on CORD and trades one granularity for the other on the two others, as single-task tuning does. Conditioned training reinforces on two of the three, CORD (+0.5 point, +4.8 line) and the forms corpus (+7.2 point, +11.0 line), resolvably on the coarse side and directionally on the fine one, and trades on WildReceipt; at that recipe no alternative measurably beats it on either side anywhere. Two byte-identical-prompt controls separate content from format: shuffled conditioning destroys the coarse-side skill but costs the fine side far less, and a neutral-content control reproduces the whole fine-side gain on WildReceipt, which is therefore prompt structure but buys nothing resolvable on the other two. On the forms corpus conditioning buys collapse avoidance: mixed training and the neutral control both assign the majority semantic label to all 50 test documents; only conditioning recovers the gold distribution. Probes find the information decodable under every regime with no resolvable increase under conditioning.
- Abstract(参考訳): 相互強化効果(MRE: Mutual Reinforcement Effect)は、細かなスパンレベルと粗いドキュメントレベルのタスクが、1つのモデルが両方を扱うときに互いに助け合うかどうかを問うものである。
3つのコーパス、レシートの2つ、スキャンされたビジネスフォームの1つをマルチモーダル文書で比較し、シングルタスク、ジョイント、コンディションドトレーニングを比較し、トレーニング中のみ、一方の粒度の金出力を他方のプロンプトに配置する。
文書レベルの4つのファセット(ライン)とゴールドフィールド抽出(ポイント)を組み合わせたアノテーション層であるDoc-MREを,事前登録の下で3段階のLCM委員会から作成し,ブラインド再アノテーションにより検証する。
1つの述語が事前に固定されている:共有レシピでは、両方の粒度の一致したシングルタスクモデルに勝つと、レジームが強化される。
混合ジョイントトレーニング(MRE)は、MREの作業が前提としており、主要なスケールでのコーパスの強化であり、CORD上の2つのシングルタスクモデルより下位にあり、シングルタスクチューニングのように、他の2つのモデルに対して1つの粒度を交換する。
CORD(+0.5ポイント、+4.8ライン)とコーパス(+7.2ポイント、+11.0ライン)の2つの条件付きトレーニングが強化され、粗い側と細かい側で順に解決され、WildReceiptで取引される。
シャッフル条件は粗い側スキルを破壊するが、細い側ははるかに安くなり、中立なコンテンツ制御はWildReceiptの全細い側ゲインを再現する。
コーパス条件付け(英語版)は崩壊回避(英語版)を購入:混合トレーニングと中立制御の両方が50の試験文書すべてに多数意味ラベルを割り当て、条件付けのみが金の分布を回復する。
調査員は、条件付きで解決可能な増加を伴わない、すべての体制下でデオード可能な情報を見つける。
関連論文リスト
- SciTrue: Reliable Scientific Claim Validation with Frontier and Open Language Models at the NTCIR SciClaimEval Task [15.259880314614117]
11のフロンティアとオープンなマルチモーダルモデルを1つの正直なサンプル・プロトコルでベンチマークする。
SciTrueは4つのエビデンスカテゴリ/サブタスクの組み合わせのうち3つに明確なマージンを付けている。
論文 参考訳(メタデータ) (2026-09-01T03:30:45Z) - Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models [29.95046057406594]
統一マルチモーダルモデル(UMM)は、理解と生成が互いに強化されるという希望によって動機付けられている。
建設によるUMMにおける2方向の関係について検討する。
どちらの方向でもチャネルが本物であることは分かるが、方向は様々である。
論文 参考訳(メタデータ) (2026-08-18T09:23:35Z) - Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes [70.61868608402723]
我々は$textbfSelf-Correcting Coupled Markov Jump Processes (SC-CMJP)を紹介する。
SC-CMJPと組み合わせて、共同マルチモーダルジェネレーションのための新しいトレーニングフリーシングルパスサンプリングであるtextttCO_texttt2textttJump$を紹介する。
トレーニングと評価のために,我々は3つの大規模ジョイントマルチモーダル生成コーパスを作成し,リリースする。
論文 参考訳(メタデータ) (2026-07-14T18:39:29Z) - Collaborative Learning for Semi-Supervised LiDAR Semantic Segmentation [51.15174185939441]
LiDAR半教師付きセグメンテーション(CoLLiS)のための協調学習
CoLLiSは、同じ学生として扱うことで、複数の表現をひとつのステップで協調的に訓練する。
3つのデータセットの実験では、CoLLiSが最先端のLiDAR SemiSLメソッドを一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2026-05-16T19:58:41Z) - Methods for Formal Verification of Agent Skills: Three Layers Toward a Mechanically Checkable Capability-Containment Proof [0.0]
LLM駆動のランタイムによってどのようにスキルが消費されるかに忠実なスキル行動に関する正確なセマンティクスを提供します。
本稿では,定式化や定式化によるスキル向上を両立させる構成可能な3つの手法を提案する。
これら3つのメソッドに加えて、バンドルプロデューサと再チェッカーは、オープンソースエンクロードフレームワークのゼロ依存JavaScriptモジュールとして出荷される。
論文 参考訳(メタデータ) (2026-05-09T19:27:38Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning [9.137158235106941]
ExecVerifyは、実行トレースから得られた検証済みのホワイトボックス報酬を組み込むことで、テキストの模倣を越えている。
ExecVerifyでトレーニングされた7Bモデルは、コード推論ベンチマークで32Bモデルに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T18:49:45Z) - Noisy-Correspondence Learning for Text-to-Image Person Re-identification [50.07634676709067]
本稿では,雑音対応においても頑健な視覚関係を学習するための新しいロバスト二重埋め込み法(RDE)を提案する。
提案手法は,3つのデータセット上での合成ノイズ対応と非合成ノイズ対応を両立させる。
論文 参考訳(メタデータ) (2023-08-19T05:34:13Z) - Reinforcing Semantic-Symmetry for Document Summarization [15.113768658584979]
文書要約は、長い文書を詳細な情報と正確な意味記述を備えた短いバージョンに凝縮する。
本稿では,文書要約のための新しいtextbfreinforcing stextbfemantic-textbfsymmetric Learning textbfmodelを提案する。
CNN/Daily MailとBigPatentの2つの大胆なベンチマークデータセットに対して、一連の実験が行われた。
論文 参考訳(メタデータ) (2021-12-14T17:41:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。