論文の概要: DiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression Generation
- arxiv url: http://arxiv.org/abs/2606.19939v1
- Date: Thu, 18 Jun 2026 08:37:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.736229
- Title: DiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression Generation
- Title(参考訳): DiffMath:手書き数式生成のための記号・グラフ対応潜時拡散変換器
- Authors: Wei Pan, Xuhan Zheng, Yilin Shi, Huiguo He, Hiuyi Cheng, Dezhi Peng, Minghui Liao, Lianwen Jin,
- Abstract要約: 手書きの数学的表現生成(HMEG)は複雑な2次元レイアウトと長距離依存のため困難である。
本研究では,シンボル指向グラフ対応潜在拡散フレームワークDiffMathを提案する。
実験により、DiffMathは構造的に一貫した手書き表現を生成し、既存の手法よりも優れた性能を示し、下流モデルの精度を向上させる。
- 参考スコア(独自算出の注目度): 47.67907704295109
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Handwritten Mathematical Expression Generation (HMEG) is challenging due to the complex two-dimensional layouts and long-range structural dependencies of mathematical expressions. Existing methods typically rely on explicit spatial supervision, such as symbol-level bounding boxes, which incurs high annotation costs and limits scalability. In this work, we propose DiffMath, a symbol- and graph-aware latent diffusion framework that leverages the hierarchical structure inherent in LaTeX as a structural prior, eliminating the need for positional supervision. First, we design a Relational Abstract Syntax Tree (RelAST), a generation-oriented representation that distills MathML trees into compact triplet sequences [S, R, D], where each token directly encodes a symbol identity, spatial relation, or nesting depth. Second, we introduce MathVAE, which learns structure-preserving latent representations through symbol-aware and relation-aware perceptual regularization, ensuring that the latent space captures both character semantics and spatial topology. Third, MathDiT performs conditional denoising in this structured latent space, further guided by a global symbol-count prior via Adaptive Layer Normalization (AdaLN) to improve structural coherence. Experiments show that DiffMath produces structurally consistent handwritten expressions, achieves superior performance over existing methods, and improves the accuracy of downstream OCR models through synthetic data augmentation.
- Abstract(参考訳): 手書きの数学的表現生成(HMEG)は、複雑な2次元のレイアウトと、数学的表現の長距離構造的依存関係のために困難である。
既存の手法は通常、シンボルレベルのバウンディングボックスのような明示的な空間監督に依存しており、高いアノテーションコストと拡張性を制限する。
本研究では,LTeXに固有の階層構造を先行構造として利用し,位置管理の必要性を排除したシンボルおよびグラフ対応潜在拡散フレームワークであるDiffMathを提案する。
まず、RelAST(Relational Abstract Syntax Tree)を設計し、MathMLツリーをコンパクトな三重項列[S, R, D]に蒸留し、各トークンがシンボルID、空間関係、ネスト深さを直接符号化する世代指向の表現を設計する。
第2に、シンボル認識と関係認識による知覚正規化を通じて構造保存された潜在表現を学習し、潜在空間が文字意味論と空間トポロジーの両方をキャプチャすることを保証するMathVAEを導入する。
第3に、MathDiTは、構造的コヒーレンスを改善するために、アダプティブ層正規化(AdaLN)を介して、グローバルなシンボルカウントによって導かれる、この構造的潜在空間における条件記述を行う。
実験により、DiffMathは構造的に一貫した手書き表現を生成し、既存の手法よりも優れた性能を実現し、合成データ拡張により下流OCRモデルの精度を向上させることが示された。
関連論文リスト
- From Extrinsic to Intrinsic: Geodesic-Guided Representation Learning for 3D Geometric Data [56.41479248637621]
我々は,textbfPreトレーニングのための新しい3D表現学習パラダイムであるtextbfPRISMを紹介した。
PRISMは textbfIntrinsic textbfSurface geodesic textbfMetric を検索して埋め込みを学習する。
提案手法は測地線距離予測において, 良好な精度, 堅牢性, 高効率性を示す。
論文 参考訳(メタデータ) (2026-06-01T13:54:26Z) - TERGAD: Structure-Aware Text-Enhanced Representations for Graph Anomaly Detection [15.051477921035264]
Graph Anomaly Detection (GAD) は、ノード、エッジ、サブ構造などの非定型的なグラフエンティティを、多数派から大きく逸脱することを目的としている。
既存のテキストリッチアプローチは通常、生のテキスト機能を使って構造的コンテキストをデータ表現パイプラインに統合する。
本稿では,大規模言語モデルの意味論的推論機能を通じてGADの構造的意味論を充実させる新しいデータ拡張フレームワークであるTERGADを提案する。
論文 参考訳(メタデータ) (2026-05-19T12:09:36Z) - $\mathcal{S}^2$IT: Stepwise Syntax Integration Tuning for Large Language Models in Aspect Sentiment Quad Prediction [51.165432266846096]
構文構造情報は、大言語モデル(LLM)の生成パラダイムにおいて未利用である
S2ITは、多段階のチューニングプロセスを通じて、構文構造知識をLLMに徐々に統合する。
実験により、S2ITは複数のデータセットにわたる最先端のパフォーマンスを大幅に改善することが示された。
論文 参考訳(メタデータ) (2026-04-25T13:24:29Z) - NAG: A Unified Native Architecture for Encoder-free Text-Graph Modeling in Language Models [33.49410203951687]
このアプローチはテキストグラフに最適である,と我々は主張する。
NAG(Native Architecture for Graphs)は、言語モデル内でグラフ処理を内部化する統合フレームワークである。
NAGは外部エンコーダのオーバーヘッドなしに堅牢なグラフ理解を実現する。
論文 参考訳(メタデータ) (2026-01-30T07:22:11Z) - PosFormer: Recognizing Complex Handwritten Mathematical Expression with Position Forest Transformer [51.260384040953326]
手書き数学的表現認識(HMER)は、人間と機械の相互作用シナリオに広く応用されている。
本稿では,HMERのための位置フォレスト変換器(PosFormer)を提案する。
PosFormerは、最先端のメソッドである2.03%/1.22%/2、1.83%、および4.62%を一貫して上回っている。
論文 参考訳(メタデータ) (2024-07-10T15:42:58Z) - Frame Averaging for Equivariant Shape Space Learning [85.42901997467754]
形状空間学習に対称性を組み込む自然な方法は、形状空間(エンコーダ)への写像と形状空間(デコーダ)からの写像が関連する対称性に同値であることを問うことである。
本稿では,2つのコントリビューションを導入することで,エンコーダとデコーダの等価性を組み込む枠組みを提案する。
論文 参考訳(メタデータ) (2021-12-03T06:41:19Z) - A Study of Continuous Vector Representationsfor Theorem Proving [2.0518509649405106]
我々は,論理特性の保存と可逆性を考慮したエンコードを開発した。
これは、すべての記号を含む公式のツリー形状が密度ベクトル表現から再構築できることを意味する。
これらの構文的および意味的特性のトレーニングに使用できるデータセットを提案する。
論文 参考訳(メタデータ) (2021-01-22T15:04:54Z) - Structure-Augmented Text Representation Learning for Efficient Knowledge
Graph Completion [53.31911669146451]
人為的な知識グラフは、様々な自然言語処理タスクに重要な支援情報を提供する。
これらのグラフは通常不完全であり、自動補完を促す。
グラフ埋め込みアプローチ(例えばTransE)は、グラフ要素を密度の高い埋め込みに表現することで構造化された知識を学ぶ。
テキストエンコーディングアプローチ(KG-BERTなど)は、グラフトリプルのテキストとトリプルレベルの文脈化表現を利用する。
論文 参考訳(メタデータ) (2020-04-30T13:50:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。