論文の概要: Bridging Online and Offline Handwriting via Differentiable Physical Rendering
- arxiv url: http://arxiv.org/abs/2608.03198v1
- Date: Tue, 04 Aug 2026 06:39:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.062214
- Title: Bridging Online and Offline Handwriting via Differentiable Physical Rendering
- Title(参考訳): 識別可能な物理レンダリングによるオンライン・オフライン手書きのブリッジ
- Authors: Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon,
- Abstract要約: 識別可能なブラシレンダリングによるオンラインオフライン手書き生成フレームワークを提案する。
提案するフレームワークは、4つのコアモジュールから構成される。1)所定のテキストとスタイル画像に基づいて目標ストロークを予測するテキストストローク生成装置、2)スタイル参照からブラシモデルパラメータを抽出するブラシパラメータオブザーバ、3)ストロークシーケンスを手書き画像にマッピングする微分可能なブラシ、4)レンダリング画像の精細化を行うゼロショット画像リファクタ。
- 参考スコア(独自算出の注目度): 32.06536846087488
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Realistic handwritten text generation plays an important role in numerous applications, such as font design, biometric authentication, and robotic calligraphy. Existing methods are typically divided into two independent paradigms: online approaches that estimate handwriting trajectories and offline approaches that synthesize realistic handwriting images. While online models capture structural and temporal dynamics, they often lack fine-grained textures, whereas offline models reproduce realistic appearance but discard stroke order. However, unifying online and offline models remains challenging due to (1) the lack of an explicit physical model linking stroke kinematics to pixel-level appearance and (2) the absence of paired trajectory-image datasets. Moreover, enabling end-to-end learning requires a differentiable rendering process across motion and appearance domains. To address these challenges, we propose a compact physical brush model that bridges stroke dynamics and visual appearance, together with a differentiable rendering module that converts stroke trajectories into stylized images. By integrating these components, we propose a unified online-offline handwriting generation framework via differentiable brush rendering. The proposed framework consists of four core modules: 1) a text-to-stroke generator that predicts the target stroke conditioned on the given text and style image, 2) a brush parameter observer that extracts brush model parameters from style references, 3) a differentiable brush renderer that maps a stroke sequence and physical brush parameters into a handwritten image, and 4) a zero-shot image refiner that refines rendered images via diffusion models. Extensive experiments and real-world robotic calligraphy demonstrations validate our approach, achieving both structural and visual fidelity.
- Abstract(参考訳): 現実的な手書きテキスト生成はフォント設計、生体認証、ロボット書記など多くのアプリケーションにおいて重要な役割を果たしている。
既存の手法は通常、2つの独立したパラダイムに分けられる:手書きの軌跡を推定するオンラインアプローチと、現実的な手書きイメージを合成するオフラインアプローチである。
オンラインモデルは構造的・時間的ダイナミクスを捉えるが、しばしば細かいテクスチャを欠くが、オフラインモデルは現実的な外観を再現するが、ストロークオーダーは捨てる。
しかし,オンラインモデルとオフラインモデルの統合は,(1)ストロークキネマティクスをピクセルレベルの外観に結びつける明示的な物理モデルがないこと,(2)ペア化された軌跡画像データセットがないことなどから,依然として困難である。
さらに、エンドツーエンドの学習を可能にするには、動作領域と外観領域をまたいだ異なるレンダリングプロセスが必要である。
これらの課題に対処するために、脳卒中動態と視覚的外観をブリッジするコンパクトな物理ブラシモデルと、脳卒中軌跡をスタイリングされた画像に変換する識別可能なレンダリングモジュールを提案する。
これらのコンポーネントを統合することにより、識別可能なブラシレンダリングによるオンラインオフライン手書き生成フレームワークを提案する。
提案するフレームワークは4つのコアモジュールで構成されている。
1)所定のテキスト及びスタイル画像に条件付けされた目標ストロークを予測するテキストストローク生成装置。
2)スタイル参照からブラシモデルパラメータを抽出するブラシパラメータオブザーバ
3)ストロークシーケンスと物理ブラシパラメータを手書き画像にマッピングする識別可能なブラシレンダラー
4) 拡散モデルによるレンダリング画像の精錬を行うゼロショット画像精錬器。
大規模な実験と実世界のロボット書道デモは、構造的および視覚的忠実性の両方を達成し、我々のアプローチを検証する。
関連論文リスト
- Single-Line Drawing Generation via Semantics-Driven Optimization [51.26529682867565]
本稿では,ベクトル形式で1行の描画を自動的に生成するセマンティクス駆動方式を提案する。
本手法は,一様有理B-スプライン曲線(URBS)のパラメータを最適化するために,スコア蒸留サンプリングを利用する。
本手法はベクトル化曲線を生成するため, 直結する下流加工プロセス, レーザーエッチング, ワイヤ曲げなどの加工を支援できる。
論文 参考訳(メタデータ) (2026-06-01T08:46:22Z) - Semantic-Structural Alignment for Generative Pictorial Charts [59.45629259524998]
画像チャートの自動合成のための生成フレームワークを提案する。
2つの並列外部制御信号によって誘導される二重条件生成タスクとしてこの問題をモデル化する。
本手法は,芸術的に魅力的で構造的に整合性のある図表を生成する。
論文 参考訳(メタデータ) (2026-05-05T05:20:46Z) - Data-Efficient Brushstroke Generation with Diffusion Models for Oil Painting [60.15416769662556]
そこで本研究では,手書きサンプルの小さなセットから人型ブラシストローク生成を学習する問題について検討する。
Smooth Regularization (SmR) を用いた拡散型フレームワーク StrokeDiff を提案する。
学習したプリミティブをBézierベースの条件付けモジュールで制御可能であることを示す。
論文 参考訳(メタデータ) (2026-03-01T13:42:35Z) - VideoSketcher: Video Models Prior Enable Versatile Sequential Sketch Generation [73.23035143627598]
ほとんどの生成モデルはスケッチを静的なイメージとして扱い、創造的な描画の根底にある時間構造を見渡す。
本稿では,事前学習したテキスト・ビデオ拡散モデルに適応した逐次スケッチ生成のためのデータ効率のよい手法を提案する。
本手法は,テキスト指定順序を忠実に追従する高品質なスケッチを生成するとともに,リッチな視覚的ディテールを示す。
論文 参考訳(メタデータ) (2026-02-17T18:55:03Z) - ScriptViT: Vision Transformer-Based Personalized Handwriting Generation [0.0]
スタイル付き手書き文字生成は、写実的で、特定のライターのスタイルと整合した手書きテキストを合成することを目的としている。
複数の参照画像からグローバルなスタイルパターンを学習するビジョントランスフォーマー方式のエンコーダを提案する。
次に、これらのスタイルキューをクロスアテンション機構を用いて対象のテキストと統合し、より忠実に意図したスタイルを反映した手書き画像を生成する。
論文 参考訳(メタデータ) (2025-11-23T06:38:23Z) - Birth of a Painting: Differentiable Brushstroke Reconstruction [25.61763988336406]
絵画は視覚的なストーリーテリングのユニークな形態を具現化しており、創造過程は最終作品と同じくらい重要である。
我々のアプローチはリアルでスタイリッシュな外観を生み出し、デジタル絵画の統一モデルを提供する。
論文 参考訳(メタデータ) (2025-11-17T09:55:53Z) - Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation [25.834500552609136]
I2V(Image-to-Video)合成により,実世界の静的絵画を生かしたトレーニングフリーフレームワークを提案する。
既存のI2V手法は、主に自然なビデオデータセットに基づいて訓練されており、静的な絵画から動的出力を生成するのに苦労することが多い。
我々のフレームワークは既存のI2V手法とプラグイン・アンド・プレイの統合を可能にし、現実世界の絵画をアニメーション化するのに理想的なソリューションとなる。
論文 参考訳(メタデータ) (2025-03-31T05:25:49Z) - AI Illustrator: Translating Raw Descriptions into Images by Prompt-based
Cross-Modal Generation [61.77946020543875]
本稿では,複雑な意味論による生の記述を意味的に対応する画像に翻訳するフレームワークを提案する。
本フレームワークは,テキスト埋め込みから画像埋め込みへのプロンプトに基づくプロジェクションモジュールと,StyleGAN上に構築された適応画像生成モジュールの2つのコンポーネントから構成される。
本手法は,事前学習モデルに適合し,複雑な記述を処理でき,外部のペアデータを必要としない。
論文 参考訳(メタデータ) (2022-09-07T13:53:54Z) - Adaptively-Realistic Image Generation from Stroke and Sketch with
Diffusion Model [31.652827838300915]
拡散モデルに基づくスケッチやストロークからの画像合成を3次元制御する統合フレームワークを提案する。
我々のフレームワークは、形状、色、リアリズムを制御したカスタマイズ画像の生成に柔軟性を提供しながら、最先端のパフォーマンスを実現している。
提案手法は,実画像の編集,部分スケッチとストロークの生成,マルチドメインマルチモーダル合成などの応用を解き放つ。
論文 参考訳(メタデータ) (2022-08-26T13:59:26Z) - Improving Generation and Evaluation of Visual Stories via Semantic
Consistency [72.00815192668193]
一連の自然言語キャプションが与えられた場合、エージェントはキャプションに対応する一連の画像を生成する必要がある。
それまでの作業では、このタスクで合成テキスト・画像モデルより優れた繰り返し生成モデルを導入してきた。
従来のモデリング手法には、デュアルラーニングフレームワークの追加など、いくつかの改善点を提示する。
論文 参考訳(メタデータ) (2021-05-20T20:42:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。