論文の概要: ReDeck: Step-Level Render-Grounded Refinement for Document-to-Slide Generation
- arxiv url: http://arxiv.org/abs/2609.00194v2
- Date: Sat, 05 Sep 2026 21:02:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.328831
- Title: ReDeck: Step-Level Render-Grounded Refinement for Document-to-Slide Generation
- Title(参考訳): ReDeck: ドキュメント・ツー・スライディング・ジェネレーションのためのステップ・レベル・レンダー・グラウンド・リファインメント
- Abstract要約: 本稿では,文書・スライド生成のためのステップレベルのレンダリング・グラウンド・リファインメント・フレームワークであるReDeckを提案する。
局所的な修復とグローバルな品質のバランスをとるために、ReDeckでは、空間的エラーに対する複数のグラニュラフィードバック、セマンティックとデザインのガイダンスに対するターンレベルの適応的批判、ハードレイアウトの検証のための提出レベルゲートを使用している。
GPT-5.4、Claude-4.6、Gemini-3.1の他、ReDeckは既存のスライド生成エージェントより一貫して優れている。
- 参考スコア(独自算出の注目度): 50.508786206669605
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Document-to-slide generation is challenging because slides are dense editable artifacts that require both faithful content selection and precise spatial layout. Recent slide agents adopt iterative reflection, but typically follow a monolithic "one version, one feedback" loop: a slide or deck is rewritten, rendered afterward, and critiqued only at the turn boundary. This delayed feedback makes local failures such as overflow, overlap, clipping, and off-canvas placement difficult to attribute and repair. We propose ReDeck, a step-level render-grounded refinement framework that decomposes slide revision into atomic edit actions and returns renderer-derived observations after each step, turning refinement into "one edit, one observation." To balance local repair with global quality, ReDeck uses multi-granular feedback: step-level render feedback for spatial errors, a turn-level adaptive critic for semantic and design guidance, and a submission-level gate for hard layout validation. We further introduce DeckQuiz, a benchmark that decouples content fidelity, spatial correctness, and design quality. Across GPT-5.4, Claude-4.6, and Gemini-3.1, ReDeck consistently outperforms existing slide-generation agents, and ablations confirm that feedback timing and granularity are critical for reliable slide refinement.
- Abstract(参考訳): スライドは、忠実なコンテンツ選択と正確な空間レイアウトの両方を必要とする密集した編集可能なアーティファクトであるため、ドキュメントからスライドへの生成は困難である。
最近のスライドエージェントは反復的なリフレクションを採用するが、典型的にはモノリシックな"1バージョン、1つのフィードバック"ループに従う:スライドまたはデッキは書き直され、後で描画され、ターン境界でのみ批判される。
この遅延したフィードバックは、オーバーフロー、オーバーラップ、クリップング、オフキャンバス配置などのローカル障害を属性と修復が難しくする。
ReDeckは、スライドリビジョンをアトミックな編集アクションに分解し、各ステップ後にレンダラー由来の観察結果を返却し、リファインメントを「1つの編集、1つの観察」に変換する。
局所的な修復とグローバルな品質のバランスをとるために、ReDeckでは、空間エラーに対するステップレベルのレンダリングフィードバック、セマンティックおよびデザインガイダンスに対するターンレベルの適応的批判、ハードレイアウト検証のためのサブミディションレベルのゲートなど、複数のグラニュラフィードバックを使用している。
さらに、コンテンツ忠実度、空間的正確性、設計品質を分離するベンチマークであるDeckQuizを紹介します。
GPT-5.4、Claude-4.6、Gemini-3.1で、ReDeckは既存のスライド生成エージェントを一貫して上回り、フィードバックのタイミングと粒度が信頼性の高いスライド改善に重要であることを確認する。
関連論文リスト
- GraLoD: Graphics-Inspired Continuous Level-of-Detail Learning for Image Restoration [54.85451496831771]
再生スケールを空間変化およびステージ依存変数として扱うプラグイン・アンド・プレイフレームワークであるGraLoDを提案する。
GraLoDはネイティブエンコーダ階層を再利用し、そのマルチスケール機能を共有LOD表現空間に整列し、デコーダの各段階でステージ条件付きLODフィールドを予測する。
実験はタスク固有とオールインワンの復元において一貫した改善を示す。
論文 参考訳(メタデータ) (2026-09-15T03:22:22Z) - FiRe: Fixed-Noise Refinement for Visual Counterfactual Explanations [9.955401099290096]
本稿では,視覚的対実的説明のための固定ノイズ補充フレームワークFiReを提案する。
FiReは入力を固定ノイズレベルにマッピングし、そのレベルのノイズ状態を反復的に洗練する。
FiReは約3$times$高速オンライン推論と8$times$より少ないFLOPを実現し、同等または最先端の対物品質を得る。
論文 参考訳(メタデータ) (2026-08-09T12:15:37Z) - ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition [60.25038184390257]
ReDesignは、編集可能な階層階層を成長させるエージェントフレームワークで、特定のツールを選択して、モダリティにまたがって構成する。
大規模な編集性を評価するために、909個のFigmaファイルと14,796個の編集命令からなるFigma Edit Replay Benchmarkを導入する。
論文 参考訳(メタデータ) (2026-07-28T10:53:33Z) - Consistent-Inversion: Reverse Consistency Guidance for Structure-Preserving Visual Editing [41.38183848746174]
Consistent-Inversionは、構造保存ビジュアル編集のためのトレーニング不要の逆整合ガイダンスフレームワークである。
SD3.5プロトコルを統一したプロトコルで、ターゲット・プロンプトアライメントを維持しながら、背景および構造的忠実性を改善する。
論文 参考訳(メタデータ) (2026-06-05T11:00:12Z) - GeoEdit: Local Frames for Fast, Training-Free On-Manifold Editing in Diffusion Models [9.1810262671279]
訓練なしの編集は通常、全ての編集強度の完全な装飾軌跡を再実行し、反復的な洗練が高価になる。
代わりに、小さなローカル更新が繰り返し再合成を置き換えることができるデータ多様体の近くで編集します。
提案アルゴリズムは、初期雑音に対する小さな摂動を通して接フレームを構築し、拡散に基づく投影と小さな接移動を交互に行う。
論文 参考訳(メタデータ) (2026-04-27T09:47:02Z) - SceneExpander: Expanding 3D Scenes with Free-Form Inserted Views [69.08965991211704]
ユーザ中心のワークフローにおける3Dシーンの拡大について検討する。
固定シーンにおける単純なオブジェクト編集やスタイル転送とは異なり、挿入されたビューは元の再構築と3Dミスアライメントされることが多い。
パラメトリックフィードフォワード3D再構成モデルにテスト時間適応を適用したSceneExpanderを提案する。
論文 参考訳(メタデータ) (2026-03-28T02:04:48Z) - VLM-SlideEval: Evaluating VLMs on Structured Comprehension and Perturbation Sensitivity in PPT [0.0]
視覚言語モデル(VLM)は、プレゼンテーションスライドを含むマルチモーダルコンテンツの評価にますます利用されているが、スライド固有の理解はいまだ探索されていない。
VLM-SlideEvalは,(1)真実に整合したスライド画像からの要素レベル抽出,(2)幾何学,スタイル,テキストの摂動制御,(3)シャッフルスライドからデッキの物語順を復元するなど,3つの軸に沿ってVLMを探索する評価フレームワークである。
論文 参考訳(メタデータ) (2025-10-24T22:06:56Z) - FreeSplat++: Generalizable 3D Gaussian Splatting for Efficient Indoor Scene Reconstruction [50.534213038479926]
FreeSplat++は大規模な屋内全シーン再構築の代替手法である。
深度調整による微調整により,再現精度が大幅に向上し,トレーニング時間も大幅に短縮された。
論文 参考訳(メタデータ) (2025-03-29T06:22:08Z) - High-Fidelity GAN Inversion for Image Attribute Editing [61.966946442222735]
本稿では,画像固有の詳細をよく保存した属性編集を可能にする,GAN(High-fidelity Generative Adversarial Network)インバージョンフレームワークを提案する。
低ビットレートの遅延符号では、再構成された画像や編集された画像の高忠実度の詳細を保存することは困難である。
高忠実度復元のための基準として歪みマップを用いる歪みコンサルテーション手法を提案する。
論文 参考訳(メタデータ) (2021-09-14T11:23:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。