論文の概要: Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards
- arxiv url: http://arxiv.org/abs/2606.27376v1
- Date: Thu, 25 Jun 2026 17:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.400601
- Title: Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards
- Title(参考訳): Ask, Solve, Generate: 自己完結型マルチモーダル理解と生成
- Authors: Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer,
- Abstract要約: 視覚的理解と画像生成の両方をサポートするほとんどの統合された大型マルチモーダルモデル(LMM)は、訓練後の監督に頼っている。
本稿では,3つの内部的役割を持つ自己進化型トレーニングフレームワークを提案する。 視覚的質問を生成するプロポーラ, 回答と評価を行うソルバ, 画像を生成するジェネレータである。
画像生成のために,質問文の忠実度とサイクル一貫性キャプションを組み合わせたマルチスケール内部評価手法を設計する。
- 参考スコア(独自算出の注目度): 52.42920996842378
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most unified large multimodal models (LMMs) that support both visual understanding and image generation still rely on curated post-training supervision, such as human annotations, preference labels, or external reward models. We ask whether a unified LMM can improve both abilities autonomously using only unlabeled images. We propose a self-evolving training framework with three internal roles: a Proposer that generates visual questions, a Solver that answers and evaluates them, and a Generator that synthesizes images. Training uses only self-derived consistency signals, without human annotations, preference labels, or task-trained external reward/judge models. To stabilize learning, we introduce Solver Token Entropy (STE), a continuous difficulty signal based on token-level prediction uncertainty that remains useful even when sample-level consistency becomes unreliable. For image generation, we design a multi-scale internal evaluation scheme that combines question-answer fidelity scoring with cycle-consistent captioning. This creates a solver-mediated coupling, where better visual understanding enables more reliable generation assessment and stronger internal training signals. The framework preserves the same role decomposition, reward logic, and training schedule across diffusion-based BLIP3o, rectified-flow BAGEL, and autoregressive VARGPT-v1.1 architectures, requiring only each backbone's native prompting and generation interface. Across eight understanding metrics, our method consistently improves over the corresponding base models. On BAGEL, it achieves a $+3.5\%$ absolute gain on MMMU and improves GenEval image generation performance from $82\%$ to $85\%$. Code and models are publicly released.
- Abstract(参考訳): 視覚的理解と画像生成の両方をサポートするほとんどの統合された大型マルチモーダルモデル(LMM)は、人間のアノテーション、嗜好ラベル、外部報酬モデルなどの訓練後の監督に依然として依存している。
我々は、ラベルなし画像のみを用いて、統一LMMが両方の能力を自律的に改善できるかどうかを問う。
本稿では,3つの内部的役割を持つ自己進化型トレーニングフレームワークを提案する。 視覚的質問を生成するプロポーラ, 回答と評価を行うソルバー, 画像を生成するジェネレータである。
トレーニングは、人間のアノテーション、好みラベル、タスク訓練された外部報酬/報酬モデルなしで、自己由来の一貫性信号のみを使用する。
学習を安定させるために,トークンレベルの予測の不確実性に基づく連続的困難信号であるソルバートークンエントロピー(STE)を導入する。
画像生成のために,質問文の忠実度とサイクル一貫性キャプションを組み合わせたマルチスケール内部評価手法を設計する。
これにより、より優れた視覚的理解により、より信頼性の高い生成アセスメントとより強力な内部トレーニング信号が可能になる。
このフレームワークは、拡散ベースのBLIP3o、修正フローBAGEL、自動回帰VARGPT-v1.1アーキテクチャにまたがる同じ役割の分解、報酬ロジック、トレーニングスケジュールを保持し、各バックボーンのネイティブプロンプトと生成インターフェースのみを必要とする。
8つのメトリクスを総合的に理解することで,本手法は対応するベースモデルよりも常に改善される。
BAGELでは、MMMUに対して$+3.5\%の絶対ゲインを達成し、GenEval画像生成性能を8.2\%から8.5\%に改善する。
コードとモデルは公開されている。
関連論文リスト
- Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis [34.5994686982342]
強い意味表現は拡散と流れモデルの収束と生成の質を向上させる。
既存のアプローチは、主に外部モデルに依存しており、個別のトレーニングが必要であり、不整合した目標を運用し、予期しないスケーリングの振る舞いを示す。
本稿では,自己制御型フローマッチングパラダイムであるSelf-Flowを紹介する。
論文 参考訳(メタデータ) (2026-03-06T17:41:49Z) - SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models [44.79249920949795]
Unified Multimodal Models (UMM) は、視覚言語の生成と理解機能を単一のフレームワークに統合する。
モデルはユーザの指示に基づいてイメージを正しく理解するが、テキストプロンプトから忠実なイメージを生成することはできない。
SRUMは,様々な設計の既存のUMMに直接適用可能な,自己回帰型ポストトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-10-14T17:56:11Z) - Harmonizing Visual Representations for Unified Multimodal Understanding and Generation [53.01486796503091]
我々は,共有MARエンコーダによる理解と生成タスクを調和させる統合自己回帰フレームワークであるemphHarmonを提案する。
HarmonはGenEval、MJHQ30K、WISEベンチマークで最先端の画像生成結果を達成する。
論文 参考訳(メタデータ) (2025-03-27T20:50:38Z) - Unified Autoregressive Visual Generation and Understanding with Continuous Tokens [52.21981295470491]
We present UniFluid, a unified autoregressive framework for joint visual generation and understanding。
我々の統合自己回帰アーキテクチャはマルチモーダル画像とテキスト入力を処理し、テキストの離散トークンと画像の連続トークンを生成する。
画像生成と理解タスクの間には本質的にトレードオフがあることに気付きましたが、注意深く調整されたトレーニングレシピによって互いに改善できるようになりました。
論文 参考訳(メタデータ) (2025-03-17T17:58:30Z) - MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling [64.09238330331195]
本稿では,MMAR(Multi-Modal Auto-Regressive)確率モデルフレームワークを提案する。
離散化の手法とは異なり、MMARは情報損失を効率的に回避するために、連続的に評価された画像トークンを取り入れている。
また,数値安定性問題に対処する理論的に実証された手法と,タスク目標の生成と理解のバランスをとるトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2024-10-14T17:57:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。