論文の概要: Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
- arxiv url: http://arxiv.org/abs/2607.13125v2
- Date: Sat, 18 Jul 2026 17:28:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.444004
- Title: Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
- Title(参考訳): Boogu-Image-0.1:最小予算下での理解によるオープンエージェントマルチモーダル生成の促進
- Abstract要約: 本稿では,オープンソースの統合マルチモーダル理解・生成モデルファミリであるBoogu-Image-0.1を紹介する。
高品質なテキスト画像生成、高速推論、命令ベースの編集、バイリンガル(中国語)テキストレンダリングにおいて、競争力のあるパフォーマンスを提供する。
- 参考スコア(独自算出の注目度): 110.65684175617822
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce Boogu-Image-0.1, an open-source unified multimodal understanding and generation model family, comprising Base, Turbo, Edit, and Edit-Turbo variants. It delivers competitive performance in high-quality text-to-image generation, fast inference, instruction-based editing, and bilingual (Chinese-English) text rendering. Closed-source multimodal systems like Nano-Banana-Pro and GPT-Image-2 achieve strong performance through system-level integration rather than a single model, yet their internal practices remain largely undisclosed. In this work, we demonstrate that strengthening the understanding capability of the system, through a stronger multimodal encoder, agentic prompt rewriting, and related techniques, together with improvements in data quality, training pipelines, and agentic inference-time scaling, can substantially enhance generation and editing performance even under highly constrained compute budgets. Comprehensive evaluations show that Boogu-Image-0.1 consistently matches or surpasses other open-source models across standard benchmarks, and achieves results approaching leading closed-source systems. Notably, this is accomplished with only 208.62 million unique images. The base model's theoretical training cost is only approximately \$400K. We share practical discussions that we believe are valuable to the broader research community, and release weights, code, and recipes under Apache 2.0 to advance the open ecosystem for unified multimodal understanding and generation. Our code is available here: https://github.com/Boogu-Project/Boogu-Image.
- Abstract(参考訳): 本稿では,オープンソースの統合マルチモーダル理解・生成モデルファミリーであるBoogu-Image-0.1について紹介する。
高品質なテキスト画像生成、高速推論、命令ベースの編集、バイリンガル(中国語)テキストレンダリングにおいて、競争力のあるパフォーマンスを提供する。
Nano-Banana-Pro や GPT-Image-2 のようなクローズドソースのマルチモーダルシステムは、単一のモデルではなくシステムレベルの統合によって強力な性能を発揮するが、内部のプラクティスはほとんど開示されていない。
本研究では, マルチモーダルエンコーダ, エージェントプロンプト書き換え, 関連技術によるシステム理解能力の向上, データ品質の向上, トレーニングパイプライン, エージェント推論時間スケーリングなどにより, 高度に制約された計算予算下においても, 生成および編集性能を大幅に向上させることができることを示した。
総合的な評価では、Boogu-Image-0.1は標準ベンチマークで他のオープンソースモデルと一貫して一致または上回っており、主要なクローズドソースシステムに近づいた結果が得られている。
特に、これは208.62万枚のユニークな画像で達成されている。
基本モデルの訓練費は約400Kドルである。
我々は、幅広い研究コミュニティにとって価値があると信じている実践的な議論を共有し、Apache 2.0の下でリリースの重み、コード、レシピを公開して、統一されたマルチモーダル理解と生成のためのオープンなエコシステムを前進させます。
私たちのコードは、https://github.com/Boogu-Project/Boogu-Image.comで入手可能です。
関連論文リスト
- DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing [67.77471070868852]
DeepGen 1.0は、画像生成と編集のための軽量な5B統一モデルである。
わずか5000万のサンプルでトレーニングされており、WISEでは80BのHunyuan Imageを28%、UniREditBenchでは27BのQwen-Image-Editを37%上回っている。
トレーニングコード、ウェイト、データセットをオープンソース化することで、統合マルチモーダルリサーチを民主化する、効率的で高性能な代替手段を提供します。
論文 参考訳(メタデータ) (2026-02-12T17:44:24Z) - DuoGen: Towards General Purpose Interleaved Multimodal Generation [65.13479486098419]
DuoGenは汎用的なインターリーブ生成フレームワークで、データキュレーション、アーキテクチャ設計、評価に対処する。
我々は、キュレートされた生のWebサイトから書き直されたマルチモーダルな会話を組み合わせることで、大規模で高品質な命令チューニングデータセットを構築する。
2段階の切り離し戦略はまずMLLMをインストラクションチューニングし、次にインターリーブされた画像テキストシーケンスを使用してDiTをアライメントする。
論文 参考訳(メタデータ) (2026-01-31T04:35:15Z) - LightBagel: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation [48.02842078521973]
提案手法は, 生成と理解に特化して公開されているモデルを戦略的に融合させることにより, 競争性能をより効率的に得ることができることを示す。
我々のキーとなる設計は、ネットワーク全体にわたってマルチモーダルな自己注意ブロックをインターリーブしながら、元のブロックを保持することである。
たった35Bトークンでトレーニングすることで、このアプローチは複数のベンチマークで強力な結果が得られる。
論文 参考訳(メタデータ) (2025-10-27T02:59:57Z) - Query-Kontext: An Unified Multimodal Model for Image Generation and Editing [53.765351127477224]
統一マルチモーダルモデル(UMM)はテキスト・ツー・イメージ生成(T2I)と編集(TI2I)において顕著な性能を示した。
本稿では,マルチモーダル入力から符号化されたセマンティックキューと粗粒度画像条件からなるマルチモーダルコンテクス」を用いて,VLMと拡散モデルをブリッジする新しいアプローチであるQuery-Kontextを紹介する。
実験により,本手法は強い統一ベースラインと一致し,いくつかのケースにおいてタスク固有の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2025-09-30T17:59:46Z) - MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models [30.494968865008513]
最近のテキスト・ツー・イメージモデルは、正確な視覚制御、マルチモーダル入力のバランス、複雑な画像生成のための広範な訓練を必要とする。
自己回帰型マルチモーダル画像生成のための効率的なマルチモーダルコンディショニングのための新しいフレームワークであるMENTORを提案する。
本手法は,拡散法に比べて画像再構成精度,タスク適応性,トレーニング効率の向上を実現している。
論文 参考訳(メタデータ) (2025-07-13T10:52:59Z) - OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation [44.34131932968147]
マルチモーダルな理解と生成を統一するための軽量でオープンソースなベースラインであるOpenUniを紹介します。
統一モデル学習における一般的なプラクティスに触発されて、トレーニングの複雑さとオーバーヘッドを最小限にする効率的なトレーニング戦略を採用しました。
我々は,1) 高品質で命令整合性のある画像を生成すること,2) GenEval, DPG-Bench, WISE などの標準ベンチマークにおいて,1.1B と 3.1B のみ活性化パラメータで例外的な性能を達成できることを実証した。
論文 参考訳(メタデータ) (2025-05-29T17:09:44Z) - Emerging Properties in Unified Multimodal Pretraining [32.856334401494145]
マルチモーダル理解と生成をサポートするオープンソースの基盤モデルであるBAGELを紹介する。
BAGELは、大規模なインターリーブ付きテキスト、画像、ビデオ、Webデータからキュレートされた数兆のトークンに基づいて事前訓練された、統一されたデコーダのみのモデルである。
オープンソースの統一モデルでは、マルチモーダル生成と標準ベンチマークでの理解の両方において、大幅に優れています。
論文 参考訳(メタデータ) (2025-05-20T17:59:30Z) - Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation [54.588082888166504]
我々は、因果アプローチを通じてインターリーブされたマルチモーダル生成を可能にする統一的なフレームワークであるMogaoを提案する。
Mogooは、Deep-fusion設計、デュアルビジョンエンコーダ、インターリーブされた回転位置埋め込み、マルチモーダル分類器フリーガイダンスなど、アーキテクチャ設計における重要な技術的改善のセットを統合している。
実験により,モガオはマルチモーダル理解とテキスト・ツー・イメージ生成において最先端の性能を発揮するとともに,高品質でコヒーレントなインターリーブ・アウトプットの創出にも優れていることが示された。
論文 参考訳(メタデータ) (2025-05-08T17:58:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。