論文の概要: SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning
- arxiv url: http://arxiv.org/abs/2607.12042v1
- Date: Mon, 13 Jul 2026 18:00:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.926672
- Title: SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning
- Title(参考訳): SymbOmni:シンボリック概念学習によるエージェントオムニモデルの進化
- Abstract要約: 本研究では,概念学習による累積進化のためのエージェントオムニモデルであるSymb Omniを提案する。
コアとなるシンボリックコンセプトボックスは、低レベルの操作を再利用可能なインストラクションに抽象化する最適化可能なメモリモジュールである。
実験により、(I)Symb Omniは既存のエージェントベースシステムよりも大幅に優れており、クローズドソースモデル(Nano Banana、GPT-Image-1など)を画質とタスクの成功率の両方で上回っている。
- 参考スコア(独自算出の注目度): 23.30327391111696
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual generation is increasingly ubiquitous in diverse domains, from text-to-image/video synthesis to multimodal interactive creation. Yet prevailing monolithic models remain fundamentally constrained by their inability to learn cumulatively and evolve autonomously, which is a limitation we term the "perpetual novice" problem. They lack mechanisms for structuring experience into reusable knowledge and therefore rely on brittle, "from-scratch" reasoning for each task, resulting in poor compositional generalization and inefficient knowledge retention. Motivated by these limitations, we propose SymbOmni, an agentic omni-model designed for cumulative evolution through Symbolic Concept Learning. At its core is the Symbolic Concept Box, an optimizable memory module that abstracts low-level operations into reusable Symbolic Workflow Instructions. SymbOmni operates through an induction-transduction cycle: experiences are abstracted into symbolic concepts (induction), which are then adaptively composed to solve novel tasks (transduction). The training is done by verbalized backpropagation with language-based feedback to enable continuous self-improvement without gradient-based model fine-tuning. Comprehensive experiments validate that (I) SymbOmni significantly outperforms existing agent-based systems for iterative creation and also surpasses closed-source models (e.g., Nano Banana, GPT-Image-1) in both image quality and task success rates; (II) SymbOmni effectively reduces token consumption by over 40% while maintaining competitive generation quality; and (III) SymbOmni enables effective continual learning by achieving cumulative gains across multiple online-learning benchmarks and setting a new state of the art.
- Abstract(参考訳): テキスト・ツー・イメージ/ビデオ合成からマルチモーダル・インタラクティブな生成に至るまで、視覚生成は様々な領域でますます普及している。
しかし、一般的なモノリシックモデルは、累積的に学習できず、自律的に進化することができないため、基本的に制約を受けています。
それらは経験を再利用可能な知識に構造化するメカニズムが欠如しており、それゆえ、各タスクに対する「ゼロ・スクラッチ」推論の脆さに頼っているため、構成的一般化の貧弱さと非効率的な知識保持をもたらす。
これらの制約に触発されたSymbOmniは,シンボリック概念学習による累積的進化を目的としたエージェントオムニモデルである。
コアとなるSybolic Concept Boxは、低レベルの操作を再利用可能なSybolic Workflow Instructionsに抽象化する最適化可能なメモリモジュールである。
経験はシンボリックな概念(推論)に抽象化され、新しい課題(変換)を解決するために適応的に構成される。
トレーニングは、言語ベースのフィードバックによる言語化されたバックプロパゲーションによって行われ、勾配ベースのモデル微調整なしで継続的自己改善を可能にする。
総合的な実験により、(I)SymbOmniは既存のエージェントベースシステムよりも大幅に優れており、画像品質とタスク成功率の両方においてクローズドソースモデル(Nano Banana, GPT-Image-1)を上回り、(II)SymbOmniは競合生成品質を維持しながらトークン消費を40%以上効果的に削減し、(III)SymbOmniは複数のオンライン学習ベンチマークで累積ゲインを達成し、新しいステート・オブ・ザ・アーティファクトを設定することで効果的な継続的学習を可能にした。
関連論文リスト
- CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models [69.9266117908314]
VAR(Visual Autoregressive)モデルは、テキスト・ツー・イメージ生成の効率的なパラダイムとして登場した。
既存のVARベースのパーソナライズ方法は、進化するユーザ要求に対応できない。
VARモデルにおける連続的パーソナライズ生成に関する最初の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-05-19T12:18:15Z) - Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis [34.5994686982342]
強い意味表現は拡散と流れモデルの収束と生成の質を向上させる。
既存のアプローチは、主に外部モデルに依存しており、個別のトレーニングが必要であり、不整合した目標を運用し、予期しないスケーリングの振る舞いを示す。
本稿では,自己制御型フローマッチングパラダイムであるSelf-Flowを紹介する。
論文 参考訳(メタデータ) (2026-03-06T17:41:49Z) - Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models [23.128973540926552]
内因性再増殖は、モデルの理解を明確な生成的推論ステップに変換する。
評価精度,再現効率,生成品質において,SEERは一貫して最先端のベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2026-01-28T06:54:36Z) - NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching [64.10695425442164]
NExT-OMNI(英語版)は、離散フローパラダイムによる統一モデリングを実現するオープンソース・オムニモーダル・ファンデーション・モデルである。
NExT-OMNIは、大規模なインターリーブ付きテキスト、画像、ビデオ、オーディオデータに基づいて訓練され、マルチモーダル生成および理解ベンチマーク上で競合するパフォーマンスを提供する。
さらなる研究を進めるために、トレーニングの詳細、データプロトコル、およびコードとモデルチェックポイントの両方をオープンソース化する。
論文 参考訳(メタデータ) (2025-10-15T16:25:18Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities [76.46448367752944]
MLLM(Multimodal large language model)は、単一のフレームワーク内で視覚的理解と画像生成を統一する言語である。
ほとんどの既存のMLLMはAutore(AR)アーキテクチャに依存しており、将来の開発に固有の制限を課している。
本稿では,離散フローマッチングに基づく統一マルチモーダルモデルであるFUDOKIを紹介する。
論文 参考訳(メタデータ) (2025-05-26T15:46:53Z) - Will Pre-Training Ever End? A First Step Toward Next-Generation Foundation MLLMs via Self-Improving Systematic Cognition [89.50068130832635]
自己改善認知 (SIcog) は、マルチモーダル知識によって次世代のMLLMを構築するための自己学習フレームワークである。
ステップバイステップの視覚的理解のためのChain-of-Descriptionを提案し、詳細なマルチモーダル推論をサポートするために構造化されたChain-of-Thought(CoT)推論を統合する。
実験は、マルチモーダル認知を増強したMLLMの開発におけるSIcogの有効性を示す。
論文 参考訳(メタデータ) (2025-03-16T00:25:13Z) - Learning New Concepts, Remembering the Old: Continual Learning for Multimodal Concept Bottleneck Models [11.716449233474451]
概念ボトルネックモデル(CBM)は、人間の理解可能な概念で視覚的な入力をブリッジすることで、AIシステムの解釈可能性を高める。
既存のCBMは静的データセットを前提としており、実際のマルチモーダルデータストリームへの適応性を制限している。
我々は,CBMのための新しい継続学習タスクを定義し,概念・増分学習とクラス・増分学習を同時に扱う。
論文 参考訳(メタデータ) (2024-11-25T10:44:14Z) - Multi-Stage Knowledge Integration of Vision-Language Models for Continual Learning [79.46570165281084]
蒸留法における人間の学習過程をエミュレートするマルチステージ知識統合ネットワーク(MulKI)を提案する。
Mulkiは、イデオロギーの排除、新しいイデオロギーの追加、イデオロギーの排除、コネクティクスの作りという4つの段階を通じてこれを達成している。
提案手法は,下流タスク間の連続学習をサポートしながら,ゼロショット能力の維持における大幅な改善を示す。
論文 参考訳(メタデータ) (2024-11-11T07:36:19Z) - Making LLaMA SEE and Draw with SEED Tokenizer [69.1083058794092]
大規模言語モデルにSEEとDrawの能力を持たせるための精巧な画像トークンであるSEEDを紹介します。
SEEDトークンを使うことで、LLMはオリジナルのトレーニングレシピの下でスケーラブルなマルチモーダルオートレグレスを実行することができる。
SEED-LLaMAはマルチターン・イン・コンテクスト・マルチモーダル生成のような合成創発的能力を示す。
論文 参考訳(メタデータ) (2023-10-02T14:03:02Z) - Generalising via Meta-Examples for Continual Learning in the Wild [24.09600678738403]
我々は「野生で学習する」ニューラルネットワークを扱うための新しい戦略を開発する
MEML - Meta-Example Meta-Learning - 破滅的な忘れを同時に緩和する新しいモジュール。
様々な拡張タスクを作成し、最も難しいタスクを最適化する手法を採用して拡張する。
論文 参考訳(メタデータ) (2021-01-28T15:51:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。