論文の概要: VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following
- arxiv url: http://arxiv.org/abs/2608.26013v2
- Date: Thu, 27 Aug 2026 06:33:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.904362
- Title: VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following
- Title(参考訳): VISA:マルチモーダルインストラクション追従のためのエージェント自己進化データ合成
- Authors: Min Zeng, Guanxin Tan, Libin Cen, Yafei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen,
- Abstract要約: マルチモーダル命令追従モデルは、正確で多様性があり、検証可能で、困難なトレーニングデータを必要とする。
本稿では,マルチモーダル命令合成を自己進化ループとして再構成するエージェントフレームワークであるVISAを提案する。
MM-IFEvalの実験では、VISAは強いベースラインを越えて、マルチモーダル命令を一貫して改善している。
- 参考スコア(独自算出の注目度): 11.967752833065655
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal instruction-following models require training data that is accurate, diverse, verifiable, and challenging. Existing synthesis pipelines typically follow a one-pass generate-and-filter paradigm, discarding feedback from failed samples, verifier outcomes, and target-model errors. We present VISA (Visual Instruction Synthesis Agent), an agentic framework that reformulates multimodal instruction synthesis as a self-evolving loop. At each round, VISA analyzes an image to filter incompatible constraints and discover new verifiable ones, samples diversity- and difficulty-aware constraint sets from persistent memory, generates candidate instructions, and verifies the resulting samples with executable tools and structured large language model judges. Failed samples trigger diagnostic-guided recovery, while accepted samples are probed against the target model to estimate difficulty. The resulting verifier signals and target-model failure profiles are written back to memory, allowing subsequent rounds to adaptively expand the constraint space, reduce template repetition, and focus on unresolved model weaknesses. The same verifier contracts further provide reward signals for reinforcement learning without a separately trained reward model. Experiments on MM-IFEval show that VISA consistently improves multimodal instruction following over strong baselines, while preserving general multimodal capability across seven public benchmarks.
- Abstract(参考訳): マルチモーダル命令追従モデルは、正確で多様性があり、検証可能で、困難なトレーニングデータを必要とする。
既存の合成パイプラインは通常、1パスの生成とフィルタのパラダイムに従っており、失敗したサンプルからのフィードバック、検証結果、ターゲットモデルエラーを破棄する。
VISA(Visual Instruction Synthesis Agent)は,マルチモーダルな命令合成を自己進化ループとして再構成するエージェントフレームワークである。
各ラウンドで、VISAは画像を分析し、互換性のない制約をフィルタリングし、新しい検証可能な制約を発見し、永続メモリから多様性と難易度を考慮した制約セットをサンプリングし、候補命令を生成し、その結果のサンプルを実行可能なツールと構造化された大規模言語モデル判断で検証する。
欠損したサンプルは診断誘導回復を誘導し、受け入れられたサンプルは対象モデルに対してプローブされ、難易度を推定する。
結果の検証信号とターゲットモデル故障プロファイルはメモリに書き戻され、その後のラウンドで制約空間を適応的に拡張し、テンプレートの繰り返しを減らし、未解決のモデルの弱点に集中することができる。
同じ検証器契約により、個別に訓練された報酬モデルなしで強化学習のための報酬信号が提供される。
MM-IFEvalの実験では、VISAは7つの公開ベンチマークで一般的なマルチモーダル能力を保ちながら、強いベースラインを超えるマルチモーダル命令を一貫して改善している。
関連論文リスト
- Uncertainty Quantification for Multimodal Retrieval Augmented Generation [14.789439938448034]
マルチモーダルおよび検索対応確率信号を用いたモデリングの不確実性は、マルチモーダルRAGシステムにおける推定を改善することを示す。
提案したLeMUQは平均3.8%のAUROC値を増加させる。
本研究は,マルチモーダルな不確実性をモデル化することの重要性を強調し,より信頼性が高く安全なマルチモーダルRAGシステムへのステップを提供する。
論文 参考訳(メタデータ) (2026-05-28T14:00:32Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - UniT: Unified Multimodal Chain-of-Thought Test-time Scaling [85.590774707406]
統一モデルは単一のアーキテクチャ内でマルチモーダル理解と生成の両方を扱うことができるが、通常は出力を反復的に書き換えることなく単一のパスで操作する。
マルチモーダルなテストタイムスケーリングのためのフレームワークであるUniTを導入し、単一の統一モデルで複数のラウンドをまたいだ推論、検証、精査を可能にします。
論文 参考訳(メタデータ) (2026-02-12T18:59:49Z) - Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision [11.159231524113764]
マルチモーダル大規模言語モデル(MLLM)の複雑な推論能力を高めるための重要なメカニズムとして強化学習(RL)が登場した。
本稿では,これらの構造的制約に対処する textbfGuided Verifier フレームワークを提案する。
我々は,マルチモーダル幻覚をターゲットとした特殊なデータ合成パイプラインを開発し,プロセスレベルの負の textbfCoRe データセットとtextbfCorrect-guide textbfReasoning トラジェクトリを構築し,ガイド付き検証器を訓練する。
論文 参考訳(メタデータ) (2026-02-04T07:38:42Z) - VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples [40.65748922891177]
VaccineRAGは、新しいChain-of-Thoughtベースの検索強化生成データセットである。
VaccineRAGは、正/負のサンプル比の異なるデータを用いてモデルを評価するためにベンチマークを使用する。
LLMに各サンプルに対する明示的なチェーン・オブ・ソート分析を生成するように促すことで、モデルのサンプル識別能力を向上する。
論文 参考訳(メタデータ) (2025-09-02T04:49:51Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Accelerated Sampling from Masked Diffusion Models via Entropy Bounded Unmasking [17.511240770486452]
仮面拡散モデル (MDM) は, 言語モデリングにおける自己回帰モデル (ARM) と比較して, 競合性能を示した。
本稿では,Entropy bounded unmasking 手法を用いて,既存のサンプルのドロップイン置換であるEB-Samplerを紹介する。
EB-Samplerは、パフォーマンスを損なうことなく、標準的なコーディングと数学推論ベンチマークで、最先端のMDMのサンプリングを約2~3倍高速化する。
論文 参考訳(メタデータ) (2025-05-30T17:52:55Z) - Autoregressive Speech Synthesis without Vector Quantization [135.4776759536272]
We present MELLE, a novel continuous-valued token based language modeling approach for text-to-speech synthesis (TTS)。
MELLEはテキスト条件から直接連続メル-スペクトログラムフレームを自動回帰生成する。
MELLEは、サンプリングベクトル量子化符号の固有の欠陥を回避し、ロバスト性問題を緩和する。
論文 参考訳(メタデータ) (2024-07-11T14:36:53Z) - Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in
Vision-Language Models [76.410400238974]
モデル出力を補正し、モデルが盲目的に自信を持たないようにするためのフィードバック付きTTAを提案する。
CLIPモデルは、TTA中に報酬モデルとして採用され、VLMにフィードバックを提供する。
提案したCLIPフィードバック(RLCF)フレームワークによるテキスト強化学習は非常に柔軟で普遍的である。
論文 参考訳(メタデータ) (2023-05-29T11:03:59Z) - One for More: Selecting Generalizable Samples for Generalizable ReID
Model [92.40951770273972]
本稿では,選択したサンプルを損失関数として一般化する1対3の学習目標を提案する。
提案した1対3のサンプルは,ReIDトレーニングフレームワークにシームレスに統合できる。
論文 参考訳(メタデータ) (2020-12-10T06:37:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。