論文の概要: Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement
- arxiv url: http://arxiv.org/abs/2608.03733v1
- Date: Tue, 04 Aug 2026 14:28:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.240911
- Title: Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement
- Title(参考訳): マルチモーダル大言語モデル自己改善のためのフェールインフォーム画像自己拡張
- Authors: Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo,
- Abstract要約: フェールインフォームドイメージの自己拡張(textbfFISA)はMLLMの自己改善のためのフレームワークで、モデル自身の障害ケースから拡張イメージを構築する。
本手法は,視覚的に難解だが解答保存画像のコンプリケーションを生成し,自己検査によりその有用性を検証し,意味的歪みを避けるために二重忠実度フィルタリングを適用する。
- 参考スコア(独自算出の注目度): 50.97806700110183
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) have achieved remarkable performance across vision-language tasks, but their progress depends heavily on large-scale, high-quality multimodal data that are costly to annotate. Self-augmentation offers a promising alternative by enabling models to expand their own training data without external supervision. However, existing MLLM self-augmentation methods are largely text-centric, while image augmentation remains underexplored and typically relies on generic or handcrafted transformations that are weakly aligned with the model's actual incapability. We propose Failure-informed Image Self-Augmentation (\textbf{FISA}), a framework for MLLM self-improvement that constructs augmented images from the model's own failure cases. Our method generates visually challenging yet answer-preserving image complications, verifies their utility through self-examination, and applies dual fidelity filtering to avoid semantic distortion. Experiments on visual question answering benchmarks show that the proposed method consistently improves performance across both in-distribution and out-of-distribution settings. Further experiments validate the compatibility of FISA with existing textual self-augmentation approaches, the superior data efficiency of the synthesized samples over generic image augmentation baselines, and the practical effectiveness of the proposed filtering strategy.
- Abstract(参考訳): MLLM(Multimodal large language model)は、視覚言語タスクにおいて顕著なパフォーマンスを達成しているが、その進歩は、アノテートにコストがかかる大規模で高品質なマルチモーダルデータに大きく依存している。
自己拡張は、モデルを外部の監督なしに独自のトレーニングデータを拡張することによって、有望な代替手段を提供する。
しかし、既存のMLLM自己拡張法は主にテキスト中心であるが、画像拡張は未探索のままであり、一般的にはモデルの実能力と弱い整合性を持つジェネリック変換や手作り変換に依存している。
本稿では,MLLM自己改善のためのフレームワークであるFluure-informed Image Self-Augmentation (\textbf{FISA})を提案する。
本手法は,視覚的に難解だが解答保存画像のコンプリケーションを生成し,自己検査によりその有用性を検証し,意味的歪みを避けるために二重忠実度フィルタリングを適用する。
視覚的質問応答ベンチマークの実験結果から,提案手法は分布内および分布外の両方における性能を一貫して改善することが示された。
さらに、既存のテキスト自己拡張アプローチとのFISAの互換性、一般的な画像拡張ベースラインよりも合成サンプルのデータ効率が優れていること、そして、提案したフィルタリング戦略の実践的有効性を検証する。
関連論文リスト
- Enhanced Text-to-Image Generation by Fine-grained Multimodal Reasoning [13.412268665909826]
きめ細かいマルチモーダル推論(FiMR)は、視覚的質問応答(VQA)を利用して、明確できめ細かいフィードバックを生成するフレームワークである。
FiMRは推論ベースの方法を含む画像生成ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-15T05:24:29Z) - ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection [51.93101033997245]
AI生成画像のリアリズムの増大は、誤情報やプライバシー侵害に対する深刻な懸念を引き起こしている。
我々は、AI生成画像検出のための新しい推論に基づく一般化可能なフレームワークThinkFakeを提案する。
我々は、ThinkFakeがGenImageベンチマークで最先端の手法より優れており、挑戦的なLOKIベンチマークで強力なゼロショットの一般化を示すことを示す。
論文 参考訳(メタデータ) (2025-09-24T07:34:09Z) - A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets [26.167194142428475]
視覚言語モデル(VLM)は、高品質な画像テキストデータが不足しているため、しばしば構成的推論に苦しむ。
手動のアノテーションを使わずに反実データを自動的に生成するブロックベース拡散手法を提案する。
提案手法は,既存の手法に比べてトレーニングデータを大幅に少なくしながら,複数のベンチマークにまたがる最先端の結果を達成している。
論文 参考訳(メタデータ) (2025-07-07T06:47:10Z) - Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models [58.936893810674896]
顔認識システムのセキュリティと信頼性を確保するためには,FAS(Face Anti-Spoofing)が不可欠である。
I-FAS(Interpretable Face Anti-Spoofing)と呼ばれるFASのためのマルチモーダルな大規模言語モデルフレームワークを提案する。
本稿では,FAS画像の高品質なキャプションを生成するために,Spof-Aware Captioning and Filtering(SCF)戦略を提案する。
論文 参考訳(メタデータ) (2025-01-03T09:25:04Z) - Beyond Human Data: Aligning Multimodal Large Language Models by Iterative Self-Evolution [43.07899102255169]
本稿では,高品質な質問や回答を自律的に生成することのできる,新しい多モード自己進化フレームワークを提案する。
まず、画像駆動型セルフクエスト機構を実装し、画像コンテンツに基づいた質問の作成と評価を可能にする。
第2に,画像キャプションから答えの質を向上させるための自己改善手法を提案する。
論文 参考訳(メタデータ) (2024-12-20T08:06:00Z) - MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling [64.09238330331195]
本稿では,MMAR(Multi-Modal Auto-Regressive)確率モデルフレームワークを提案する。
離散化の手法とは異なり、MMARは情報損失を効率的に回避するために、連続的に評価された画像トークンを取り入れている。
また,数値安定性問題に対処する理論的に実証された手法と,タスク目標の生成と理解のバランスをとるトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2024-10-14T17:57:18Z) - Debiasing Multimodal Large Language Models via Penalization of Language Priors [38.97645845493758]
MLLM(Multimodal Large Language Models)は、コンピュータビジョンや自然言語処理において欠かせないツールとなっている。
生成されたコンテンツは、入力画像よりも、基礎となるLarge Language Models (LLMs) の本質的な先行性によって駆動されることが多い。
本稿では、これらのバイアスを補正し、視覚情報に対するモデルの焦点をリダイレクトするための、単純でトレーニングのない2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-08T12:35:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。