論文の概要: Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation
- arxiv url: http://arxiv.org/abs/2607.28269v1
- Date: Thu, 30 Jul 2026 14:23:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.605977
- Title: Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation
- Title(参考訳): Theia:データフリー蒸留のためのインシデント1Mデータセットの大規模マルチモーダルキャプションと自動検証
- Authors: Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini,
- Abstract要約: この領域の既存のデータセットは完全に記述的テキストを欠いているか、あるいは厳しいテキストイメージのセマンティックなミスアライメントに悩まされている。
本稿では,災害対応のための大規模マルチモーダルデータセットの構築と自動検証を行う新しい手法を提案する。
- 参考スコア(独自算出の注目度): 43.1212452324751
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The deployment of Vision-Language Models (VLMs) in critical domains like disaster management requires high-quality multimodal datasets, especially for transferring knowledge via Data-Free Knowledge Distillation (DFKD). However, existing datasets in this domain either entirely lack descriptive text, such as Incidents1M, or suffer from severe text-image semantic misalignment, such as CrisisMMD. In this work, we present a novel methodology to construct and automatically validate a large-scale multimodal dataset for disaster response. Starting from the vision-only Incidents1M, we successfully recovered 100,000 images and generated high-fidelity textual descriptions using two distinct Qwen3.5 architectures: a 4B dense model and a 35B Mixture-of-Experts (MoE) model. To ensure the generated captions provide reliable semantic anchoring for DFKD, we introduce an image-blind LLM-as-a-Judge validation pipeline leveraging Qwen3.5-9B. By intentionally obscuring the original image from the judge, this evaluator accurately simulates the modality gap of the student model during data-free distillation. Our evaluation across 173,179 label pairs demonstrates a high semantic agreement (78.65/100) between the two architectures. Furthermore, the automated evaluation reveals a conservative captioning behaviour, characterized by a high Precision (77.6%) and low Recall (46.0%). This minimizes the false positive noise, while simultaneously exposing underlying human annotation inconsistencies in the original ground truth. This work provides a scalable, LLM-validated multimodal dataset and a reproducible framework to advance cross-modal knowledge distillation.
- Abstract(参考訳): 災害管理のような重要な領域におけるビジョン・ランゲージ・モデル(VLM)の展開には、特にデータ自由知識蒸留(DFKD)を介して知識を伝達するために、高品質なマルチモーダルデータセットが必要である。
しかし、この領域の既存のデータセットには、インシデント1Mのような記述的なテキストが完全に欠けているか、CrisisMMDのような厳しいテキストイメージのセマンティックなミスアライメントに悩まされている。
本研究では,災害対応のための大規模マルチモーダルデータセットの構築と自動検証を行う新しい手法を提案する。
視覚のみのインシデント1Mから10万枚の画像を復元し,2つの異なるQwen3.5アーキテクチャ(4B高密度モデルと35Bミクチャー・オブ・エクササイズ(MoE)モデル)を用いて高忠実度テキスト記述を生成することに成功した。
生成したキャプションがDFKDに信頼性のあるセマンティックアンカーを提供することを保証するため,Qwen3.5-9Bを利用した画像ブラインドLLM-as-a-Judge検証パイプラインを導入する。
この評価器は、判断者からの原像を意図的に隠蔽することにより、データフリー蒸留時の学生モデルのモダリティギャップを正確にシミュレートする。
173,179個のラベルペアに対して評価を行った結果,2つのアーキテクチャ間のセマンティックな合意(78.65/100)が得られた。
さらに、自動評価は、高い精度(77.6%)と低いリコール(46.0%)を特徴とする保守的なキャプション動作を明らかにする。
これは偽陽性ノイズを最小限に抑えつつ、基礎となる人間のアノテーションの不整合を元の根拠の真実で同時に露呈する。
この研究は、スケーラブルでLLM価のマルチモーダルデータセットと、クロスモーダルな知識蒸留を促進する再現可能なフレームワークを提供する。
関連論文リスト
- Towards Generalizable Forgery Detection and Reasoning [23.858913560970866]
We formulate detection and explanation as a unified forgery Detection and Reasoning task (FDR-Task)
マルチモーダル・フォージェリー推論データセット (MMFR-Dataset) は10つの生成モデルにわたる120K画像を含む大規模データセットであり, フォージェリー属性には378Kの推論アノテーションがある。
複数の生成モデルに対する実験により、FakeReasoningは堅牢な一般化を実現し、検出タスクと推論タスクの両方において最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2025-03-27T06:54:06Z) - CoSimGen: Controllable Diffusion Model for Simultaneous Image and Mask Generation [1.9393128408121891]
既存の生成モデルは、高品質で同時画像マスク生成の必要性に対処できない。
本稿では,同時画像生成とマスク生成を同時に行うための拡散型フレームワークであるCoSimGenを提案する。
CoSimGenはすべてのデータセットで最先端のパフォーマンスを達成し、データセットで0.11、LPIPSで0.53の最低KIDを達成した。
論文 参考訳(メタデータ) (2025-03-25T13:48:22Z) - AnomalySD: Few-Shot Multi-Class Anomaly Detection with Stable Diffusion Model [7.942354689705658]
異常検出は製造業において重要な課題であり、製品の欠陥部分を特定することを目的としている。
ほとんどの産業的異常検出法は、訓練に十分な正規データが存在することを前提としている。
本稿では,安定拡散モデルを用いた数発のマルチクラス異常検出フレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-04T08:33:44Z) - Multi-Modal Prompt Learning on Blind Image Quality Assessment [65.0676908930946]
画像品質評価(IQA)モデルは意味情報から大きな恩恵を受け、異なる種類のオブジェクトを明瞭に扱うことができる。
十分な注釈付きデータが不足している従来の手法では、セマンティックな認識を得るために、CLIPイメージテキスト事前学習モデルをバックボーンとして使用していた。
近年のアプローチでは、このミスマッチに即時技術を使って対処する試みがあるが、これらの解決策には欠点がある。
本稿では、IQAのための革新的なマルチモーダルプロンプトベースの手法を提案する。
論文 参考訳(メタデータ) (2024-04-23T11:45:32Z) - Progressive Alignment with VLM-LLM Feature to Augment Defect Classification for the ASE Dataset [7.1083241462091165]
従来の欠陥分類アプローチは2つの障壁に直面している。
不十分なトレーニングデータと不安定なデータ品質。
画像上に記録されたリッチなデータ記述を含む,欠陥分類のための特別なデータセットを提案するが,欠陥特徴を直接学習するのは困難である。
論文 参考訳(メタデータ) (2024-04-08T04:17:27Z) - Identifying and Mitigating Model Failures through Few-shot CLIP-aided
Diffusion Generation [65.268245109828]
本稿では,突発的相関に付随する障害モードのテキスト記述を生成するためのエンドツーエンドフレームワークを提案する。
これらの記述は拡散モデルのような生成モデルを用いて合成データを生成するのに使うことができる。
本実験では, ハードサブポピュレーションの精度(sim textbf21%$)が著しく向上した。
論文 参考訳(メタデータ) (2023-12-09T04:43:49Z) - Sieve: Multimodal Dataset Pruning Using Image Captioning Models [11.362835828985494]
Vision-Language Models (VLM) は、大規模で多様でノイズの多いWebcrawledデータセットで事前トレーニングされている。
提案手法は,CLIPがノイズラベルを事前学習しているため,偽陽性や陰性などの複数の制約を伴っていると論じる。
そこで我々は,小,多様,整列した画像テキストペア上で事前訓練された画像キャプションモデルによって生成された合成キャプションを用いたプルーニング信号Sieveを提案する。
論文 参考訳(メタデータ) (2023-10-03T14:53:53Z) - On quantifying and improving realism of images generated with diffusion [50.37578424163951]
与えられた画像の5つの統計的測度から算出した画像リアリズムスコア(IRS)と呼ばれるメトリクスを提案する。
IRSは、与えられた画像を実または偽のものとして分類する手段として容易に利用できる。
我々は,安定拡散モデル (SDM) , Dalle2, Midjourney, BigGAN による偽画像の検出に成功して,提案したIRSのモデルおよびデータに依存しない性質を実験的に確立した。
このデータセットは、高品質の4つのモデルによって生成される100のクラスに対して1,000のサンプルを提供します。
論文 参考訳(メタデータ) (2023-09-26T08:32:55Z) - Masked Images Are Counterfactual Samples for Robust Fine-tuning [77.82348472169335]
微調整の深層学習モデルは、分布内(ID)性能と分布外(OOD)堅牢性の間のトレードオフにつながる可能性がある。
そこで本研究では,マスク付き画像を対物サンプルとして用いて,ファインチューニングモデルのロバスト性を向上させる新しいファインチューニング手法を提案する。
論文 参考訳(メタデータ) (2023-03-06T11:51:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。