論文の概要: Towards reliable multimodal disaster severity assessment through preference optimization and explainable vision-language reasoning
- arxiv url: http://arxiv.org/abs/2609.00879v1
- Date: Tue, 01 Sep 2026 08:11:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.459865
- Title: Towards reliable multimodal disaster severity assessment through preference optimization and explainable vision-language reasoning
- Title(参考訳): 優先最適化と説明可能な視覚言語推論によるマルチモーダル災害重大度評価に向けて
- Authors: Yuanjun Zhang, Fuzel Ahamed Shaik, Suvojit Acharjee, Fahad Khalid, Mourad Oussalah,
- Abstract要約: 本研究では、スーパービジョンファインチューニング(SFT)とダイレクトパラメータ最適化(DPO)を統合した2段階トレーニングフレームワークを提案する。
自動メトリクス、モデルベーススコアリング、人格ランキングを用いて、分類性能と説明品質の両方を評価する。
実験の結果、SFTの精度は73.64%から78.29%に向上し、Macro-F1はベースラインに比べて29%向上した。
- 参考スコア(独自算出の注目度): 2.5428307120715634
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable disaster damage assessment requires models that provide both accurate predictions and transparent explanations. However, existing multimodal approaches are limited by scarce annotated data and insufficient evaluation of reasoning quality. This study proposes a two-stage training framework that integrates Supervised Fine-Tuning (SFT) and Direct Preference Optimization (DPO) within a unified data construction pipeline. From a single Human-in-the-Loop (HITL) annotation workflow, two complementary datasets are derived, namely ReasoningSet, which contains validated rationales for SFT, and PreferenceSet, which comprises paired rationales for DPO-based alignment. The framework evaluates both classification performance and explanation quality using automatic metrics, model-based scoring, and human ranking. Experimental results show that SFT improves accuracy from 73.64% to 78.29% and increases Macro-F1 by 29% compared to the baseline, while explanation quality improves by approximately 25%. Subsequent DPO alignment further enhances interpretability on the PreferenceSet. Cross-model validation on InternVL-3-8B and LLaVA-1.5-7B demonstrates the robustness and generalizability of the approach. The proposed framework improves detection of underrepresented mild damage cases, reduces high-risk misclassifications, and strengthens alignment between model reasoning and human judgment. Overall, it provides a reproducible pathway to develop reliable multimodal systems that deliver auditable, actionable disaster insights for emergency management.
- Abstract(参考訳): 信頼性の高い災害被害評価には、正確な予測と透明な説明の両方を提供するモデルが必要である。
しかし、既存のマルチモーダルアプローチは、注釈付きデータが少なく、推論品質の評価が不十分なため、制限されている。
本研究では、統合データ構築パイプラインにスーパービジョンファインチューニング(SFT)とダイレクトパラメータ最適化(DPO)を統合する2段階のトレーニングフレームワークを提案する。
単一のHuman-in-the-Loop(HITL)アノテーションワークフローから、SFTの検証された有理性を含むReasoningSetと、DPOベースのアライメントのためのペア化された有理性を含むPreferenceSetという、2つの補完的なデータセットが導出される。
このフレームワークは、自動メトリクス、モデルベースのスコアリング、人格ランキングを用いて、分類性能と説明品質の両方を評価する。
実験の結果、SFTの精度は73.64%から78.29%に向上し、Macro-F1はベースラインに比べて29%向上し、説明品質は約25%向上した。
その後のDPOアライメントはPreferenceSetの解釈可能性をさらに高める。
InternVL-3-8BとLLaVA-1.5-7Bのクロスモデル検証は、このアプローチの堅牢性と一般化性を示している。
提案手法は, 軽度損傷事例の検出を改善し, リスクの高い誤分類を低減し, モデル推論と人的判断の整合性を高める。
全体として、緊急管理のために監査可能で行動可能な災害情報を提供する信頼性の高いマルチモーダルシステムを開発するための再現可能な経路を提供する。
関連論文リスト
- The Good, the Bad, and the Brittle: Benchmarking Robustness and Generalisation of Histopathology Foundation Models [0.1274452325287335]
12の病理基盤モデル(PFM)とResNetのベースラインをベンチマークした。
PFMは、堅牢性とドメインの一般化の両方においてCNNを一貫して上回っているが、モデルスケーリングはリターンの低下を示している。
NR-Kfold解析では,訓練とテストの類似性が破られた場合,系統的精度の低下と変動の増大が明らかになった。
論文 参考訳(メタデータ) (2026-07-05T16:49:09Z) - Benchmarking Sensor-Fault Robustness in Forecasting [34.25988781693566]
我々は,予測アーキテクチャとロバスト性改善手法を評価するために,共有CPS地上センサフォアストレステストプロトコルであるSensorFault-Benchを紹介する。
最悪のシナリオ劣化、クリーン平均二乗誤差(MSE)、最悪のシナリオ故障時間MSEを報告し、絶対誤差から相対ロバスト性を分離する。
SensorFault-Benchは、オープンソースコード、ドキュメント化されたデータアクセス、再生および拡張ガイドを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:41:14Z) - CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling [61.75914342638658]
CDRRM(Contrast-Driven Reward Model)は、高品質なルーリック生成と優先判断のためのフレームワークである。
この作業は、報酬モデリングのためのスケーラブルで解釈可能で、データ効率のよいパスを提供する。
論文 参考訳(メタデータ) (2026-03-09T07:15:23Z) - Observationally Informed Adaptive Causal Experimental Design [55.998153710215654]
本稿では,観測モデルを基礎的先行として活用する新たなパラダイムであるアクティブ残留学習を提案する。
このアプローチは、実験的な焦点を、目標因果量の学習から、観察バイアスの補正に必要な残差を効率的に推定するへとシフトさせる。
合成および半合成ベンチマークの実験は、R-Designがベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-03-04T06:52:37Z) - Benchmarking Corruption Robustness of LVLMs: A Discriminative Benchmark and Robustness Alignment Metric [49.393713730706445]
汚損の堅牢性を評価するための識別サンプルを強調したベンチマークであるBench-Cを紹介する。
本稿では,ロバストネスアライメントスコア(RAS)を提案する。
論文 参考訳(メタデータ) (2025-11-24T12:07:56Z) - Structured Uncertainty guided Clarification for LLM Agents [126.26213027785813]
LLMエージェントは、ツールコール機能を備えた大きな言語モデルを拡張するが、曖昧なユーザ命令は、しばしば誤った呼び出しやタスクの失敗につながる。
本稿では,ツールコールパラメータに対する構造的不確かさの定式化,完全情報の期待値(EVPI)を目標としたPOMDPのモデル化,冗長性防止のためのアスペクトベースコストモデルを提案する。
我々のSAGE-Agentは、この構造化された不確実性を活用し、より優れた効率を達成するために、曖昧なタスクのカバレッジを7~39%増加させ、明確な質問を1.5~2.7$times$に減らした。
論文 参考訳(メタデータ) (2025-11-11T21:50:44Z) - T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation [60.620408007636016]
T2I-Eval-R1は,大まかな品質スコアのみを用いて,オープンソースのMLLMを訓練する新しい強化学習フレームワークである。
提案手法では,グループ相対政策最適化を命令調整プロセスに統合し,スカラースコアと解釈可能な推論チェーンの両方を生成する。
論文 参考訳(メタデータ) (2025-05-23T13:44:59Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z) - Exploring Optimal Substructure for Out-of-distribution Generalization
via Feature-targeted Model Pruning [23.938392334438582]
本研究では,不均一な部分構造を自動探索するために,SFPと呼ばれる新しいSpurious Feature-targeted Model Pruningフレームワークを提案する。
SFP は構造ベースおよび非構造 OOD 一般化 SOTA をそれぞれ4.72% と 23.35% に向上させることができる。
論文 参考訳(メタデータ) (2022-12-19T13:51:06Z) - Unifying Model Explainability and Robustness for Joint Text
Classification and Rationale Extraction [11.878012909876713]
そこで我々は,AT-BMCという共同分類と合理的抽出モデルを提案する。
混合逆行訓練(AT)は、モデルの堅牢性を改善するために離散的および埋め込み空間における様々な摂動を利用するように設計されており、境界マッチング制約(BMC)は境界情報のガイダンスによりより正確に有理性を見つけるのに役立つ。
ベンチマークデータセットのパフォーマンスは、提案されたAT-BMCが、大きなマージンによる分類と合理性抽出の両方のベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2021-12-20T09:48:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。