論文の概要: Symbal: Detecting Systematic Misalignments in Model-Generated Captions
- arxiv url: http://arxiv.org/abs/2607.15216v1
- Date: Thu, 16 Jul 2026 17:18:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.183534
- Title: Symbal: Detecting Systematic Misalignments in Model-Generated Captions
- Title(参考訳): Symbal: モデル生成キャプションにおける系統的ミスアライメントの検出
- Abstract要約: 本研究は, 系統的誤りとして言及するキャプションエラーのクラスに焦点を当てる。
本研究の目的は,MLLM生成キャプションを用いた視覚言語データセットを用いて,そのような誤りを検出することである。
本稿では、既成の基盤モデルを用いた構造化二段構成を用いて、系統的ミスアライメントを識別するSymbalを提案する。
- 参考スコア(独自算出の注目度): 10.388673049493947
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) often introduce errors when generating image captions, resulting in misaligned image-text pairs. Our work focuses on a class of captioning errors that we refer to as systematic misalignments, where a recurring error in MLLM-generated captions is closely associated with the presence of a specific visual feature in the paired image. Given a vision-language dataset with MLLM-generated captions, our aim in this work is to detect such errors, a task we refer to as systematic misalignment detection. As our first key contribution, we present Symbal, which utilizes a structured, dual-stage setup with off-the-shelf foundation models to identify systematic misalignments and summarize results in natural language. As our second key contribution, we introduce SymbalBench, a benchmark designed to evaluate automated methods on our proposed task. SymbalBench consists of 1.7 million image-text pairs from two domains (natural and medical images), organized into 420 vision-language datasets with annotated systematic misalignments. Symbal exhibits strong performance on this benchmark, correctly identifying systematic misalignments in 63.8% of datasets, a nearly 4x improvement over the closest baseline. We supplement our evaluations on SymbalBench with real-world evaluations, showing that (1) Symbal can accurately surface systematic misalignments in captions generated by four MLLMs and (2) Symbal is a powerful tool for auditing off-the-shelf image-caption datasets. Ultimately, our novel task, method, and benchmark can aid users with auditing MLLM-generated captions and identifying critical errors, without requiring access to the underlying MLLM. Code is available at https://github.com/Stanford-AIMI/Symbal.
- Abstract(参考訳): MLLM(Multimodal large language model)は、画像キャプションの生成時にエラーが発生し、画像とテキストのペアが一致しない。
本研究は,MLLM 生成したキャプションにおける繰り返しエラーが,ペア画像の特定の視覚的特徴の存在と密接に関連しているような,系統的な誤認識(systemal misalignment)と呼ばれるキャプションエラーのクラスに焦点を当てる。
本研究の目的は,MLLM生成キャプションを用いた視覚言語データセットを用いて,このような誤りを検知することである。
最初の重要なコントリビューションとして、既成の基盤モデルによる構造化された二重ステージのセットアップを利用して、体系的なミスアライメントを識別し、結果を自然言語で要約するSymbalを提案する。
第2のキーコントリビューションとして,提案タスクにおける自動メソッドの評価を目的としたベンチマークであるSybalBenchを紹介した。
SymbalBenchは、2つのドメイン(自然画像と医用画像)から170万の画像テキストペアで構成され、420の視覚言語データセットに注釈付き系統的ミスアライメントで編成されている。
Symbalは、このベンチマークで強いパフォーマンスを示し、63.8%のデータセットにおいて、体系的なミスアライメントを正しく識別し、最も近いベースラインよりも4倍近く改善した。
The Symbal Bench with real-world evaluations, showed that Symbal can accurate surface systematic misalignment in Casts by four MLLMs and (2) Symbal is a powerful tool for auditing off-the-shelf image-caption datasets。
最終的に、我々の新しいタスク、方法、ベンチマークは、MLLMの生成したキャプションを監査し、基盤となるMLLMへのアクセスを必要とせずにクリティカルエラーを特定するのに役立つ。
コードはhttps://github.com/Stanford-AIMI/Symbal.comで入手できる。
関連論文リスト
- MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding [39.29898673779214]
Whole Slide Images (WSIs) は階層構造を示し、診断情報は細胞形態、局所組織組織、世界的文脈から現れる。
既存の計算病理学(CPath) マルチモーダル言語モデル(MLLM)は一般にWSI全体を単一の埋め込みに圧縮する。
我々は、WSIレベルのMLLMであるtextbfMLLMHWSIを導入し、4つの異なるスケールで視覚特徴とマルチスケール言語を整列する。
論文 参考訳(メタデータ) (2026-03-24T11:04:58Z) - Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs [32.58951235745983]
大規模言語モデル(MLLM)における相互整合性を評価するための2つの新しいベンチマークを導入する。
本ベンチマークでは3つのモード(画像,テキスト,混合)で同じ意味情報を持つサンプルを含む。
論文 参考訳(メタデータ) (2025-12-09T18:57:07Z) - FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges [85.24983823102262]
本稿では,テキスト・トゥ・イメージ(T2I)モデルと視覚言語モデル(VLM)を評価するための構造化手法を提案する。
我々は,挑戦的プロンプトで条件付きT2Iモデルにより生成された画像において,VLMが27の特定の障害モードを識別できるかどうかを検証した。
以上の結果から,現在の測定値ではこれらの誤差を捉えるには不十分であることが示唆された。
論文 参考訳(メタデータ) (2025-12-01T19:46:03Z) - ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models [23.37951284612929]
動的知覚、科学的推論、具体化された意思決定ドメインにまたがる30K以上のインスタンスのデータセットを構築します。
ViRectifyでは、MLLMに対してステップワイドな誤り識別を行い、重要なビデオ証拠を根拠とした合理性を生成する。
また,視覚的エビデンスに基づく補正手法として,段階的誤り軌道と報酬モデルを組み合わせた軌道証拠駆動補正手法を提案する。
論文 参考訳(メタデータ) (2025-12-01T09:05:02Z) - Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning [27.33722610773045]
マルチモーダル大規模言語モデル (MLLM) は視覚言語タスクにおいて高い性能を達成しているが、細かな視覚的差異に苦慮している。
本稿では,最小限に編集された画像対を意味的に一致した字幕で生成する制御データ生成パイプラインを提案する。
論文 参考訳(メタデータ) (2025-06-08T17:23:36Z) - MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval [50.062817677022586]
Zero-Shot Image Retrieval (ZS-CIR) メソッドは通常、参照イメージを擬似テキストトークンに変換するアダプタを訓練する。
MLLM-Guided VLM Fine-Tuning with Joint Inference (MVFT-JI) を提案する。
論文 参考訳(メタデータ) (2025-05-26T08:56:59Z) - AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding [79.43306110124875]
AlignVLMは視覚的特徴をテキスト埋め込みの重み付き平均値にマッピングする視覚テキストアライメント手法である。
実験の結果,AlignVLMは先行アライメント法と比較して最先端の性能を実現していることがわかった。
論文 参考訳(メタデータ) (2025-02-03T13:34:51Z) - Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage [50.84150600032693]
MLLM(Multimodal large language model)は、非常に詳細なキャプションを生成するのに優れるが、幻覚を引き起こすことが多い。
我々は,LLM-MLLM協調を利用して与えられたキャプションを補正するマルチエージェント手法を提案する。
提案手法は, キャプションの精度を向上し, GPT-4Vによるキャプションの精度を向上する。
論文 参考訳(メタデータ) (2024-12-20T01:37:22Z) - Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval [92.13664084464514]
合成画像検索(CIR)の課題は,検索画像とユーザの意図を記述したテキストに基づいて画像を取得することである。
既存の手法は、CIRタスクにおける高度な大規模視覚言語(VL)モデルにおいて大きな進歩を遂げているが、それらは一般的に、モデルトレーニングのためのラベル付き三重項の欠如とリソース制限された環境への展開の困難という2つの大きな問題に悩まされている。
本稿では、VLモデルを利用して合成学習のためのラベルなし画像のみに依存する画像2Sentenceに基づく非対称ゼロショット合成画像検索(ISA)を提案する。
論文 参考訳(メタデータ) (2024-03-03T07:58:03Z) - Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs [71.07108539262721]
低レベルの視覚に関連する人間の言語応答をエミュレートするためのベンチマーク設定を設計する。
我々は,MLLMの低レベルの認識関連質問応答と記述評価を,単一画像から画像ペアへ拡張する。
複数のMLLMが単一の画像に対して十分な低レベルの視覚能力を持つことを示したが、GPT-4Vのみが人間よりも高い精度で比較できる。
論文 参考訳(メタデータ) (2024-02-11T06:44:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。