論文の概要: OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2609.11244v1
- Date: Thu, 10 Sep 2026 08:41:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.259803
- Title: OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models
- Title(参考訳): OmniHallu:マルチモーダル大言語モデルにおけるクロスモーダル理解と生成のための統一幻覚検出
- Abstract要約: 我々は、理解タスクと生成タスクの両方にまたがる統合幻覚検出フレームワークであるOmniHalluを紹介する。
我々のマルチエージェントアーキテクチャは、モデル出力を原子クレームに分解し、モダリティ固有の専門家を通して検証し、構造化された推論を通して証拠を集約する。
- 参考スコア(独自算出の注目度): 2.9934878496863946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Multimodal Large Language Models (MLLMs) have achieved remarkable progress across diverse tasks, they suffer from hallucinations where generated outputs contradict or misrepresent input semantics. Existing research typically addresses hallucination detection within a single modality or task type, limiting generalizability. We introduce OmniHallu, a unified hallucination detection framework spanning both comprehension and generation tasks across image, video, and audio modalities. We contribute OmniHallu-Bench, a 10,000-sample benchmark with claim-level human annotations covering six cross-modal tasks: image-to-text (I2T), video-to-text (V2T), audio-to-text (A2T), text-to-image (T2I), text-to-video (T2V), and text-to-audio (T2A). Our multi-agent architecture decomposes model outputs into atomic claims, verifies them through modality-specific experts, and aggregates evidence via structured reasoning. We further propose a preference-optimized trainable verifier that approximates the multi-agent decision boundary, reducing expert calls by 66% with minimal performance loss. Extensive experiments reveal a consistent modality-dependent performance gradient and provide fine-grained insights into cross-modal hallucination patterns.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は様々なタスクにおいて顕著な進歩を遂げているが、生成した出力が矛盾したり、入力セマンティクスを誤って表現する幻覚に悩まされている。
既存の研究は通常、単一のモダリティまたはタスクタイプ内の幻覚検出に対処し、一般化可能性を制限する。
OmniHalluは、画像、ビデオ、オーディオのモダリティにまたがる理解タスクと生成タスクにまたがる統合幻覚検出フレームワークである。
我々は,イメージ・トゥ・テキスト(I2T),ビデオ・トゥ・テキスト(V2T),オーディオ・トゥ・テキスト(A2T),テキスト・トゥ・イメージ(T2I),テキスト・トゥ・ビデオ(T2V),テキスト・トゥ・オーディオ(T2A)の6つのタスクをカバーするクレームレベルのヒューマンアノテーションを備えた10,000サンプルベンチマークであるOmniHallu-Benchを寄贈した。
我々のマルチエージェントアーキテクチャは、モデル出力を原子クレームに分解し、モダリティ固有の専門家を通して検証し、構造化された推論を通して証拠を集約する。
さらに、マルチエージェント決定境界を近似し、性能損失を最小限に抑えた専門家の呼び出しを66%削減する、優先最適化トレーニング可能な検証器を提案する。
大規模な実験では、一貫したモダリティに依存した性能勾配が示され、クロスモーダル幻覚パターンに関するきめ細かい洞察を提供する。
関連論文リスト
- UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations [61.85916280854257]
LVLM(Large Vision-Language Models)は印象的な視覚的推論と対話機能を実現するが、視覚入力によるコンテンツサポートを幻覚させることが多い。
textbfUniProbeは軽量で統一された学習可能な検出器で、凍ったLVLMの不均一な計算トレースを1つの前方パスからモデル化する。
論文 参考訳(メタデータ) (2026-08-11T12:01:59Z) - MultiHaluDet: Multilingual Hallucination Detection via LLM Hidden State Probing [1.3700362496838856]
大規模言語モデル(LLM)における幻覚は、信頼性の高いデプロイメントにとって重要な障壁である。
多言語幻覚を検出する新しい3段階積み重ねフレームワークであるMultiHaluDetを紹介する。
本フレームワークは,HluEvalおよびTriviaQAベンチマークで98.55%のAUROCに到達し,最先端検出性能を実現する。
論文 参考訳(メタデータ) (2026-05-24T07:50:03Z) - OmniRet: Efficient and High-Fidelity Omni Modality Retrieval [51.80205678389465]
OmniRetは,テキスト,視覚,音声の3つの重要なモダリティにまたがる複雑なクエリを処理可能な,最初の検索モデルである。
提案モデルでは,コンポジションクエリ,音声,ビデオ検索のタスクにおいて,最先端のモデルを用いたオンパーパフォーマンスを実現しつつ,大幅な改善を実現している。
論文 参考訳(メタデータ) (2026-03-02T17:19:55Z) - Investigating the Viability of Employing Multi-modal Large Language Models in the Context of Audio Deepfake Detection [6.491407316650203]
VLM(Vision-Language Models)とMLLM(Multimodal Large Language Models)は、画像やビデオのディープフェイクの検出において、強力な一般化を示している。
我々は,音声深度検出のためのMLLMの可能性を探究することを目的としている。
論文 参考訳(メタデータ) (2026-01-02T18:17:22Z) - Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception [97.32606786622728]
我々は、データパイプライン、モデル、ベンチマークの観点から、Omniの詳細な認識を体系的で包括的に調査する。
ツールコールを統合したエージェントデータ生成パイプラインであるOmni-Detectiveを提案する。
Omni-Detectiveで生成されたデータに基づいて、2つのキャプションモデル:音声のみの詳細な知覚のためのオーディオ・キャプション・キャプション・モデルと、音声視覚による詳細な知覚のためのOmni-Captionerを訓練する。
論文 参考訳(メタデータ) (2025-10-14T17:00:09Z) - Beyond ROUGE: N-Gram Subspace Features for LLM Hallucination Detection [5.0106565473767075]
大規模言語モデル(LLM)は、自然言語を含む様々なタスクにおいて有効性を示す。
幻覚の根本的な問題は依然としてこれらのモデルに悩まされており、一貫性のある真正な情報を生成する際の信頼性を制限している。
LLM生成テキストからN-Gram周波数テンソルを構成するROUGEにインスパイアされた新しい手法を提案する。
このテンソルは共起パターンを符号化することでよりリッチな意味構造を捉え、事実と幻覚的コンテンツをよりよく区別することができる。
論文 参考訳(メタデータ) (2025-09-03T18:52:24Z) - OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination [32.43796002503023]
Omni-modal large language model (OLLM) における幻覚を軽減するために設計された好み調整フレームワークであるOmniDPOを提案する。
両課題に対処することにより、OmniDPOはマルチモーダルグラウンドを効果的に改善し、幻覚を減少させる。
論文 参考訳(メタデータ) (2025-08-31T07:19:32Z) - A Survey of Multimodal Hallucination Evaluation and Detection [52.03164192840023]
MLLM(Multi-modal Large Language Models)は、視覚情報とテキスト情報を統合するための強力なパラダイムとして登場した。
これらのモデルはしばしば幻覚に悩まされ、もっともらしいように見えるコンテンツを生成するが、入力内容や確立された世界的知識と矛盾する。
本調査では,イメージ・トゥ・テキスト(I2T)およびテキスト・トゥ・イメージ(T2I)生成タスクを対象とした幻覚評価ベンチマークと検出方法の詳細なレビューを行う。
論文 参考訳(メタデータ) (2025-07-25T07:22:42Z) - M2K-VDG: Model-Adaptive Multimodal Knowledge Anchor Enhanced
Video-grounded Dialogue Generation [24.480587619037184]
ビデオグラウンドド・ダイアログ生成(VDG)では,マルチモーダル知識に基づいて,流動的で正確な回答を生成する必要がある。
マルチモーダル知識利用の難しさは、実際にはVDGモデルに深刻な幻覚をもたらす。
幻覚軽減のためのモデル適応型マルチモーダル知識アンカー拡張フレームワークM2K-VDGを提案する。
論文 参考訳(メタデータ) (2024-02-19T06:32:39Z) - AutoHall: Automated Hallucination Dataset Generation for Large Language Models [56.92068213969036]
本稿では,AutoHallと呼ばれる既存のファクトチェックデータセットに基づいて,モデル固有の幻覚データセットを自動的に構築する手法を提案する。
また,自己コントラディションに基づくゼロリソース・ブラックボックス幻覚検出手法を提案する。
論文 参考訳(メタデータ) (2023-09-30T05:20:02Z) - MuRAG: Multimodal Retrieval-Augmented Generator for Open Question
Answering over Images and Text [58.655375327681774]
我々は,Multimodal Retrieval-Augmented Transformer (MuRAG)を提案する。
MuRAGは外部の非パラメトリックマルチモーダルメモリにアクセスして言語生成を増強する。
以上の結果から, MuRAGは最先端の精度を達成し, 既存のモデルよりも10~20%精度が高いことがわかった。
論文 参考訳(メタデータ) (2022-10-06T13:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。