論文の概要: MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models
- arxiv url: http://arxiv.org/abs/2607.01117v1
- Date: Wed, 01 Jul 2026 16:04:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.980494
- Title: MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models
- Title(参考訳): MoHallBench: ビデオ大言語モデルにおける運動幻覚のベンチマーク
- Abstract要約: ビデオLLMにおける運動幻覚の診断のためのベンチマークであるMoHallBenchを提案する。
MoHallBenchは、共起前兆、逐次推論、類似性混乱の3つの主要な幻覚源を体系的に評価している。
- 参考スコア(独自算出の注目度): 40.92844894741183
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video Large Language Models (VideoLLMs) have shown strong progress in video understanding, yet they still suffer from hallucinations that are inconsistent with visual evidence. Existing benchmarks mainly focus on object hallucination or coarse action perception, leaving a key video-specific problem underexplored: motion hallucination, in which models infer human motions that are absent from the video. We present MoHallBench, a benchmark for diagnosing motion hallucination in VideoLLMs. MoHallBench systematically evaluates three major sources of hallucination: co-occurrence priors, sequential inference, and similarity confusion. It contains 11,306 video clips and 40,493 question-answer pairs, covering binary-choice, multiple-choice, and generative settings. We further introduce a bi-directional questioning protocol with bias-aware metrics to reduce affirmation bias in binary evaluation. Experiments on ten recent open-source VideoLLMs reveal a clear decoupling between action recognition and hallucination resistance, as models that perform well on positive action recognition often fail on adversarial negatives. Among all settings, sequential inference hallucination is the most severe, showing that current models tend to over-infer expected outcomes from partial motion cues. Our analyses further confirm that stronger priors and finer-grained similarity substantially amplify hallucination. We hope MoHallBench can facilitate future evaluation and mitigation of motion hallucination in VideoLLMs.
- Abstract(参考訳): Video Large Language Models (VideoLLMs) はビデオ理解の進歩が著しいが、視覚的証拠とは相容れない幻覚に悩まされている。
既存のベンチマークでは、主に物体の幻覚や粗い行動知覚に焦点が当てられており、ビデオから欠落している人間の動きをモデルが推測する動き幻覚(Motion Hallucination)という、ビデオ特有の重要な問題が未解決のまま残されている。
ビデオLLMにおける運動幻覚の診断のためのベンチマークであるMoHallBenchを提案する。
MoHallBenchは、共起前兆、逐次推論、類似性混乱の3つの主要な幻覚源を体系的に評価している。
11,306の動画クリップと40,493の質問応答ペアが含まれており、バイナリ選択、複数選択、生成設定をカバーしている。
さらに、二分評価における肯定バイアスを低減するために、バイアス対応のメトリクスを持つ双方向質問プロトコルを導入する。
最近の10のオープンソースビデオLLMの実験では、正の行動認識でよく機能するモデルが敵の否定で失敗するので、アクション認識と幻覚抵抗の明確な分離が示されている。
あらゆる設定の中で、シーケンシャルな推論幻覚が最も深刻であり、現在のモデルでは、部分的な動きの手がかりから期待される結果を過大に推測する傾向があることを示している。
さらに,より強い先行とより微細な類似性が幻覚を著しく増幅することを確認した。
我々は,MoHallBenchがビデオLLMにおける運動幻覚の今後の評価と緩和を容易にすることを願っている。
関連論文リスト
- MotionHalluc: Diagnosing Kinematic Hallucinations in Fine-Grained Motion Reasoning [4.895176146260259]
我々は、ペアビデオ比較において、運動幻覚を評価するためのベンチマークであるMotionHallucを紹介する。
MotionHallucは553の動画対に対して1540のきめ細かい質問からなり、(1)幻覚、(2)帰属幻覚、(3)時間幻覚の3つの中核次元に沿った幻覚を評価する。
以上の結果から, 映像間比較における幻覚の低減には, 明瞭な定量測定による動作推論が重要な要因であることが示唆された。
論文 参考訳(メタデータ) (2026-06-22T09:13:19Z) - SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding [30.820850789099932]
本稿では,各出力トークンに対する時間的・空間的忠実度を適応的に向上する学習自由度手法を提案する。
SEASONは3つの幻覚検査ベンチマークにおいて、既存のトレーニングなし幻覚緩和アプローチよりも優れています。
論文 参考訳(メタデータ) (2025-12-04T10:17:20Z) - Alternating Perception-Reasoning for Hallucination-Resistant Video Understanding [35.20942192333083]
我々は、ループベースのパラダイムと反幻覚報酬を統合した新しいフレームワークを導入する。
一度にビデオを記述する代わりに、各ループは正確なタイムスタンプを持つビデオセグメントを記述するためにモデルを必要とする。
幻覚のリスクに対して、Factual-Aware Evaluatorは、各知覚結果を信頼できる反幻覚報酬として評価する。
論文 参考訳(メタデータ) (2025-11-23T14:14:14Z) - MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models [56.49314029765706]
本稿では,LVMの幻覚を系統的に評価するベンチマークであるMESHを紹介する。
MESHでは、ターゲットインスタンスとトラップインスタンスを組み込んだバイナリとマルチチョイスフォーマットを備えたQA-Answeringフレームワークを使用している。
我々は,MESHがビデオの幻覚を効果的かつ包括的に識別する手法であることを実証した。
論文 参考訳(メタデータ) (2025-09-10T12:34:07Z) - ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding [61.526407756322264]
ELV-Hallucは、ビデオの幻覚に関する最初のベンチマークである。
モデルは、急速に変化するセマンティクスにおいてSAHの傾向が強くなる。
また,ELV-Halluc と Video-MME の改善も達成した。
論文 参考訳(メタデータ) (2025-08-29T10:25:03Z) - Exploring Hallucination of Large Multimodal Models in Video Understanding: Benchmark, Analysis and Mitigation [49.885797244626694]
大型マルチモーダルモデル(LMM)の幻覚は、正しいように見えるが実際には正しくない応答を提供する。
本稿では,ビデオモダリティにおけるLMMの幻覚問題について検討することを目的としている。
論文 参考訳(メタデータ) (2025-03-25T13:12:17Z) - Trust Me, I'm Wrong: LLMs Hallucinate with Certainty Despite Knowing the Answer [51.7407540261676]
本研究では,モデルが常に正しい解答を行うことのできる幻覚の別のタイプについて検討するが,一見自明な摂動は,高い確実性で幻覚応答を生じさせる。
この現象は特に医学や法学などの高度な領域において、モデルの確実性はしばしば信頼性の代用として使用される。
CHOKEの例は、プロンプト間で一貫性があり、異なるモデルやデータセットで発生し、他の幻覚と根本的に異なることを示す。
論文 参考訳(メタデータ) (2025-02-18T15:46:31Z) - EventHallusion: Diagnosing Event Hallucinations in Video LLMs [42.66453293963568]
MLLM(Multimodal Large Language Models)はビデオ理解の分野で大きな進歩を遂げている。
本稿では,イベントに対するビデオLLMの幻覚を評価する新しいベンチマークであるEventHallusionを提案する。
また,ビデオLLMの幻覚化問題に対処するため,TCD(Temporal Contrastive Decoding)と呼ばれるシンプルで効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-09-25T03:49:46Z) - VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models [59.05674402770661]
本稿では,大規模ビデオ言語モデル(LVLM)における幻覚検出のための最初の総合的ベンチマークであるVideoHallucerを紹介する。
VideoHallucerは幻覚を2つの主なタイプに分類する。
論文 参考訳(メタデータ) (2024-06-24T06:21:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。