論文の概要: Tone Matters: The Impact of Linguistic Tone on Hallucination in VLMs
- arxiv url: http://arxiv.org/abs/2601.06460v1
- Date: Sat, 10 Jan 2026 07:00:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-13 19:08:00.825013
- Title: Tone Matters: The Impact of Linguistic Tone on Hallucination in VLMs
- Title(参考訳): 音質:VLMの幻覚に及ぼす言語音の影響
- Authors: Weihao Hong, Zhiyuan Jiang, Bingyu Shen, Xinlei Guan, Yangyi Feng, Meng Xu, Boyang Li,
- Abstract要約: VLM(Vision-Language Models)は、安全クリティカルなアプリケーションでの利用が増えている。
VLMは、ユーザプロンプトを満たすために画像に存在しない詳細を幻覚させることが多い。
本研究では,刺激圧の異なる形態が幻覚行動にどのように影響するかを検討する。
- 参考スコア(独自算出の注目度): 9.81797972219297
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) are increasingly used in safety-critical applications that require reliable visual grounding. However, these models often hallucinate details that are not present in the image to satisfy user prompts. While recent datasets and benchmarks have been introduced to evaluate systematic hallucinations in VLMs, many hallucination behaviors remain insufficiently characterized. In particular, prior work primarily focuses on object presence or absence, leaving it unclear how prompt phrasing and structural constraints can systematically induce hallucinations. In this paper, we investigate how different forms of prompt pressure influence hallucination behavior. We introduce Ghost-100, a procedurally generated dataset of synthetic scenes in which key visual details are deliberately removed, enabling controlled analysis of absence-based hallucinations. Using a structured 5-Level Prompt Intensity Framework, we vary prompts from neutral queries to toxic demands and rigid formatting constraints. We evaluate three representative open-weight VLMs: MiniCPM-V 2.6-8B, Qwen2-VL-7B, and Qwen3-VL-8B. Across all three models, hallucination rates do not increase monotonically with prompt intensity. All models exhibit reductions at higher intensity levels at different thresholds, though not all show sustained reduction under maximum coercion. These results suggest that current safety alignment is more effective at detecting semantic hostility than structural coercion, revealing model-specific limitations in handling compliance pressure. Our dataset is available at: https://github.com/bli1/tone-matters
- Abstract(参考訳): VLM(Vision-Language Models)は、信頼性の高い視覚的接地を必要とする安全クリティカルなアプリケーションにおいて、ますます使われている。
しかし、これらのモデルはしばしば、ユーザプロンプトを満たすために画像に存在しない詳細を幻覚させる。
VLMの系統的な幻覚を評価するために、最近のデータセットやベンチマークが導入されたが、多くの幻覚行動は依然として不十分である。
特に、先行研究は、主にオブジェクトの存在や欠如に焦点を当てており、迅速な言い回しと構造的制約が体系的に幻覚を誘発するかどうかがはっきりしないままである。
本稿では,刺激圧の異なる形態が幻覚行動にどのように影響するかを検討する。
Ghost-100は、視覚的な重要な詳細を意図的に取り除き、不在による幻覚を制御可能な、手続き的に生成された合成シーンのデータセットである。
構造化された5-Level Prompt Intensity Frameworkを使用して、中立的なクエリから有害な要求、厳格なフォーマット制約まで、さまざまなプロンプトを発生させる。
我々は,MiniCPM-V 2.6-8B,Qwen2-VL-7B,Qwen3-VL-8Bの3種類のオープンウェイトVLMを評価した。
これら3つのモデル全体で、幻覚率は即時強度とともに単調に増加しない。
全てのモデルは異なる閾値で高い強度レベルで還元を示すが、最大強制下で持続的な還元を示すわけではない。
これらの結果から,現在の安全アライメントは構造的保磁力よりも意味的敵意の検出に有効であることが示唆された。
私たちのデータセットは、https://github.com/bli1/tone-matters.comで利用可能です。
関連論文リスト
- HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images [9.716231984097313]
VLM(Large Vision-Language Models)は様々なマルチモーダルタスクにおいて顕著な成功を収めているが、固有の言語バイアスに根ざした幻覚に弱いままである。
本研究では,ハロシン化誘導画像(HII)を正確に合成する新しいパイプラインを設計する。
合成HIIを用いて一貫したシーン条件の幻覚パターンを明らかにする。
提案手法は, 標準的な幻覚ベンチマークにおいて, 最先端の38%の改善を実現している。
論文 参考訳(メタデータ) (2026-02-11T02:11:02Z) - Mechanisms of Prompt-Induced Hallucination in Vision-Language Models [58.991412160253276]
制御されたオブジェクトカウント設定において、プロンプトが画像中のオブジェクト数をオーバーステートする障害モードについて検討する。
刺激誘発幻覚 (PIH) を, 追加訓練を伴わずに40%以上減少させる小さなアテンションヘッドのセットを同定した。
本研究は, 刺激による幻覚を誘発する内的メカニズムについての知見を提示し, モデル特異的な行動の実施方法の違いを明らかにした。
論文 参考訳(メタデータ) (2026-01-08T18:23:03Z) - Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations [73.37711261605271]
幻覚緩和法は主に嗜好アライメントに基づいており、嗜好データ収集には外部の人間のアノテーションや補助モデルが必要である。
本稿では,外部依存を伴わない幻覚を緩和する新規で一般化可能な手法である自己注入による自律的選好アライメント(APASI)を提案する。
APASIはターゲットのLVLMを利用して、生成した応答に幻覚を自己注入し、好みのレベルが異なるペアの応答を生成する。
論文 参考訳(メタデータ) (2025-09-14T14:26:53Z) - SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs [52.03164192840023]
LVLM(Large Vision-Language Models)は、いまだ幻覚に悩まされている。
本稿では,スケーラブルで制御可能で多様な評価データを生成する自動データ構築パイプラインを提案する。
我々は,忠実度と事実性幻覚の両方を評価するためのベンチマークであるSHALEを構築した。
論文 参考訳(メタデータ) (2025-08-13T07:58:01Z) - Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images [6.48620624181578]
SHE(Sequence Hallucination Eradication)は,幻覚を検知し緩和する軽量なフレームワークである。
また,行動幻覚の重症度を定量化する新しい指標(BEACH)を提案する。
論文 参考訳(メタデータ) (2025-06-08T15:08:52Z) - Mitigating Hallucinations in Vision-Language Models through Image-Guided Head Suppression [16.465703269782654]
大型視覚言語モデル (LVLM) はしばしば幻覚に悩まされ、視覚的文脈と一致しないテキストを生成する。
推論時間介入による幻覚の低減を目的とした既存の手法は、遅延を著しく増加させる。
本稿では,タスクに依存しない注意誘導型頭部抑制戦略であるSPINについて述べる。
論文 参考訳(メタデータ) (2025-05-22T09:00:57Z) - HalluLens: LLM Hallucination Benchmark [49.170128733508335]
大規模言語モデル(LLM)は、しばしばユーザ入力やトレーニングデータから逸脱する応答を生成する。
本稿では,新たな内因性評価タスクと既存内因性評価タスクを併用した総合幻覚ベンチマークを提案する。
論文 参考訳(メタデータ) (2025-04-24T13:40:27Z) - Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling [78.78822033285938]
VLM(Vision-Language Models)は視覚的理解に優れ、視覚幻覚に悩まされることが多い。
本研究では,幻覚を意識したトレーニングとオンザフライの自己検証を統合した統合フレームワークREVERSEを紹介する。
論文 参考訳(メタデータ) (2025-04-17T17:59:22Z) - AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models [91.78328878860003]
視覚言語モデル(LVLM)は幻覚の傾向が強い。
ベンチマークは多くの場合、障害パターンが一般化できない手作りのコーナーケースに依存します。
最初の自動ベンチマーク生成手法であるAutoHallusionを開発した。
論文 参考訳(メタデータ) (2024-06-16T11:44:43Z) - Plausible May Not Be Faithful: Probing Object Hallucination in
Vision-Language Pre-training [66.0036211069513]
大規模視覚言語事前学習モデルは、テキストを生成する際に、存在しない視覚オブジェクトを幻覚させる傾向がある。
標準メトリクスでより良いスコアを得るモデルは、オブジェクトをより頻繁に幻覚させる可能性があることを示す。
驚いたことに、パッチベースの機能が最も良く、より小さなパッチ解決は、オブジェクト幻覚の非自明な減少をもたらす。
論文 参考訳(メタデータ) (2022-10-14T10:27:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。