論文の概要: When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models
- arxiv url: http://arxiv.org/abs/2607.08059v1
- Date: Thu, 09 Jul 2026 02:19:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.394792
- Title: When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models
- Title(参考訳): ハルトを考える:視覚言語モデルにおける推論の連鎖におけるエピステマティクス信号
- Authors: Mayank Singal,
- Abstract要約: 視覚言語モデル(VLM)における解答エントロピー行動の最初の3家族的経験的特徴付けを提供する。
Qwen3-VL-8B-Thinkingは完全な崩壊を示し、GLM-4.1V-9B-Thinkingは崩壊しない、InternVL3-8Bは選択的思考を示す。
3つの思考モードモデル全体において、思考チェーンエントロピーは、連鎖が生成される部分集合上での解エントロピーよりも優れる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Uncertainty quantification for visual language models (VLMs) conventionally targets the answer token distribution. We provide the first three-family empirical characterisation of answer entropy behaviour in thinking-mode VLMs. Running four models on identical POPE adversarial samples, we find three qualitatively distinct patterns: Qwen3-VL-8B-Thinking shows complete collapse (ans H AUROC = 0.492); GLM-4.1V-9B-Thinking shows no collapse (0.716); and InternVL3-8B shows selective thinking (chains on only 50% of samples, ans H = 0.675 full / 0.602 thinking-only). Across all three thinking-mode models, thinking chain entropy outperforms answer entropy on the subset where chains are generated (0.647, 0.759, 0.608 vs. 0.492, 0.716, 0.602 respectively), suggesting chain signals are the more reliable predictor whenever chains are present. This holds strongly for Qwen and GLM, but with only marginal and statistically unreliable advantage for InternVL3 (n_FP = 17). A 300-sample VQAv2 pilot confirms chain entropy (0.680) outperforms answer entropy (0.595) on VQAv2 questions, with the gap largest for free-form answers (0.733 vs. 0.467). On harder reasoning tasks (HallusionBench) both Qwen models show moderate signal (approx. 0.64), consistent with incomplete pre-commitment on difficult questions. We additionally document structured abstention affecting 12-22% of queries with asymmetry toward absent-object queries, and a practical abstention gate raising accuracy from 71.0% to 93.8% at 62.7% coverage with no additional inference cost.
- Abstract(参考訳): 視覚言語モデル(VLM)の不確実性定量化は、従来、解答トークンの分布をターゲットとしていた。
思考モードVLMにおける応答エントロピー行動の3家族による最初の経験的特徴化について述べる。
Qwen3-VL-8B-Thinkingは完全な崩壊を示す(H AUROC = 0.492)、GLM-4.1V-9B-Thinkingは崩壊しない(0.716)、InternVL3-8Bは選択的な思考を示す(サンプルの50%にチェーンがあり、 ans H = 0.675 full / 0.602 思考のみ)。
これら3つの思考モードモデル全体で、シンクチェーンエントロピーは、チェーンが生成される部分集合(それぞれ0.647, 0.759, 0.608 vs. 0.492, 0.716, 0.602)で解答エントロピーよりも優れており、チェーン信号がチェーンが存在するとき、より信頼性の高い予測器であることが示唆されている。
これは Qwen と GLM に対して強く成り立つが、InternVL3 (n_FP = 17) に対する限界的かつ統計的に信頼できない優位性しか持たない。
300サンプルのVQAv2パイロットは、鎖エントロピー(0.680)がVQAv2の解エントロピー(0.595)を上回っていることを確認する。
より難しい推論タスク (HallusionBench) について、両Qwenモデルは、難しい問題に対する不完全な事前コミットと整合した、適度な信号(約0.64)を示す。
また,非対称なクエリの12~22%が非対称なクエリに影響を与え,62.7%のカバレッジで 71.0% から 93.8% の精度向上を実現した。
関連論文リスト
- Evaluation Awareness Is Not One Capability: Evidence from Open Language Models [1.758143872501506]
安全ベンチマークは、テスト条件の振る舞いがデプロイメントの振る舞いを予測すると仮定する。
これにより、ベンチマークパフォーマンスとデプロイメントの動作のギャップが開ける。
我々は、37のオープンウェイトモデルと7つのファミリーにわたる8つの実験を通して、この評価意識を特徴づける。
論文 参考訳(メタデータ) (2026-06-22T16:48:43Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation [1.8345614451086532]
RLHF 対応言語モデルは TruthfulQA 上で応答均質化を示す。
40-79%の質問は、10のi.i.d.サンプルに対して単一のセマンティッククラスタを生成する。
論文 参考訳(メタデータ) (2026-03-25T09:35:15Z) - Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption [0.0]
エッジデプロイメントのための大規模視覚言語モデルの迅速な圧縮は、未解決の問題を引き起こす: コンパクトモデルは、単に頻繁にではなく、異なるフェールするのだろうか?
本研究では, VQAv2 および COCO キャプションから 4,000 個のサンプルに対して, 7-ビリオンパラメータ定量 VLM (Qwen2.5-VL-7B, 4-bit NF4) と500 万パラメータFP16モデル (SmolVLM2-500M) を比較した。
平均トークン確率を用いて3カテゴリーの誤り分類法(対象盲点, セマンティックドリフト, 先行バイアス)を診断の枠組みとして適用し, 信頼度校正を期待誤差(ECE)を用いて測定する。
論文 参考訳(メタデータ) (2026-03-24T10:14:40Z) - Entropy trajectory shape predicts LLM reasoning reliability: A diagnostic study of uncertainty dynamics in chain-of-thought [0.0]
本研究は,ステップごとの解答完了をサンプリングし,正当性を予測することによって,推論ステップ間の不確実性のダイナミクスの形状を把握できるかどうかを考察する。
エントロピー-軌道単調性(Entropy-trajectory monotonicity)を導入する。
論文 参考訳(メタデータ) (2026-03-19T14:17:16Z) - Quantile Advantage Estimation for Entropy-Safe Reasoning [44.192277495613695]
RLVRによる強化学習はLLM推論を強化するが、エントロピー崩壊とエントロピー爆発の間のトレーニングはしばしば振動する
いずれのハザードも値のないRLで使われる平均ベースラインに辿り着くが、これは不適切に報酬のアウトリージの下で負のアドバンテージサンプルをペナルティ化する。
本稿では,平均値をグループ単位のK量子基底線に置き換えた量子アドバンテージ推定(QAE)を提案する。
論文 参考訳(メタデータ) (2025-09-26T17:37:52Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Faithful Chain-of-Thought Reasoning [51.21714389639417]
CoT(Chain-of-Thought)は言語モデル(LM)のパフォーマンスを様々な推論タスクで向上させる。
翻訳と問題解決という2つの段階を含む推論フレームワークであるFithful CoTを提案する。
このことは、推論連鎖が最終回答の忠実な説明を提供することを保証している。
論文 参考訳(メタデータ) (2023-01-31T03:04:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。