論文の概要: Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
- arxiv url: http://arxiv.org/abs/2607.28478v1
- Date: Thu, 30 Jul 2026 16:30:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.661769
- Title: Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
- Title(参考訳): 車の洗車場まで歩けるか?Commonsense Reasoningにおける大規模言語モデルのサリエンスバイアス
- Abstract要約: モデルが無用な明示的な邪魔者によって簡単にハイジャックされることを示し、タスクの暗黙的な物理的あるいは常識的な前提を無視します。
重要なオープンな疑問は、この失敗がコモンセンス知識の真のギャップを反映しているか、それとも誤解を招くタスクフレーミングの下で単にその抑制を反映しているかである。
この結果から,モデル能力から導入までのコモンセンス推論失敗のボトルネックが解消され,この盲点に対するテストベッドとしてSaliTrapがリリースされた。
- 参考スコア(独自算出の注目度): 19.177595059532557
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As large language models (LLMs) continue to advance in complex reasoning tasks, they have learned to heavily prioritize explicit conditions provided in the input. However, in everyday commonsense reasoning, this mechanism exposes a critical vulnerability which we term Salience Bias: models become easily hijacked by useless explicit distractors (e.g., numerical values), leading them to ignore the implicit physical or commonsense prerequisites of a task. A critical open question is whether this failure reflects a genuine gap in commonsense knowledge or merely its suppression under misleading task framing. To investigate this, we construct the SaliTrap Benchmark, a high-quality dataset across four trap dimensions. Evaluating 12 state-of-the-art LLMs, we find that all mainstream models suffer significantly from salience bias, with severity scaling with distractor density and detecting the trap often decoupled from actually avoiding it. Crucially, by re-eliciting the same models with the task framing stripped away, we show that this is overwhelmingly a failure of \textbf{knowledge suppression rather than knowledge absence}: a context-free knowledge probe alone recovers over 90\% of sycophantic-compliance failures, revealing that the requisite commonsense is intrinsically present but actively crowded out by salient distractors that lure the model into over-compliant, unnecessary computation. Building on this diagnosis, we further show that lightweight, inference-time prompting alone substantially closes the gap without any retraining. Our findings relocate the bottleneck of commonsense reasoning failures from model competence to elicitation, and we release SaliTrap as a testbed for this blind spot. The codes are available at https://github.com/Wuzheng02/SaliTrap.
- Abstract(参考訳): 大規模言語モデル (LLM) が複雑な推論タスクに進化し続けるにつれて、彼らは入力で提供される明示的な条件を強く優先することを学びました。
しかし、日常的なコモンセンス推論では、このメカニズムはSalience Bias(サリエンスバイアス)と呼ばれる重要な脆弱性を露呈する。
重要なオープンな疑問は、この失敗がコモンセンス知識の真のギャップを反映しているか、それとも誤解を招くタスクフレーミングの下で単にその抑制を反映しているかである。
そこで我々は,4つのトラップ次元にまたがる高品質なデータセットであるSaliTrap Benchmarkを構築した。
現状のLLMを12種類評価すると,全ての主流モデルがサリエンスバイアスに大きく悩まされていることが判明した。
文脈自由知識プローブだけでは、90 %以上のサイコファンティックコンプライアンス障害を回復し、必須のコモンセンスが本質的に存在するが、過度に準拠し、不要な計算へと誘惑する有能な散逸によって積極的に混雑していることを明らかにする。
この診断に基づいて、軽量な推論時間のみのプロンプトが、再トレーニングを伴わずに、ギャップを実質的に閉じていることが示される。
この結果から,モデル能力から導入までのコモンセンス推論失敗のボトルネックを解消し,この盲点に対するテストベッドとしてSaliTrapをリリースする。
コードはhttps://github.com/Wuzheng02/SaliTrap.comで入手できる。
関連論文リスト
- Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning [109.33717747526583]
大規模言語モデルは、計算コストが高くても意味論的に無効な推論を、能力を超えたタスクで生成する。
textbfCaRL(textbfCapability-textbfaligned textbfReinforcement textbfL)を導入し、振る舞いを機能境界に合わせる。
実験は、タスクの難易度を超えて性能を保ちながら、無駄な推論を大幅に削減することを示した。
論文 参考訳(メタデータ) (2026-07-31T09:30:33Z) - Unveiling the Visual Counting Bottleneck in Vision-Language Models [49.591496870141846]
この研究は視覚的数え上げを3つの認知段階(視覚的識別、大きさ認識、象徴的マッピング)に分解する。
合成Go基板と線形プローブを用いて、視覚的バックボーンは、外挿系にしっかりと、線形に分離可能な量表現を保っていることを示す。
我々は、崩壊をシンボルマッピングステージに向ける。そこでは、モデルがシンボルトークンに有効な視覚的大きさを投影することに失敗する。
論文 参考訳(メタデータ) (2026-05-28T16:20:29Z) - Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination [25.643533134113607]
我々はロジットレンズを用いて注意機構を解析し、Vocabulary Hijacking(語彙ハイジャック)という別個の異常を明らかにする。
本研究では,ハイジャック・アウェア・ビジュアル・アテンション・エンハンスメント(HAVAE, Hijacking-Aware Visual Attention Enhancement)を提案する。
論文 参考訳(メタデータ) (2026-05-11T14:16:25Z) - Bridging the Know-Act Gap via Task-Level Autoregressive Reasoning [22.264933226031435]
我々は,新たに構築された大規模・学際横断的な問題ベンチマークであるFactyScienceを用いて,包括的解析を行った。
このギャップは,タスク選択とコンテンツ生成を結びつけるトークンレベルの自己回帰に起因していることを示す。
この決定を明示的にモデル化したタスクレベルの自動回帰フレームワークであるDeIllusionLLMを提案する。
論文 参考訳(メタデータ) (2026-03-23T22:43:34Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning [16.274791437311602]
本稿では,ロボット故障検出と推論のための適応ラウンドベースマルチタスクmOdelについて紹介する。
マルチタスク・セルフリファインメント・プロセスとして検出と推論を定式化する。
ARMORは,従来の手法を最大30%の故障検出率で改善し,最先端の性能を実現していることを示す。
論文 参考訳(メタデータ) (2026-02-12T20:55:36Z) - Lost in the Noise: How Reasoning Models Fail with Contextual Distractors [57.31788955167306]
推論モデルとエージェントAIシステムの最近の進歩は、多様な外部情報への依存度を高めている。
NoisyBenchは、RAGの11のデータセット、推論、アライメント、ツール使用タスクに対して、モデルロバスト性を体系的に評価する包括的なベンチマークである。
評価の結果,文脈的障害に直面した場合,最先端モデルでは最大80%の破滅的な性能低下がみられた。
論文 参考訳(メタデータ) (2026-01-12T05:43:51Z) - Backdoor Unlearning by Linear Task Decomposition [69.91984435094157]
ファンデーションモデルは、敵の摂動と標的のバックドア攻撃に非常に敏感である。
既存のバックドア除去アプローチは、有害な振る舞いをオーバーライドするために、コストのかかる微調整に依存している。
このことは、バックドアがモデルの一般的な能力を損なうことなく取り除けるかどうかという問題を提起する。
論文 参考訳(メタデータ) (2025-10-16T16:18:07Z) - Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models [7.18947815679122]
内部状態探索と整合検証は、大きな言語モデルにおける幻覚を検出するために用いられる。
両手法のギャップを埋める統一的なフレームワークを開発する。
私たちのフレームワークは一貫して、強力なベースラインをはるかに上回ります。
論文 参考訳(メタデータ) (2025-10-13T15:31:21Z) - Uncertainty-Aware Attention Heads: Efficient Unsupervised Uncertainty Quantification for LLMs [129.79394562739705]
大型言語モデル(LLM)は、顕著な流布を示すが、しばしば「幻覚」として知られる致命的な誤りを引き起こす。
本稿では,非教師的アプローチであるRAUQ(Recurrent Attention-based Uncertainty Quantification)を提案する。
4つのLLMと12の質問応答、要約、翻訳タスクにわたる実験は、RAUQが優れた結果をもたらすことを示した。
論文 参考訳(メタデータ) (2025-05-26T14:28:37Z) - Interpreting the Repeated Token Phenomenon in Large Language Models [31.1226642501095]
大きな言語モデル (LLM) は、引き起こされた時に1つの単語を正確に繰り返すことができず、代わりに無関係なテキストを出力する。
「この現象の原因を説明し、注意流しの概念と結びつけよう。」
我々の研究は、注意シンクの原因となる神経回路を特定し、この回路がどれくらいの時間繰り返しで破壊されるかを示す。
論文 参考訳(メタデータ) (2025-03-11T21:40:58Z) - From Chaos to Clarity: Claim Normalization to Empower Fact-Checking [57.024192702939736]
Claim Normalization(別名 ClaimNorm)は、複雑でノイズの多いソーシャルメディア投稿を、より単純で分かりやすい形式に分解することを目的としている。
本稿では,チェーン・オブ・ソートとクレーム・チェック・バシネス推定を利用した先駆的アプローチであるCACNを提案する。
実験により, CACNは様々な評価尺度において, いくつかの基準値を上回る性能を示した。
論文 参考訳(メタデータ) (2023-10-22T16:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。