論文の概要: Decomposition of Evidence, Contradiction, and Fragility in Perturbation Responses
- arxiv url: http://arxiv.org/abs/2608.12935v1
- Date: Thu, 13 Aug 2026 08:13:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.438496
- Title: Decomposition of Evidence, Contradiction, and Fragility in Perturbation Responses
- Title(参考訳): 摂動応答におけるエビデンス, コントラディション, フラクティリティの分解
- Authors: Lei You,
- Abstract要約: 我々は, 一致, 反対, 終端無効応答をエビデンスE, 矛盾C, FにルートするDECAFを紹介する。
分解は通常の等級、 Abs = E + C + F を正確に保存し、終端相対公理の下で一意である。
明らかな経路だけを変えることで、全体のレスポンスが80%近く増加するが、脆弱性が4倍以上に増加する一方で、証拠はほとんど変化しない。
- 参考スコア(独自算出の注目度): 1.1162481475388237
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Perturbation methods explain model decisions by measuring prediction changes under altered inputs, but response magnitude tells us only how much a model reacts, not what that reaction means. The same magnitude can support the final factual-counterfactual difference, oppose it, or arise strongly along the perturbation path yet vanish at the endpoint. We therefore track how the contrast develops as paired inputs are progressively revealed, using the final contrast to interpret the trajectory. We introduce DECAF (Decomposition of Evidence, Contradiction, And Fragility), which routes aligned, opposed, and endpoint-null responses into evidence E, contradiction C, and fragility F. The decomposition preserves ordinary magnitude exactly, Abs = E + C + F, and is unique under endpoint-relative axioms. Across controlled vision and tabular settings, the three components track independently measured behavior. In a 72-model ImageNet-9 audit, we compare cases with nearly identical response magnitude but different independently measured behaviors. The largest DECAF component agrees with an observed behavior in 96.4% of cases, compared with 35.0% for magnitude alone. Changing only the reveal path increases total response by nearly 80%, yet evidence barely changes while fragility grows by more than 4x. On FunnyBirds and ImageNet-1k, short forward-only DECAF trajectories outperform the tested general-purpose attribution baselines. On a 1B-scale DINOv2 model, a short trajectory matches a strong gradient-based baseline with 4.75x lower wall time and 2.36x lower peak memory.
- Abstract(参考訳): 摂動法は、変化した入力の下での予測変化を測定することによってモデル決定を説明するが、反応の大きさは、その反応の意味ではなく、モデルがどれだけ反応するかだけを教えてくれる。
同じ大きさは、最終的な事実と事実の差を支持したり、それに反対したり、あるいは終点でまだ消えていない摂動経路に沿って強く発生する。
したがって、最終的なコントラストを用いて、ペア入力が徐々に明らかにされるにつれて、コントラストがどのように発達するかをトラックする。
我々はDECAF(Decomposition of Evidence, Contradiction, And Fragility)を導入し, 整列, 反対, 終端ヌル応答をエビデンスE, 矛盾C, 脆弱Fへとルートする。
コントロールされた視覚と表の設定で、3つのコンポーネントは独立して測定された振る舞いを追跡する。
72モデルのImageNet-9オーディションでは、ほぼ同一の応答大きさのケースと比較するが、独立に測定された振る舞いが異なる。
最大のDECAF成分は96.4%のケースで観察された行動と一致している。
明らかな経路だけを変えることで、全体のレスポンスが80%近く増加するが、脆弱性が4倍以上に増加する一方で、証拠はほとんど変化しない。
FunnyBirdsとImageNet-1kでは、短い前方のみのDECAF軌道が試験された汎用属性ベースラインを上回っている。
1BスケールのDINOv2モデルでは、短い軌道は強い勾配ベースのベースラインと4.75倍低い壁時間と2.36倍低いピークメモリに一致する。
関連論文リスト
- Orientation, not magnitude: the causal structure of task-vector interference in merged language models [0.0]
タスク算術はそうでなければ機能し、フィールドはマグニチュードで原因を診断する。
層状フラックスの正確な分解は、既存の断続輸送の増幅によって支配されていることを示している。
ナイーブのbfloat16生成の「ユニバーサリティ」は、量子化粗さであることが判明した。
論文 参考訳(メタデータ) (2026-08-12T08:40:24Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Robust for the Wrong Reasons: The Representational Geometry of LLM Robustness to Science Skepticism [3.993449663756884]
大規模言語モデル (LLMs) は、競合する科学的問題に対してますます議論されている。
同じ懐疑的な圧力下での3つの異なるポリシーを示すモデルを示す。
我々はこれらを、偶発的堅牢性からアクティブに分離した4方向の分類に合成する。
論文 参考訳(メタデータ) (2026-07-02T09:40:52Z) - Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement [4.226475360842309]
大規模言語モデル(LLM)は、実行中に同じ決定問題に対して異なる回答を与え、自身の事前回答がコンテキストとして返されるときにその決定を覆す。
モデル重みを変化させることなく、この不安定性を測定・部分的に低減できるかどうかを問う。
我々は,プロンプトレベルの状態強化層であるCognitive Kernel Model (CKM)をテストする。
論文 参考訳(メタデータ) (2026-06-05T12:36:36Z) - Disagreement-Based Cross-Model Routing for Implicit Video Question Answering [0.0]
我々はImplicitQAベンチマークを用いて,複数選択のビデオ質問応答について検討した。
このベンチマークでは、単一のフロンティアビデオLLMが、その精度の天井付近ですでに動作している。
ラベルやトレーニングを必要とせず、純粋な推論時間である、不一致に基づくクロスモデルルーティングを提案する。
論文 参考訳(メタデータ) (2026-05-31T05:56:27Z) - One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness [12.183451602438753]
単純な語彙制約(句読解文字または共通単語の禁止)により、命令調整されたLLMが応答を崩壊させることを示す。
ベースモデルでは,同じ制約の下で,小さな,騒々しい,双方向的な効果を伴って,体系的な崩壊を示さないことを示す。
論文 参考訳(メタデータ) (2026-04-14T17:40:01Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - What's the Harm? Sharp Bounds on the Fraction Negatively Affected by
Treatment [58.442274475425144]
我々は,これらの関数がどの程度の速さで学習されたかに関わらず,効率の良い頑健な推論アルゴリズムを開発した。
シミュレーション研究および失業者のキャリアカウンセリングのケーススタディにおいて,本手法を実証する。
論文 参考訳(メタデータ) (2022-05-20T17:36:33Z) - An Analysis of the Adaptation Speed of Causal Models [80.77896315374747]
最近、Bengioらは、すべての候補モデルの中で、$G$は、あるデータセットから別のデータセットに適応する最速のモデルであると推測した。
最適化からの収束率を用いた原因影響SCMの適応速度について検討する。
驚くべきことに、私たちは反因果モデルが有利である状況を見つけ、初期仮説を偽造する。
論文 参考訳(メタデータ) (2020-05-18T23:48:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。