論文の概要: StateSwap: Probing Support-Elimination Hidden States in Multiple-Choice Questions
- arxiv url: http://arxiv.org/abs/2609.01081v2
- Date: Mon, 07 Sep 2026 09:46:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.336485
- Title: StateSwap: Probing Support-Elimination Hidden States in Multiple-Choice Questions
- Title(参考訳): StateSwap: 複数項目の質問に隠れたサポート除去状態の探索
- Authors: Chao Gao, Haijiang Liu, Qiyuan Li, Caicai Guo, Frank van Harmelen, Jinguang Gu,
- Abstract要約: 2つのフレーミングによって引き起こされる異なる内部表現から相違が生じているかどうかを検討する。
最小限に異なるプロンプトを持つデュアルフレーミングプロトコルを導入する。
2つのフレーミングは中間層に集中して分離可能な[STATE]活性化を誘導する。
- 参考スコア(独自算出の注目度): 22.173138594307662
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models often answer the same multiple-choice question inconsistently when it is posed under support-oriented and elimination-oriented framings. We investigate whether these discrepancies arise from different internal representations induced by the two framings. We introduce a dual-framing protocol with minimally varied prompts that use either support- or elimination-oriented framing while keeping the evaluation target fixed. To probe the internal computation, we append an untrained special token, [STATE], and treat its residual-stream activation as an intervention interface. Across both models, the two framings induce separable [STATE] activations concentrated in intermediate layers. Swapping these activations between paired prompts systematically changes predictions and improves cross-framing agreement, providing intervention-based evidence that the activations are behaviorally relevant. Beyond instance-level substitution, mean-difference steering directions derived from the dual-framing contrast exhibit more bounded layer-wise responses than matched contrastive activation addition directions under the evaluated protocol.
- Abstract(参考訳): 大規模言語モデルは、サポート指向のフレーミングと削除指向のフレーミングの下で提案された場合、同じ複数選択の質問に答えることが多い。
2つのフレーミングによって引き起こされる異なる内部表現からこれらの相違が生じるかを検討する。
評価対象を固定したまま、サポートまたは削除指向のフレーミングを使用する最小限のプロンプトを持つデュアルフレーミングプロトコルを導入する。
内部計算を探索するために、訓練されていない特別なトークン[STATE]を付加し、その残ストリーム活性化を介入インターフェースとして扱う。
どちらのモデルでも、2つのフレーミングは中間層に集中して分離可能な[STATE]活性化を誘導する。
これらのアクティベーションをペア間でスワップすることで、予測を体系的に変更し、クロスフレーミング合意を改善し、アクティベーションが行動に関連があるという介入に基づく証拠を提供する。
インスタンスレベルの置換以外にも、二重フレーミングコントラストから導かれる平均差の操舵方向は、評価されたプロトコルの下でのコントラッシブなアクティベーション加算方向との一致よりも、より有界な層ワイド応答を示す。
関連論文リスト
- Action-Aligned Retrieval with Pairwise Multimodal Reranking for Text-Based Person Anomaly Search [10.617164505348283]
テキストに基づく人物異常検索は、見た目よりもよりきめ細かな、文脈に依存した行動に基づいて個人を識別する必要がある。
既存のメソッドは、これらのコンテキスト条件のアクションをキャプチャするのに苦労する。
本稿では,アクション整合検索とペアワイズ・マルチモーダル・リグレードを組み合わせた3段階間粗大化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-24T17:04:34Z) - Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration [13.299987551113809]
グループ認知学習(グループ認知学習、Group Cognition Learning、GCL)は、モダリティ固有の符号化の後に2段階のプロトコルを適用する、管理された協調パラダイムである。
GCLはモダリティの優位性と結合を緩和し、回帰ベンチマークと分類ベンチマークの両方で最先端の結果を確立する。
論文 参考訳(メタデータ) (2026-05-01T03:19:34Z) - Feature-level Interaction Explanations in Multimodal Transformers [1.7101146971136896]
マルチモーダルトランスフォーマーは、異なるモーダルが共同で意思決定をどのように支援するかを明確にすることなく、予測を生成する。
本稿では,凍結した事前学習エンコーダからトークン/パッチシーケンスを直接操作する構造化Mixture-of-Experts層であるFeature-level I2MoEを提案する。
我々は,帰属とトップK%マスキングを組み合わせ,忠実度を評価する専門的な説明パイプラインを開発する。
論文 参考訳(メタデータ) (2026-03-04T18:24:31Z) - DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models [55.30555646945055]
テキスト・ツー・イメージ(T2I)モデルはセマンティック・リークに対して脆弱である。
DeLeakerは、モデルのアテンションマップに直接介入することで、漏洩を緩和する軽量なアプローチである。
SLIMはセマンティックリークに特化した最初のデータセットである。
論文 参考訳(メタデータ) (2025-10-16T17:39:21Z) - Two in One Go: Single-stage Emotion Recognition with Decoupled Subject-context Transformer [78.35816158511523]
単段階の感情認識手法として,DSCT(Decoupled Subject-Context Transformer)を用いる。
広範に使われている文脈認識型感情認識データセットであるCAER-SとEMOTICの単段階フレームワークの評価を行った。
論文 参考訳(メタデータ) (2024-04-26T07:30:32Z) - Fine-grained Temporal Contrastive Learning for Weakly-supervised
Temporal Action Localization [87.47977407022492]
本稿では,シーケンス・ツー・シーケンスの区別を文脈的に比較することで学習が,弱い教師付き行動の局所化に不可欠な帰納的バイアスをもたらすことを論じる。
微分可能な動的プログラミングの定式化の下では、FSD(Fen-fine Sequence Distance)とLCS(Longest Common Subsequence)の2つの相補的コントラストが設計されている。
提案手法は,2つのベンチマークにおいて最先端の性能を実現する。
論文 参考訳(メタデータ) (2022-03-31T05:13:50Z) - Weakly-Supervised Spatio-Temporal Anomaly Detection in Surveillance
Video [128.41392860714635]
Weakly-Supervised Snoma-Temporally Detection (WSSTAD) を監視ビデオに導入する。
WSSTADは異常事象を封止する時空間管(すなわち連続する境界ボックスのシーケンス)をローカライズすることを目的としている。
本稿では,空間的・時間的領域に複数粒度を持つ入力提案を行うデュアルブランチネットワークを提案する。
論文 参考訳(メタデータ) (2021-08-09T06:11:14Z) - TTAN: Two-Stage Temporal Alignment Network for Few-shot Action
Recognition [29.95184808021684]
少数のサンプル(支援)を用いた新規なアクションクラス(クエリ)の認識を目的としたアクション認識
我々は,サポートサンプル間のミスアライメントを考慮に入れた,新しいマルチショットフュージョン戦略を考案した。
ベンチマークデータセットを用いた実験では,数発のアクション認識のための最先端性能を実現する上で,提案手法の可能性を示した。
論文 参考訳(メタデータ) (2021-07-10T07:22:49Z) - Context-Aware Interaction Network for Question Matching [51.76812857301819]
本研究では,二つのシーケンスを整合させ,それらの意味関係を推定する文脈認識インタラクションネットワーク(coin)を提案する。
具体的には,(1)コンテキスト情報を効果的に統合するためのコンテキスト対応のクロスアテンション機構,(2)整列表現を柔軟に補間するゲート融合層を備える。
論文 参考訳(メタデータ) (2021-04-17T05:03:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。