論文の概要: A Mechanistic Lens on Semantic Conflicts: Using Activation Patching to Understand LLM Behavior
- arxiv url: http://arxiv.org/abs/2607.05587v1
- Date: Mon, 06 Jul 2026 19:35:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.310515
- Title: A Mechanistic Lens on Semantic Conflicts: Using Activation Patching to Understand LLM Behavior
- Title(参考訳): セマンティック・コンフリクトに関するメカニスティック・レンズ--アクティベーション・パッチを用いたLCM動作の理解
- Abstract要約: 本稿では,意味的対立の下での大規模言語モデル(LLM)の振る舞いについて,制御された最初の機械論的研究を示す。
本研究では,2つのタスク(アウトプット予測と単体テスト生成)における4つのオープンウェイトLLMを評価する。
以上の結果から,セマンティックコンフリクトが両タスクの実行地上精度を大幅に低下させることが示唆された。
- 参考スコア(独自算出の注目度): 7.506391522879222
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models (LLMs) are increasingly used in software-engineering tasks processing executable code and non-executable semantic cues such as comments or identifiers. These two sources can conflict when semantic cues suggest different program behavior than the code itself. It remains unclear how such semantic conflicts affect LLM behavior and which source dominates their outputs. We present the first controlled, mechanistic study of LLM behavior under semantic conflicts. To this end, we construct 45 Python snippet triplets that isolate conflicts by varying either semantic cues or implementation while keeping token-aligned pairs for causal intervention. We evaluate four open-weight LLMs on two tasks (output prediction and unit-test generation) using behavioral performance measures and residual-stream activation patching to identify token-layer states that causally contribute to behavioral differences between aligned and conflicting inputs. Our results show that semantic conflicts significantly reduce execution-grounded correctness in both tasks and that all tested LLMs often follow misleading semantic cues. Residual-stream activation patching reveals a consistent pattern for final-output prediction: The changed cue/code region and a small set of intermediate tokens carry most of the recoverable causal signal before aggregation near the output readout. For unit-test generation, this pattern extends beyond the prompt, showing that conflict-related information is recoverable at generated sites before producing expected values. Overall, our findings show that semantic conflicts affect program comprehension and downstream tasks, with relevant information concentrated in a small number of causally active residual-stream states, and demonstrate a framework for mechanistically analyzing how LLMs integrate code-related information under controlled semantic variations.
- Abstract(参考訳): 大規模言語モデル(LLM)は、実行可能なコードやコメントや識別子などの実行不可能なセマンティックキューを処理するソフトウェアエンジニアリングタスクにおいて、ますます使われている。
これら2つのソースは、セマンティックキューがコード自身とは異なるプログラムの振る舞いを示唆する場合に矛盾する可能性がある。
このような意味的対立がLLMの動作にどのように影響し、どのソースが出力を支配しているのかは、まだ不明である。
セマンティック・コンフリクト下でのLLMの挙動について, 制御, 機械的考察を行った。
この目的のために、45個のPythonスニペットトリプルを構築し、因果的介入のためのトークン整列ペアを維持しながら、意味的なキューまたは実装のいずれでも変更することで競合を分離する。
我々は,2つのタスク(アウトプット予測と単体テスト生成)における4つのオープンウェイトLCMを評価し,協調入力と競合入力の動作差に因果的に寄与するトークン層状態を特定する。
以上の結果から,セマンティック・コンフリクトは両タスクの実行対象の正しさを著しく低下させ,全てのテスト済みLLMは誤解を招くようなセマンティック・キューに追従することが多いことが示唆された。
変更されたキュー/コード領域と小さな中間トークンセットは、出力読み出し付近で集約される前に、回復可能な因果信号の大部分を運ぶ。
単体テスト生成では、このパターンはプロンプトを超えて、競合関連情報が期待値を生成する前に生成されたサイトで回復可能であることを示す。
全体として,意味的対立がプログラムの理解や下流のタスクに影響を及ぼし,関連する情報が少数の因果的活動的残差ストリーム状態に集中していることを示し,LLMが制御された意味的変動の下でコード関連情報をどのように統合するかを機械的に解析する枠組みを実証する。
関連論文リスト
- PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs [1.7243216387069673]
大きな言語モデル(LLM)は、しばしば矛盾するプロンプトに遭遇する。
現在のインストラクションは、これらのメタインストラクションを独立した形で評価する。
矛盾する命令が与えられた場合のLCMの挙動を解析するためのフレームワーク textitPRIME を導入する。
論文 参考訳(メタデータ) (2026-06-21T12:30:23Z) - From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - On the Paradoxical Interference between Instruction-Following and Task Solving [50.75960598434753]
次の命令は、大規模言語モデル(LLM)を、タスクの実行方法に関する明示的な制約を指定することで、人間の意図と整合させることを目的としている。
我々は,LLMのタスク解決能力にパラドックス的に干渉する命令に従うという,直感に反する現象を明らかにした。
本稿では,タスク解決に追従する命令の干渉を定量化する指標として,SUSTAINSCOREを提案する。
論文 参考訳(メタデータ) (2026-01-29T17:48:56Z) - ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions [26.40258251641021]
このデータセットは、ユーザインストラクション内の競合を検出し、解決するLarge Language Modelsの機能を評価するためのベンチマークである。
ほとんどのプロプライエタリなLCMは強力なコンフリクト検出能力を持っているが、オープンソースのモデルではDeepSeek-R1のみが同様の強力な性能を示している。
強いコンフリクト検出能力にもかかわらず、LLMは競合する制約に直面したときに、ユーザにコンフリクトや要求の明確化を明示的に通知することは滅多にない。
論文 参考訳(メタデータ) (2025-11-18T10:49:37Z) - Hybrid Fuzzing with LLM-Guided Input Mutation and Semantic Feedback [0.0]
本稿では,静的および動的解析をLarge Language Model(LLM)誘導入力変異と意味フィードバックと統合したハイブリッドファジリングフレームワークを提案する。
本手法は,最先端のファジィよりも高速な時間対第一のバグ,意味的多様性の向上,およびユニークなバグの競合数を実現する。
論文 参考訳(メタデータ) (2025-11-06T02:38:24Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z) - DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models [55.30555646945055]
テキスト・ツー・イメージ(T2I)モデルはセマンティック・リークに対して脆弱である。
DeLeakerは、モデルのアテンションマップに直接介入することで、漏洩を緩和する軽量なアプローチである。
SLIMはセマンティックリークに特化した最初のデータセットである。
論文 参考訳(メタデータ) (2025-10-16T17:39:21Z) - Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing [12.835224376066769]
大きな言語モデル(LLM)は目覚ましい機能を示しているが、そのデプロイメントは望ましくない振る舞いによってしばしば損なわれている。
本稿では,表現とその勾配を解析することによって,望ましくないLCMの挙動を診断する,新しい,効率的なフレームワークを提案する。
本手法は,有害な内容の追跡,バックドア中毒の検出,知識汚染の同定などのタスクに対して,系統的に評価する。
論文 参考訳(メタデータ) (2025-09-26T12:07:47Z) - LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance [54.683384204063934]
大規模マルチモーダルモデル(LMM)は不正確なセグメンテーションと幻覚的理解に苦しむ。
視覚的理解とセグメンテーションの相補的関係を生かしたフレームワークであるLIRAを提案する。
LIRAはセグメンテーションと理解タスクの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-08T07:46:26Z) - Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders [29.356200147371275]
大きな言語モデル(LLM)は人間のクエリを扱うのに優れていますが、時に欠陥や予期せぬ応答を生成することができます。
特徴解釈と相互情報に基づく目的設計のための固定語彙集合を提案する。
そこで本研究では,学習した機能アクティベーションを,対応する説明に基づいて調整する2つの実行時ステアリング戦略を提案する。
論文 参考訳(メタデータ) (2025-02-21T16:36:42Z) - What You See Is Not Always What You Get: An Empirical Study of Code Comprehension by Large Language Models [0.5735035463793009]
ソースコードに隠された文字操作がLLMの動作を誤認し,人間のレビュアーには検出不能なままにしておくという,大きな言語モデル(LLM)の攻撃に対する脆弱性について検討する。
これらの攻撃には、コードリオーダー、見えないコーディング文字、コード削除、コードホモグリフが含まれる。
以上の結果より,LLMは摂動の大きさと性能に異なる負の相関性を示す一方,LLMは認識不能なコードキャラクタ攻撃に対する感受性を示すことが明らかとなった。
論文 参考訳(メタデータ) (2024-12-11T04:52:41Z) - Contrastive Instruction Tuning [61.97704869248903]
意味論的に等価な命令-インスタンスペア間の類似性を最大化するために、コントラスト命令チューニングを提案する。
PromptBenchベンチマークの実験によると、CoINはLLMの頑健さを一貫して改善し、文字、単語、文、意味のレベルを平均して2.5%の精度で変化させる。
論文 参考訳(メタデータ) (2024-02-17T00:09:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。