論文の概要: They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It
- arxiv url: http://arxiv.org/abs/2607.03598v1
- Date: Fri, 03 Jul 2026 20:49:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.664069
- Title: They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It
- Title(参考訳): 意味を推測する:モデルは、その上で行動するよりも信頼性が高い
- Abstract要約: 我々は、送信者の意図をデコードする言語モデルの失敗は、ロバストな表現の上にある読み出しの1つであることを示す。
線形プローブは、6つのモデルと4つのファミリー、およびベースチェックポイントで、送信者の意図を認識または評価したいかどうかを復号する。
ストーリーの行動的半分は、デフォルトの出力が意図に作用するかどうかが異なるという認識/評価のコントラストに基づいている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a person shares something with a language model, the model often answers the surface of the message rather than what the sender was doing by sending it: share a finished project and it critiques the code; share a raw late-night line and it runs a wellness check. We treat the sender's communicative intent, the Gricean what-was-meant, as a first-class interpretability object, and show the failure is one of readout on top of a robust representation. A linear probe decodes the sender's intent, whether they want a thing recognized or evaluated, from a model's default-pass hidden states, cleanly and surface-independently, across six models and four families and in the base checkpoints. The representation generalizes further, to intent that is only pragmatically inferred, and to a second, lexically clean intent (support versus help). The behavioral half of the story, and every causal test, is established on the recognize/evaluate contrast, where what varies is whether the default output acts on the intent. The readout lags the representation in depth within a model (the intent is decodable several layers before it drives the output); across models, which ones act on it by default is model-specific, an observed stratification (three of six show the failure) that we do not read as a scaling law. Where the gap is open, a direction closely tied to the representation, the discriminative direction at a searched-for layer, is a causal handle: steering it recovers the intended behavior, as well as an explicit instruction does and with no prompt at all. This direction is near-orthogonal to the feedback-offering axis, so it routes a represented intent rather than a generic feedback knob, though at the recovery dose the routed intent can override an explicit request. We support each link with controls against obvious deflations and report the nulls as plainly as the confirmations.
- Abstract(参考訳): ある人が言語モデルと何かを共有するとき、そのモデルは送信者が何をしているかではなく、メッセージの表面に答える: 完了したプロジェクトを共有し、コードを批判し、生の深夜行を共有し、ウェルネスチェックを実行する。
我々は、送信者のコミュニケーション意図であるGricean what-was-meantを第一級の解釈可能性オブジェクトとして扱い、その障害が堅牢な表現の上の読み出しであることを示す。
線形プローブは、6つのモデルと4つのファミリー、およびベースチェックポイントで、モデルのデフォルトパス隠蔽状態から、認識または評価したいものであっても、送信者の意図をクリーンかつ表面独立にデコードする。
表現はさらに一般化し、実用的に推論されるだけで、第二に、語彙的にクリーンな意図(サポート対ヘルプ)に一般化される。
ストーリーの振る舞いの半分と、すべての因果テストは、デフォルトの出力が意図に作用するかどうかが異なる、認識/評価のコントラストに基づいて設定されます。
インテントはアウトプットを駆動する前に複数のレイヤをデオードできる)モデル内の表現を遅延させる。デフォルトでそれを動作させるモデルはモデル固有であり、観察された成層化(6つのうち3つが障害を示す)はスケーリング法則として読まれない。
ギャップが開いている場合、その表現と密接に結びついている方向、探索対象層の識別方向は因果ハンドルである。
この方向はフィードバックオフリング軸にほぼ直交するので、一般的なフィードバックノブではなく、表現されたインテントをルーティングするが、リカバリド時にはルートされたインテントが明示的な要求をオーバーライドすることができる。
明確なデフレに対するコントロールで各リンクをサポートします。
関連論文リスト
- SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks [69.08780911753102]
マルチターンジェイルブレイクはターン間で有害なインテントを前進させることでパターンを利用するため、単一のメッセージが完全な目的を公開することはない。
敵意構造を用いて多ターンジェイルブレイクを組織する4部構成の意図指向分類法を開発した。
論文 参考訳(メタデータ) (2026-08-02T09:24:08Z) - Implicit Reasoning Steering via Concept Chaining [29.121206944212556]
自然言語のテキストを使って、明示的な指示やトリガー、直接回答の手がかりを使わずに、指定された回答に向けてモデルをバイアスする。
間接的な自然なテキストは、直接のパラフレーズよりも推論がかなり少ないまま、体系的にモデル予測を操ることができることを示す。
論文 参考訳(メタデータ) (2026-07-15T18:03:08Z) - Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs [41.451167369762544]
Representation-Action Gap: 隠された状態が前提認識ミスマッチを確実にエンコードする。
振る舞い的には、モデルはアンダーリジェクションとオーバーリジェクションの2つの障害モードに分類される。
初期診断介入として、プローブ誘導ロジット調整は、符号化されたミスマッチ信号を再注入して復号する。
論文 参考訳(メタデータ) (2026-05-13T16:14:44Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails [0.0]
自然実験として、中国語・オリジン語モデルにおける政治的検閲について研究する。
5つの実験室の9つのオープンウェイトモデルに対して、プローブ、外科的改善、行動テストを使用します。
論文 参考訳(メタデータ) (2026-03-18T20:54:34Z) - CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference Understanding [56.30142869506262]
身体的参照理解(Embodied Reference Understanding)は、シーンの人物が指し示すジェスチャーと言語の両方を通して参照しているオブジェクトを予測する。
本稿では,2重モデルフレームワークを提案し,一方のモデルが頭指先方向から学習し,他方のモデルが手指先方向から学習する。
我々は、ベンチマークYouRefItデータセットの広範な実験と分析を通じてアプローチを検証し、0.25IoU閾値で約4mAPの改善を実現した。
論文 参考訳(メタデータ) (2025-07-29T15:00:21Z) - BURN: Backdoor Unlearning via Adversarial Boundary Analysis [73.14147934175604]
Backdoor Unlearningは、モデル本来の機能を保持しながら、バックドア関連の情報を削除することを目的としている。
本稿では, 偽相関疎結合, プログレッシブデータリファインメント, モデル浄化を統合した新しい防御フレームワーク, BURNによるバックドア・アンラーニングを提案する。
論文 参考訳(メタデータ) (2025-07-14T17:13:06Z) - The Geometry of Self-Verification in a Task-Specific Reasoning Model [45.669264589017665]
我々はCountDownタスクでDeepSeek R1のレシピを使ってモデルをトレーニングする。
モデルがどのように出力を検証するかをリバースエンジニアリングするために、トップダウンおよびボトムアップの分析を行います。
論文 参考訳(メタデータ) (2025-04-19T18:40:51Z) - Exploring the Individuality and Collectivity of Intents behind Interactions for Graph Collaborative Filtering [9.740376003100437]
本稿では,BIGCF (Bilateral Intent-Guided Graph Collaborative Filtering) に指定された新しい推薦フレームワークを提案する。
具体的には、因果的視点からユーザとイテムの相互作用を詳しく調べ、個別の意図の概念を提示する。
暗黙的なフィードバックの空間性に対抗するため、ユーザとアイテムの特徴分布はガウスベースのグラフ生成戦略を介して符号化される。
論文 参考訳(メタデータ) (2024-05-15T02:31:26Z) - What Are You Token About? Dense Retrieval as Distributions Over the
Vocabulary [68.77983831618685]
本稿では,2つのエンコーダが生成するベクトル表現を,モデルの語彙空間に投影することで解釈する。
得られたプロジェクションは、リッチな意味情報を含み、それらの間の接続を描画し、スパース検索を行う。
論文 参考訳(メタデータ) (2022-12-20T16:03:25Z) - Contrastive Explanations for Model Interpretability [77.92370750072831]
分類モデルの対照的説明を生成する手法を提案する。
本手法は潜在空間へのモデル表現の投影に基づいている。
本研究は,モデル決定のより正確できめ細かな解釈性を提供するためのラベルコントラスト的説明の能力に光を当てた。
論文 参考訳(メタデータ) (2021-03-02T00:36:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。