論文の概要: Belief-reality separation lives in routing over a shared value slot in language models
- arxiv url: http://arxiv.org/abs/2607.11945v1
- Date: Sat, 11 Jul 2026 10:39:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.890342
- Title: Belief-reality separation lives in routing over a shared value slot in language models
- Title(参考訳): 言語モデルにおける共有値スロット上のルーティングにおける信念と現実の分離
- Abstract要約: キャパブル言語モデルは、文字が真実と違うと信じるものを保持します。
分離可能な2つのメカニズムを2つの位置で示す。
- 参考スコア(独自算出の注目度): 6.0397270384735355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Capable language models hold what a character believes apart from what is true: told "Anna believes the cup is blue; in reality it is red," they answer blue about Anna and red about the world. Where in the computation does that separation live? We show it rests on two separable mechanisms at two positions. A generic value slot binds the attributed value. A router at the query position selects which frame, the character's belief or reality, a query reads out. Two routes fill the slot: an asserted belief, whose value the text supplies, binds in directly; a derived belief, whose value must be inferred from what the character could see, arrives by a visibility-gated lookback. A subspace trained on either route steers the other, and only the derived route depends on described visibility. The slot itself carries no belief-reality tag: intervening on it moves a reality readout as strongly as a belief one. The separation lives instead in a dissociated pair of routing subspaces, which flip a query between frames without injecting the donor's value. These results hold across three architectures, on stimuli de-confounded against theory-of-mind-benchmark shortcuts; the behavior itself emerges between 3B and 7B across five model families. This paper develops the single belief-reality axis in depth; a companion paper shows the same slot-and-router format is shared across the other non-actual contexts a sentence can open (counterfactual, fictional, temporal).
- Abstract(参考訳): キャパブル・ランゲージ・モデルはキャラクターが真実とは別物であると信じているものを保持しており、「アナはカップが青だと信じている。
計算のどこにその分離があるのか?
分離可能な2つのメカニズムを2つの位置で示す。
ジェネリック値スロットが属性値にバインドする。
クエリ位置のルータは、どのフレーム、キャラクタの信念または現実を選択し、クエリが読み出す。
二つの経路はスロットを埋める: 主張された信念(テキストが供給する価値)は直接結合する; 派生された信念(キャラクターが見たものから価値を推測しなければならない)は、可視性のある見返りによって現れる。
どちらかのルートで訓練されたサブスペースが他方を操縦し、派生したルートのみが記述された可視性に依存する。
スロット自体には信念と現実のタグがない。
分離は、代わりに、ドナーの値を注入することなくフレーム間のクエリを反転させる2つのルーティングサブスペースに格納される。
これらの結果は、3つのアーキテクチャにまたがって成り立ち、5つのモデルファミリーにまたがって3Bから7Bの間に行動自体が出現する。
共用紙は、文が開きうる他の非現実的文脈(事実的、フィクション的、時間的)間で同じスロット・アンド・ルーター形式が共有されていることを示す。
関連論文リスト
- Contrastive Projection: Reading Transformer Internals by Differencing Logit Lenses [0.0]
トレーニング不要のトレーサを使用して、すべての位置、サブレイヤ、ヘッド平均を読みます。
Phi-2の化合物-名詞->アテンション鎖を辿り、活性化パッチによって確認される。
現実と架空のエンティティの検索サーフェスを読み、ドメイン間マッピングの集合としてメタファーを読みます。
論文 参考訳(メタデータ) (2026-09-09T09:01:09Z) - How to Build Marcus's Algebraic Mind: From Minsky's Emotion-Machine Viewpoint [18.56157183294801]
The Algebraic Mind』において、マーカスは3つの認知的要素を特定した。
この問題を、GF(2) XOR-and-shift上に構築されたアーキテクチャであるVaCoAlで解決する。
衝突回避スキームはフロンティアサイズ内で正確な回復を保証する。
論文 参考訳(メタデータ) (2026-07-18T03:48:00Z) - One mechanism for many mental spaces: a shared router over a value slot in language models [6.0397270384735355]
言語は、実際のもの以外の言論コンテキストを構築します。
形式的意味論はこれらの文脈を区別する。
いずれのトランスフォーマー言語モデルが実装するかを問うとともに、Fauconnierの統一のメカニスティックバージョンを見つける。
論文 参考訳(メタデータ) (2026-07-11T10:30:36Z) - Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure [5.717981279944186]
我々は、視覚的状態依存、状態信念の画素、構造または先行への帰属を定式化する。
310の実際のWeb、モバイル、デスクトッププローブ上でのシングルチャネルの介入と組み合わせて測定する。
我々の中心となる計量は知覚融合ギャップ(Perception-Fusion Gap)である。
論文 参考訳(メタデータ) (2026-07-05T14:33:29Z) - They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It [0.0]
我々は、送信者の意図をデコードする言語モデルの失敗は、ロバストな表現の上にある読み出しの1つであることを示す。
線形プローブは、6つのモデルと4つのファミリー、およびベースチェックポイントで、送信者の意図を認識または評価したいかどうかを復号する。
ストーリーの行動的半分は、デフォルトの出力が意図に作用するかどうかが異なるという認識/評価のコントラストに基づいている。
論文 参考訳(メタデータ) (2026-07-03T20:49:37Z) - Beyond Hallucinations: The Illusion of Understanding in Large Language Models [0.0]
大規模言語モデル(LLM)は、人間のコミュニケーションや意思決定に深く浸透している。
彼らはあいまいさ、偏見、言語自体に固有の真理への直接アクセスの欠如を継承する。
本稿は,LLMがシステム1認知を大規模に運用する,高速,連想的,説得的だが,反射やファルシフィケーションは行わない,と論じる。
論文 参考訳(メタデータ) (2025-10-16T13:19:44Z) - Distributional Semantics Tracing: A Framework for Explaining Hallucinations in Large Language Models [4.946483489399819]
大規模言語モデル(LLM)は、事実的に誤った文を生成する幻覚の傾向にある。
この研究は、3つの主要な貢献を通じて、この障害モードの本質的、アーキテクチャ的起源について調査する。
論文 参考訳(メタデータ) (2025-10-07T16:40:31Z) - Language Models use Lookbacks to Track Beliefs [53.8367373163602]
我々は、因果媒介と抽象化を用いて、キャラクターの信念を推論するLMの能力を分析する。
我々の研究は信念追跡機構の洞察を提供し、LMにおけるToM推論のリバースエンジニアリングに向けた一歩を踏み出した。
論文 参考訳(メタデータ) (2025-05-20T17:59:45Z) - Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding [40.78154629252038]
曖昧なクレームにバイナリラベルを強制すると、評価の信頼性が低下する。
請求項のニュアンス評価を提供する方法として,LCM生成した要約の編集を紹介する。
我々は,ARMが主張の忠実性に関するアノテータ合意において,絶対的な21%の改善をもたらすことを示す。
論文 参考訳(メタデータ) (2025-04-01T19:08:24Z) - Is This the Subspace You Are Looking for? An Interpretability Illusion
for Subspace Activation Patching [47.05588106164043]
機械的解釈可能性(Mechanistic Interpretability)は、特定の、解釈可能な特徴の観点からモデル行動を理解することを目的としている。
最近の研究は、モデル行動を操作し、その背後にある特徴を与えられた部分空間とみなす方法として、サブスペース介入を探求している。
これらの2つの目的が多様であることを示し、潜在的に説明可能性という幻想的な感覚に繋がる可能性があることを実証する。
論文 参考訳(メタデータ) (2023-11-28T18:32:19Z) - Latent Topology Induction for Understanding Contextualized
Representations [84.7918739062235]
本研究では,文脈的埋め込みの表現空間について検討し,大規模言語モデルの隠れトポロジについて考察する。
文脈化表現の言語特性を要約した潜在状態のネットワークが存在することを示す。
論文 参考訳(メタデータ) (2022-06-03T11:22:48Z) - Transformation Driven Visual Reasoning [80.32402545546209]
本稿では,重要な要因,すなわちトランスフォーメーションを導入することで,新たな視覚的推論パラダイムを定義する。
この種のテキスト状態駆動型視覚推論アプローチは、マシンが異なる状態間のダイナミクスを推論する能力を持っているかどうかを反映する限界がある、と我々は主張する。
実験結果から,現在最先端の視覚推論モデルは,Basic上では良好に動作するが,イベントやビューにおける人間レベルのインテリジェンスには程遠いことが示唆された。
論文 参考訳(メタデータ) (2020-11-26T07:11:31Z) - A Weaker Faithfulness Assumption based on Triple Interactions [89.59955143854556]
より弱い仮定として, 2$-adjacency faithfulness を提案します。
より弱い仮定の下で適用可能な因果発見のための音方向規則を提案する。
論文 参考訳(メタデータ) (2020-10-27T13:04:08Z) - Commonsense Evidence Generation and Injection in Reading Comprehension [57.31927095547153]
本稿では,CEGI と命名された理解を読み取るためのコモンセンス・エビデンス・ジェネレーション・インジェクション・フレームワークを提案する。
この枠組みは、2種類の補助的コモンセンス証拠を包括的読解に注入し、機械に合理的思考能力を持たせる。
CosmosQAデータセットの実験では、提案されたCEGIモデルが現在の最先端アプローチよりも優れていることが示された。
論文 参考訳(メタデータ) (2020-05-11T16:31:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。