論文の概要: Falsehood and Impossibility Are Different Directions in an AI's Representation of Language
- arxiv url: http://arxiv.org/abs/2608.12852v1
- Date: Thu, 13 Aug 2026 05:52:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.408219
- Title: Falsehood and Impossibility Are Different Directions in an AI's Representation of Language
- Title(参考訳): AIの言語表現における相違点と相違点
- Abstract要約: 言語は、虚偽な事柄の状況と、そうでない事柄の状況を記述することができる。
マルチモーダルオープンウェイトモデル Gemma 3 4B IT の探索活性化に関する研究を報告する。
その答えの中で、モデルは矛盾と矛盾を混同し、15の偽文の12の「矛盾」をラベル付けする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language can describe states of affairs that are false and states of affairs that could not be the case at all. Whether an AI model internally distinguishes these failures remains unclear. I report an exploratory activation study of the multimodal open-weight model Gemma 3 4B IT using 85 prompts from 17 philosophical families and a topic-matched modality set of 15 topics, each expressed as a truth, contingent falsehood, improbable claim, semantic anomaly, and necessary falsehood. In its answers, the model conflates contingent falsehood with contradiction, labeling 12 of 15 false statements "contradiction." Its activations show a different pattern. A linear truth probe separates impossible from true statements (AUC 0.93) but not impossible from false statements (AUC 0.20). An impossibility probe evaluated on held-out topic families separates necessary from contingent falsehood at AUC 1.00, peaking at layer 15 with balanced accuracy 0.97 (Bonferroni-adjusted P=0.018). The truth and impossibility directions are close to orthogonal, whereas the impossibility direction partially overlaps a semantic anomaly direction while remaining distinguishable from it. Sparse autoencoder features at the same layer repeat this geometry. Features selective for impossibility also fire on anomalous sentences but rarely on contingent falsehoods. In this model's activation space, necessary falsehoods are not extreme cases of contingent falsehood but lie closer to the experimentally defined category of semantic anomaly. This representational proximity does not imply that impossible statements are intrinsically meaningless. These correlational observations from one small model offer an empirical footnote to an old philosophical distinction.
- Abstract(参考訳): 言語は、虚偽な事柄の状況と、そうでない事柄の状況を記述することができる。
AIモデルがこれらの失敗を内部的に区別するかどうかはまだ不明だ。
本稿では,17の哲学的家族から85のプロンプトを用いたマルチモーダルオープンウェイトモデル Gemma 3 4B IT の探索的アクティベーション研究について報告する。
その答えでは、モデルは矛盾と矛盾を混同し、15の偽文のうち12が「矛盾」である。
その活性化は異なるパターンを示す。
線形真理プローブは真文(AUC 0.93)とは分離するが、偽文(AUC 0.20)とは分離しない。
保持対象のトピックファミリーで評価された不確実性プローブは、AUC 1.00における偶発的偽造から分離し、バランスの取れた精度0.97(ボンフェロニ調整P=0.018)で15層にピークする。
真理と不合理な方向は直交に近いが、不合理な方向は意味的異常な方向と部分的に重なり、それと区別できるままである。
スパースオートエンコーダは、同じ層でこの幾何学を繰り返す。
不合理性に選択的な特徴は異常な文にも現れるが、偶発的偽造にはめったに現れない。
このモデルのアクティベーション空間では、必要偽装は一時的な偽装の極端なケースではなく、実験的に定義された意味的異常のカテゴリに近いものである。
この表現的近接性は、不可能な言明が本質的に無意味であることを意味するものではない。
これらの小さなモデルからの相関的な観察は、古い哲学的区別に実証的な脚注を与える。
関連論文リスト
- When Decodability Is Not Enough: Logical Validity Representations, Behavioral Dissociation, and Causal Tests in Language Models [2.5819252531158683]
5つのオープンウェイト変圧器モデルにおける論理的検証について検討する。
ほぼ簡潔な行動性能にもかかわらず、論理的妥当性は隠れた状態からほぼ完全に排除可能である。
以上の結果から, 妥当性を示唆し, 行動で表現し, 因果的に使用することは異なることが示唆された。
論文 参考訳(メタデータ) (2026-09-02T11:01:09Z) - Surprisal Theory is Tautological (without Rational Grounding) [60.917028769172795]
予備理論は、文脈における言語単位の人間の処理困難は、ある言語モデルの下でのそのサブプライムのアフィン関数であると主張している。
この主張は、これ以上の制約を伴わないタウトロジーであると私は主張する。
私は、タウトロジーを破るには合理主義的な介入が必要だと結論付けます。
論文 参考訳(メタデータ) (2026-07-23T17:54:37Z) - Toward AI That Understands Self and Others: A World-Model Theory of Cognitive Diversity and Alignment [0.6768558752130311]
本稿は、すでに不一致は後期現象であると主張している。
中心的な前提は単純だが自明ではない。
本稿では,認知の多様性とアライメントに関する世界モデル理論を開発する。
論文 参考訳(メタデータ) (2026-05-28T13:43:23Z) - When the Pure Reasoner Meets the Impossible Object: Analytic vs. Synthetic Fine-Tuning and the Suppression of Genesis in Language Models [0.0]
我々は「不可能物体」に対する微調整大言語モデルのオンロジ的帰結について研究する。
統計学的に有意な「遺伝子抑制」が得られ、ベースモデルが自然に合成概念を生成する一方で、競合訓練されたモデルは1.0%に低下する。
弁証的調停を伴わない論理的矛盾の訓練は、モデルを「教義的」な排除状態に強制する、と結論付けている。
論文 参考訳(メタデータ) (2026-02-26T22:53:05Z) - The Energy of Falsehood: Detecting Hallucinations via Diffusion Model Likelihoods [0.9877005520976847]
LLM(Large Language Models)は、しばしばもっともらしいが誤った主張を幻覚させる。
非平衡熱力学による事実検証を再現する,教師なしのフレームワークであるDiffuTruthを提案する。
論文 参考訳(メタデータ) (2026-02-11T20:52:16Z) - Representational Stability of Truth in Large Language Models [0.15655985886975654]
本稿では,LLMの真理の操作的定義における摂動に対する妥当性表現の頑健性として表現安定性を導入する。
トレーニングデータから欠落していると思われるエンティティに関する事実的主張と、よく知られたフィクションの文脈から引き出された非事実的主張の2つを比較した。
未知のステートメントは最大の境界シフトを引き起こし、脆弱なドメインで最大40%の真理を反転させる。
論文 参考訳(メタデータ) (2025-11-24T14:28:50Z) - Emergence of Linear Truth Encodings in Language Models [64.86571541830598]
大規模言語モデルは偽文と真を区別する線形部分空間を示すが、それらの出現のメカニズムは不明確である。
このような真理部分空間をエンドツーエンドに再現する,透明な一層トランスフォーマー玩具モデルを導入する。
本研究では,真理エンコーディングが実現可能な単純な設定について検討し,将来のトークンにおけるLM損失を減らすために,この区別を学習するようモデルに促す。
論文 参考訳(メタデータ) (2025-10-17T16:30:07Z) - Large Language Model probabilities cannot distinguish between possible and impossible language [0.11726720776908521]
モデル-内部表現を使用して、大言語モデルが'文法-非文法'の区別を表現する方法を直接タップします。
文字列確率が文法の限界のプロキシとして機能すると、非文法的条件は言語的違反を含む条件の中で際立つと予測する。
この結果から,非文法的プロンプトに対する特異な副次的シグネチャは明らかにされていない。
論文 参考訳(メタデータ) (2025-09-18T16:17:48Z) - Calibrating Verbal Uncertainty as a Linear Feature to Reduce Hallucinations [51.92795774118647]
LLMの表現空間における1つの線形特徴によって「動詞の不確実性」が支配されることがわかった。
これはモデルの実際の意味的不確実性と適度な相関しか持たないことを示す。
論文 参考訳(メタデータ) (2025-03-18T17:51:04Z) - Cognitive Dissonance: Why Do Language Model Outputs Disagree with
Internal Representations of Truthfulness? [53.98071556805525]
ニューラルネットワークモデル(LM)は、事実文の真偽を評価するために用いられる。
それらは、文の確率を問い合わせたり、真理の表現を内部で探したりすることができる。
過去の研究によると、これらの2つの手順は時折不一致であり、プローブはLM出力よりも正確である。
この結果、一部の研究者は、LMが非協力的なコミュニケーション意図を「十分」あるいは他の方法でコード化していると結論付けている。
論文 参考訳(メタデータ) (2023-11-27T18:59:14Z) - Nested Counterfactual Identification from Arbitrary Surrogate
Experiments [95.48089725859298]
観測と実験の任意の組み合わせからネスト反事実の同定について検討した。
具体的には、任意のネストされた反事実を非ネストされたものへ写像できる反ファクト的非ネスト定理(英語版)(CUT)を証明する。
論文 参考訳(メタデータ) (2021-07-07T12:51:04Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。