論文の概要: Language Models Encode the Contextual Truth of Propositions
- arxiv url: http://arxiv.org/abs/2608.03035v1
- Date: Tue, 04 Aug 2026 02:30:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.998514
- Title: Language Models Encode the Contextual Truth of Propositions
- Title(参考訳): 命題の文脈的真実を符号化する言語モデル
- Abstract要約: 文脈的真理は、構造的に異なる出力ポリシーにまたがって持続することを示す。
決定境界付近の命題は、パートナーの主張を通じて彼らの真実をシフトさせることにより、より影響を受けやすいことが分かっています。
- 参考スコア(独自算出の注目度): 25.371554138996412
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Prior work has shown that LLMs encode the truth of factual propositions along linear directions in activation space. It's unclear how these representations extend to contextual truth: propositions whose truth is determined by in-context evidence rather than world knowledge. We show that LLMs maintain a linear representation of contextual truth that persists across structurally different output policies, even when the output doesn't require the model to determine a proposition's truth, and show causal evidence via steering experiments. Using the transcripts from a collaborative vision-language task that requires two LLMs to maintain a shared common ground, we show that truth representations of a proposition are significantly swayed by partner assertions about that proposition, even when the LLM has enough evidence to determine its truth. We find evidence that propositions near the decision boundary are more susceptible to having their truth shifted through partner assertions. Separating representation from output distinguish two forms of sycophancy that output behavior alone cannot: the model may accommodate a false proposition while continuing to represent it as false, or shift its representation across the boundary. The latter is 2.59x more common when the model agrees by restating the false claim explicitly than when it agrees implicitly.
- Abstract(参考訳): 以前の研究は、LLMが活性化空間の線型方向に沿って実数命題の真理を符号化していることを示している。
これらの表現が文脈的真理にどのように拡張されるかは定かではない: 真理が世界知識よりも文脈内証拠によって決定される命題。
LLMは、命題の真理を決定するためにモデルを必要としない場合でも、構造的に異なる出力ポリシーにまたがって持続する文脈的真理の線形表現を維持し、ステアリング実験を通じて因果的証拠を示す。
共有共通基盤を維持するために2つのLLMを必要とする協調視覚言語タスクの転写文を用いて、提案の真理表現は、LLMがその真理を決定するのに十分な証拠を持っている場合でも、その提案に関するパートナーの主張によって著しく揺れていることを示す。
私たちは、決定境界付近の命題が、パートナーの主張を通じて彼らの真実をシフトさせることにより、より影響を受けやすいという証拠を見つけます。
出力から表現を分離することで、出力の振る舞いだけでは不可能な2つの形態を区別する:モデルは偽の命題を許容し、それを偽として表現し続けるか、境界を越えてその表現をシフトする。
後者は、モデルが暗黙的に同意する時よりも、偽の主張を明示的に復活させることで同意する時の方が2.59倍多い。
関連論文リスト
- Representational Stability of Truth in Large Language Models [0.15655985886975654]
本稿では,LLMの真理の操作的定義における摂動に対する妥当性表現の頑健性として表現安定性を導入する。
トレーニングデータから欠落していると思われるエンティティに関する事実的主張と、よく知られたフィクションの文脈から引き出された非事実的主張の2つを比較した。
未知のステートメントは最大の境界シフトを引き起こし、脆弱なドメインで最大40%の真理を反転させる。
論文 参考訳(メタデータ) (2025-11-24T14:28:50Z) - Emergence of Linear Truth Encodings in Language Models [64.86571541830598]
大規模言語モデルは偽文と真を区別する線形部分空間を示すが、それらの出現のメカニズムは不明確である。
このような真理部分空間をエンドツーエンドに再現する,透明な一層トランスフォーマー玩具モデルを導入する。
本研究では,真理エンコーディングが実現可能な単純な設定について検討し,将来のトークンにおけるLM損失を減らすために,この区別を学習するようモデルに促す。
論文 参考訳(メタデータ) (2025-10-17T16:30:07Z) - Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMs [29.9148172868873]
量子化により、リソース制約のある環境での大規模言語モデル(LLM)の効率的なデプロイが可能になる。
本稿では,量子化LDMの真偽を評価するための総合的な評価フレームワークであるTrathfulnessEvalを紹介する。
量子化モデルは真理表現を内部的に保持するが、誤誘導のプロンプトの下で偽の出力を生成することにはより感受性が高い。
論文 参考訳(メタデータ) (2025-08-26T21:01:45Z) - Probing the Geometry of Truth: Consistency and Generalization of Truth Directions in LLMs Across Logical Transformations and Question Answering Tasks [31.379237532476875]
我々は,大規模言語モデル (LLM) が真理性を「真理方向」と呼ぶ線形特徴としてエンコードするかどうかを考察する。
以上の結果から,全てのLLMが一貫した真理方向を示すわけではなく,より有能なモデルでより強い表現が観察されることがわかった。
宣言的原子文に基づいて訓練された真理性プローブは、論理変換、質問応答タスク、文脈内学習、外部知識ソースに効果的に一般化できることを示す。
論文 参考訳(メタデータ) (2025-06-01T03:55:53Z) - Are the Hidden States Hiding Something? Testing the Limits of Factuality-Encoding Capabilities in LLMs [48.202202256201815]
大型言語モデル(LLM)における実名幻覚
不正確なコンテンツや偽造コンテンツを生成することによって、信頼性とユーザ信頼を損なう。
近年の研究では、偽文を生成する際、LLMの内部状態が真偽に関する情報を符号化していることが示唆されている。
論文 参考訳(メタデータ) (2025-05-22T11:00:53Z) - On Reference (In-)Determinacy in Natural Language Inference [62.904689974282334]
我々は、自然言語推論(NLI)タスクにおける基準決定性(RD)仮定を再考する。
我々は、現在のNLIモデルは、入力前提と仮説が異なるコンテキストを参照できる事実検証のような下流アプリケーションでは失敗するのを観察する。
NLI例における参照曖昧性を特定するための診断ベンチマークであるRefNLIを紹介する。
論文 参考訳(メタデータ) (2025-02-09T06:58:13Z) - Cognitive Dissonance: Why Do Language Model Outputs Disagree with
Internal Representations of Truthfulness? [53.98071556805525]
ニューラルネットワークモデル(LM)は、事実文の真偽を評価するために用いられる。
それらは、文の確率を問い合わせたり、真理の表現を内部で探したりすることができる。
過去の研究によると、これらの2つの手順は時折不一致であり、プローブはLM出力よりも正確である。
この結果、一部の研究者は、LMが非協力的なコミュニケーション意図を「十分」あるいは他の方法でコード化していると結論付けている。
論文 参考訳(メタデータ) (2023-11-27T18:59:14Z) - Neuro-Symbolic Integration Brings Causal and Reliable Reasoning Proofs [95.07757789781213]
LLMの複雑な推論には2行のアプローチが採用されている。
1行の作業は様々な推論構造を持つLLMを誘導し、構造出力は自然に中間推論ステップと見なすことができる。
他方の行では、LCMのない宣言的解法を用いて推論処理を行い、推論精度は向上するが、解法のブラックボックスの性質により解釈性に欠ける。
具体的には,Prologインタプリタが生成した中間検索ログにアクセスし,人間可読推論に解釈可能であることを示す。
論文 参考訳(メタデータ) (2023-11-16T11:26:21Z) - Personas as a Way to Model Truthfulness in Language Models [23.86655844340011]
大規模な言語モデル(LLM)は、インターネットから大量のテキストで訓練されている。
本稿では,真理ラベルのトレーニングを受けていないLMが真理を知っているように見える理由を説明する。
論文 参考訳(メタデータ) (2023-10-27T14:27:43Z) - The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets [6.732432949368421]
大きな言語モデル(LLM)には印象的な能力があるが、偽装を出力する傾向がある。
近年の研究では、LLMの内部アクティベーションに関するプローブを訓練することで、LLMが真実を語っているかどうかを推測する手法が開発されている。
十分な規模で LLM が実言の真偽を線形に表す証拠を示す。
論文 参考訳(メタデータ) (2023-10-10T17:54:39Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。