論文の概要: Strangers to Themselves: What Language Models Say About Themselves Is Generic
- arxiv url: http://arxiv.org/abs/2609.09899v1
- Date: Wed, 09 Sep 2026 08:56:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.958687
- Title: Strangers to Themselves: What Language Models Say About Themselves Is Generic
- Title(参考訳): 言語モデルが語るテーマはジェネリック
- Abstract要約: 言語モデルは、どのように振る舞うかをうまく記述できる。
その説明は実際にはモデルについてですか。
私たちは自己認識を予測テストにします。
- 参考スコア(独自算出の注目度): 0.33985395340995606
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models can fluently describe how they would behave: whether they would cave to pushback, misuse a tool, or lie under pressure. Is that description actually about the model speaking? We turn self-knowledge into a prediction test. Across nine behavioral evaluations, we measure how a model behaves under different conditions, ask it to predict those rates, and compare its predictions with controls that remove the self from the question. We find that: (i) Direct self-report is weak (r = +0.04), and even showing the model the exact items only raises prediction to +0.24. Crucially, the same item-informed question about "capable AI agents in general" does just as well (+0.28), while other models' answers about themselves predict the target model at least as well as its own. (ii) Frontier scale does not detectably change this pattern: any gains in prediction are not self-specific, and are consistent with a better theory of how AI assistants behave rather than better self-knowledge. (iii) First-person framing does have one robust effect: it shifts reports in the flattering direction, understating harmful behavior relative to the same question about a generic agent. (iv) Finetuning on a model's own behavioral record can teach narrow self-predictions, but it also changes the behavior being predicted and the gains do not transfer broadly. The practical implication is simple: asking a model what it would do mostly reveals a theory of AI assistants in general, plus a favorable bias, rather than privileged knowledge of that model.
- Abstract(参考訳): 言語モデルは、どのように振る舞うかをうまく記述することができます。
その説明は実際にはモデルについてですか。
私たちは自己認識を予測テストにします。
9つの行動評価において、モデルが異なる条件下でどのように振る舞うかを測定し、それらの速度を予測し、その予測を質問から自己を取り除く制御と比較する。
以下に示す。
(i)直接自己申告は弱(r = +0.04)であり、モデルを示すときでさえ、正確な項目は+0.24までしか予測しない。
重要な点として、"一般の能力を持つAIエージェント"に関するアイテムインフォームドの質問も同じように(+0.28)、他のモデルの回答がターゲットモデルを少なくともそれ自身で予測する。
(ii)フロンティアスケールは、このパターンを検出できない:予測の利得は、自己特異的ではなく、AIアシスタントの振る舞いに関するより良い理論と一致している。
三 一人称フレーミングは、報告を平らな方向にシフトさせ、ジェネリックエージェントに関する同じ質問に対して有害な行動を下すという、強固な効果がある。
(4)モデル自身の行動記録を微調整することで、狭い自己予測を学べるが、予測される振る舞いも変化し、利得は広範に伝達されない。
モデルに何をするかを尋ねると、一般的にAIアシスタントの理論が明らかになり、そのモデルの特権的な知識よりも好ましくないバイアスが生じる。
関連論文リスト
- An Empirical Study of Counterfactual Self-Explanations in LLMs [13.093234754814851]
大規模言語モデルは、自身の出力に対する説明を容易に生成できるが、そのような自己説明は必ずしもモデルの振る舞いに忠実ではない。
本稿では,モデルが入力を最小限に編集し,それ自身の予測が変更されるような非現実的な自己説明を通じてこの問題を考察する。
以上の結果から,モデルスケールが説明品質の最大の決定要因であることが示唆された。
論文 参考訳(メタデータ) (2026-09-15T12:47:22Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior [11.616524876789624]
LLMの自己説明は、しばしばAI監視のための有望なツールとして提示されるが、モデルの真の推論プロセスへの忠実さは理解されていない。
モデル決定基準の学習を忠実な説明で行うべきだという考え方に基づく指標である正規化シミュラタゲインビリティ(NSG)を紹介する。
自己説明はモデル行動の予測を大幅に改善する(11-37% NSG)。
論文 参考訳(メタデータ) (2026-02-02T18:54:51Z) - Know Thyself? On the Incapability and Implications of AI Self-Recognition [22.582593406983907]
自己認識は、心理的分析だけでなく、安全性にも関係する、AIシステムにとって重要なメタ認知能力である。
適用や更新が容易なシステム評価フレームワークを導入する。
10の現代的大規模言語モデル(LLM)が、他のモデルからのテキストに対して、それぞれの生成したテキストをどの程度正確に識別できるかを測定する。
論文 参考訳(メタデータ) (2025-10-03T18:00:01Z) - Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors [61.92704516732144]
正当性予測の最も堅牢な特徴は、モデルの振舞いに特徴的な因果的役割を果たすものであることを示す。
モデル出力の正しさを予測するために因果メカニズムを利用する2つの手法を提案する。
論文 参考訳(メタデータ) (2025-05-17T00:31:39Z) - Great Models Think Alike and this Undermines AI Oversight [47.7725284401918]
モデル類似性がAI監視の両面に与える影響について検討する。
本稿では,モデルミスの重複に基づくLM類似度尺度CAPAを提案する。
我々の研究は、モデル類似性の報告と修正の重要性を強調します。
論文 参考訳(メタデータ) (2025-02-06T18:56:01Z) - SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs [72.06808538971487]
大規模言語モデル(LLM)が行動予測に「心の理論」(ToM)を暗黙的に適用できるかどうかを検証する。
ToM推論の異なる程度をテストする3つの質問を含む新しいデータセットSimpleTomを作成します。
私たちの知る限り、SimpleToMは、現実的なシナリオにおけるメンタルステートの知識を必要とする下流の推論を探求する最初のデータセットです。
論文 参考訳(メタデータ) (2024-10-17T15:15:00Z) - Limitations of Agents Simulated by Predictive Models [1.6649383443094403]
エージェントとなると予測モデルが失敗する2つの構造的理由を概説する。
いずれの障害も環境からのフィードバックループを組み込むことで修正可能であることを示す。
我々の治療は、これらの障害モードの統一的なビューを提供し、オンライン学習でオフライン学習ポリシーを微調整することで、より効果的になる理由を疑問視する。
論文 参考訳(メタデータ) (2024-02-08T17:08:08Z) - Rationalizing Predictions by Adversarial Information Calibration [65.19407304154177]
我々は2つのモデルを共同で訓練する: 1つは、正確だがブラックボックスな方法でタスクを解く典型的なニューラルモデルであり、もう1つは、予測の理論的根拠を付加するセレクタ・予測モデルである。
我々は,2つのモデルから抽出した情報を,それらの違いが欠落した特徴や過度に選択された特徴の指標であるように校正するために,敵対的手法を用いる。
論文 参考訳(メタデータ) (2023-01-15T03:13:09Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。