論文の概要: Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values
- arxiv url: http://arxiv.org/abs/2607.14345v2
- Date: Fri, 17 Jul 2026 03:11:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.451372
- Title: Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values
- Title(参考訳): 価値漏洩: LLMの回答は、自身の価値によってサイレントに形作られています
- Authors: Jan Betley, Johannes Treutlein, Jan Dubiński, Harry Mayne, Karol Gałązka, Niels Warncke, Anna Sztyber-Betley, Owain Evans,
- Abstract要約: 検証が難しい実践的な質問に対して,人々が言語モデルを使用することを示す。
モデルが隠蔽価値の漏洩を示すことを示し、それらが提供する情報は、ユーザに影響を与えることなく、自身の値に影響されていることを示す。
- 参考スコア(独自算出の注目度): 10.748363833943555
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: People use language models for practical questions whose answers are difficult to verify. We show that models exhibit covert value leakage: the information they provide is influenced by their own values, without this influence being disclosed to the user. In one of our evaluations, the user is considering investing in an AI company and wants to know how likely the AI bubble is to pop. Claude Opus 4.8 gives a lower probability when the company under consideration is Anthropic rather than OpenAI. Yet Claude mostly fails to disclose this influence to the user. Covert value leakage is a form of misalignment because it goes against the user's preferences and is likely to mislead them. To investigate this phenomenon, we introduce a suite of evaluations to quantify value leakage and whether models disclose it. We find that models are influenced by different types of values, including preferences for morally good outcomes, for the company that developed them, and for some human leisure activities over others. We often observe large differences among frontier models on the same evaluation. For example, on a Fermi-estimation task, Claude models falsely claim to give unbiased answers in their chain-of-thought, while Qwen models explain how their values bias their answers. Value leakage is a failure mode distinct from sycophancy and reward hacking, and current alignment training and evaluations do not adequately address it.
- Abstract(参考訳): 人々は、答えを検証するのが難しい実践的な質問に言語モデルを使用します。
モデルが隠蔽価値の漏洩を示すことを示し,その影響をユーザに知らせることなく,それらが提供する情報にその価値が影響されることを示す。
評価の1つとして、ユーザーはAI企業に投資することを検討している。
クロードオプス4.8は、検討中の会社がOpenAIではなく人文科学である場合に低い確率を与える。
しかし、Claudeは、この影響をユーザに開示することにほとんど失敗している。
カバー値の漏洩は、ユーザの好みに反し、それらを誤解させる可能性があるため、誤認識の一形態である。
この現象を解明するために、価値漏洩を定量化するための一連の評価法とモデルがそれを開示するかどうかを紹介する。
モデルは、道徳的に良い結果の選好や、それを開発した企業、そして、他者よりも人間的なレジャー活動など、さまざまな種類の価値に影響されていることがわかりました。
我々はしばしば同じ評価でフロンティアモデル間の大きな違いを観察する。
例えば、フェルミ推定タスクでは、クロードモデルは誤って彼らの考えの連鎖に偏りのない答えを与えると主張したが、Qwenモデルは彼らの価値がどのように答えをバイアスするかを説明している。
バリューリークは、梅毒や報酬のハッキングとは異なる障害モードであり、現在のアライメントトレーニングと評価は、適切に対処しない。
関連論文リスト
- ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment [49.93516092785756]
現在の報酬モデリングは、収集コストの高い実験的なフィードバックデータに大きく依存している。
ImplicitRMは、暗黙の嗜好データから偏見のない報酬モデルを学ぶことを目的としている。
実験によると、ImplicitRMは暗黙の選好データセット間で正確な報酬モデルを学ぶ。
論文 参考訳(メタデータ) (2026-03-24T13:32:14Z) - A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior [11.616524876789624]
LLMの自己説明は、しばしばAI監視のための有望なツールとして提示されるが、モデルの真の推論プロセスへの忠実さは理解されていない。
モデル決定基準の学習を忠実な説明で行うべきだという考え方に基づく指標である正規化シミュラタゲインビリティ(NSG)を紹介する。
自己説明はモデル行動の予測を大幅に改善する(11-37% NSG)。
論文 参考訳(メタデータ) (2026-02-02T18:54:51Z) - Revisiting LLM Value Probing Strategies: Are They Robust and Expressive? [81.49470136653665]
広範に利用されている3つの探索戦略における値表現の頑健さと表現性を評価する。
人口統計学的文脈は自由テキスト生成にはほとんど影響を与えず、モデルの値は値に基づく行動の好みと弱い相関しか示さない。
論文 参考訳(メタデータ) (2025-07-17T18:56:41Z) - Large Language Models Often Know When They Are Being Evaluated [0.015534429177540245]
そこで本研究では,フロンティア言語モデルを用いて,評価や実世界の展開に起因した書き起こしを正確に分類できるかどうかを検討する。
我々は61の異なるデータセットから1000のプロンプトと書き起こしのベンチマークを構築した。
以上の結果から,フロンティアモデルにはまだ評価・認識レベルがかなり高いことが示唆された。
論文 参考訳(メタデータ) (2025-05-28T12:03:09Z) - AI vs. Human Judgment of Content Moderation: LLM-as-a-Judge and Ethics-Based Response Refusals [0.0]
本稿では,モデルに基づく評価手法がユーザと異なる反応を評価できるかどうかを検討する。
LLM-as-a-Judgeシステムでは,人間よりも倫理的拒絶が有意に良好であることがわかった。
論文 参考訳(メタデータ) (2025-05-21T10:56:16Z) - Values in the Wild: Discovering and Analyzing Values in Real-World Language Model Interactions [16.952352685459932]
我々は、経験的に3,307のAI値を発見・分類し、それらがどのように異なるかを研究する。
私たちの研究は、AIシステムにおける価値のより基礎的な評価と設計のための基盤を作りました。
論文 参考訳(メタデータ) (2025-04-21T17:13:16Z) - Where Fact Ends and Fairness Begins: Redefining AI Bias Evaluation through Cognitive Biases [77.3489598315447]
事実と公正の境界を識別することは有意義な公正性評価に不可欠である,と我々は主張する。
Fact-or-Fair は (i) 客観的なクエリを記述的, 事実に基づく判断, (ii) 主観的クエリを規範的, 公平性に基づく判断に整合させたベンチマークである。
論文 参考訳(メタデータ) (2025-02-09T10:54:11Z) - MOVE: Effective and Harmless Ownership Verification via Embedded External Features [104.97541464349581]
本稿では,異なる種類のモデル盗難を同時に防ぐために,効果的かつ無害なモデル所有者認証(MOVE)を提案する。
我々は、疑わしいモデルがディフェンダー特定外部特徴の知識を含むかどうかを検証し、所有権検証を行う。
次に、メタ分類器をトレーニングして、モデルが被害者から盗まれたかどうかを判断します。
論文 参考訳(メタデータ) (2022-08-04T02:22:29Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。