論文の概要: Out-of-Distribution Generalization of Risk Aversion in Language Models
- arxiv url: http://arxiv.org/abs/2607.02755v1
- Date: Thu, 02 Jul 2026 20:41:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.41365
- Title: Out-of-Distribution Generalization of Risk Aversion in Language Models
- Title(参考訳): 言語モデルにおけるリスク回避のアウト・オブ・ディストリビューション一般化
- Abstract要約: リスク回避のためのAIのトレーニングは、AIが不一致を犯した場合に、フェールセーフを提供する可能性がある。
低利得で学んだリスク回避は、天文学的に高い利得に一般化できることを示す。
- 参考スコア(独自算出の注目度): 0.009825610883836785
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Training AIs to be risk-averse in resources could offer a failsafe in the event that AIs turn out misaligned. Misaligned but risk-averse AIs would tend to prefer low-risk, low-reward strategies like cooperation over high-risk, high-reward strategies like rebellion, limiting the downsides of any misalignment. But we can only feasibly train AIs to be risk-averse on low-stakes gambles, and we will only be safe if their risk aversion generalizes to astronomically-high-stakes gambles. Will it? To shed light on this question, we introduce RiskAverseOOD: a benchmark for measuring how well risk aversion generalizes out of distribution. We then offer some initial results. Using a variety of methods to make Qwen3-8B choose risk-aversely when the stakes are low, we find that we can induce substantial risk aversion when the stakes are astronomically high. Our models' learned risk aversion generalizes at least partially across 98 orders of magnitude. From a baseline 2% rate of choosing a safe `Cooperate' option, we see rates around 70% (SFT and tie training), 52% (DPO), and 39% (activation steering). In another experiment, our fine-tuned reward model reliably scores risk-averse reasoning above risk-neutral or excessively risk-averse alternatives (99.6% pairwise accuracy). We replicate these effects at different scales (Qwen3-1.7B and Qwen3-14B) and across model families (Gemma-3-12B-IT and Llama-3.1-8B-Instruct). Overall, we find that risk aversion learned at low stakes can generalize OOD to astronomically high stakes, though not yet consistently enough to serve as a reliable failsafe. Achieving that level of consistency is an open problem.
- Abstract(参考訳): リソースのリスク回避のためにAIをトレーニングすることは、AIが不一致を犯した場合に、フェイルセーフを提供する可能性がある。
ミスアライメントだがリスクアバースなAIは、リスクの高い、低リスクで低リスクな戦略を好む傾向にある。
しかし、私たちは、低リスクのギャンブルでAIをリスク回避に訓練するしかなく、彼らのリスク回避が天文学的に高いギャンブルに一般化したら、安全になるでしょう。
そうだろうか?
本稿では,リスク回避が分散からいかに一般化するかを評価するベンチマークとして,リスクAverseOODを紹介する。
次に、いくつかの最初の結果を提示します。
Qwen3-8Bにリスクを負わせる様々な方法を用いて、リスクが低い場合には、そのリスクが天文学的に高い場合には、相当なリスク回避を誘導できる。
我々のモデルの学習リスク回避は、少なくとも98桁のオーダーで部分的に一般化する。
安全な「協力」オプションを選択する基準2%のレートから、70%(SFTとネクタイトレーニング)、52%(DPO)、39%(アクティベーションステアリング)のレートが見られます。
別の実験では、細調整された報酬モデルがリスク中立性以上のリスク逆推論(99.6%のペアの精度)を確実に評価する。
我々はこれらの効果を異なるスケール(Qwen3-1.7BとQwen3-14B)およびモデルファミリー(Gemma-3-12B-ITとLlama-3.1-8B-Instruct)で再現する。
全体としては、低いステークで学んだリスク回避は、OODを天文学的に高いステークに一般化することができるが、信頼性のあるフェールセーフとして機能するのにはまだ不十分である。
このレベルの一貫性を達成することは、オープンな問題です。
関連論文リスト
- Decision-Making under Combinatorial Risk [2.3557380328665265]
リスク下での意思決定は、通常単発の宝くじ選択によって研究される。
我々は、リスク下での意思決定を調査するための投資配分タスクを導入し、そこでは、コンポーネントへの投資がその成功確率を高める。
提案手法では,誘導確率質量関数が現れる場合にのみ,その中心となる特徴を通じてリスクをナビゲートし,宝くじ評価にシフトすることを示す。
論文 参考訳(メタデータ) (2026-06-08T19:17:26Z) - Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling [50.872910438715486]
大規模言語モデル(LLM)は、通常、単一ショットまたは低予算の逆のプロンプトの下で安全性を評価する。
我々は,Best-of-Nサンプリングの下でのジェイルブレイク脆弱性をモデル化するための,スケーリング対応のリスク推定手法であるSABERを提案する。
論文 参考訳(メタデータ) (2026-01-30T06:54:35Z) - Toward Quantitative Modeling of Cybersecurity Risks Due to AI Misuse [50.87630846876635]
我々は9つの詳細なサイバーリスクモデルを開発する。
各モデルはMITRE ATT&CKフレームワークを使用して攻撃をステップに分解する。
個々の見積もりはモンテカルロシミュレーションによって集約される。
論文 参考訳(メタデータ) (2025-12-09T17:54:17Z) - Risk thresholds for frontier AI [1.053373860696675]
人気が高まっているアプローチの1つは、機能しきい値を定義することである。
リスク閾値は単に、どれだけのリスクが過剰かを記述するだけです。
主な欠点は、信頼性の高い評価が難しいことだ。
論文 参考訳(メタデータ) (2024-06-20T20:16:29Z) - CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models [46.93425758722059]
CRiskEvalは、大規模言語モデル(LLM)に固有のリスク確率を正確に計測するために設計された中国のデータセットである。
7種類のフロンティアリスクと4つの安全性レベルを持つ新たなリスク分類を定義する。
データセットは、事前に定義された7種類のフロンティアリスクに関連するシナリオをシミュレートする14,888の質問で構成されている。
論文 参考訳(メタデータ) (2024-06-07T08:52:24Z) - RiskQ: Risk-sensitive Multi-Agent Reinforcement Learning Value Factorization [49.26510528455664]
本稿では,リスクに敏感な個人・グローバル・マックス(RIGM)の原則を,個人・グローバル・マックス(IGM)と分散IGM(DIGM)の原則の一般化として紹介する。
RiskQは広範な実験によって有望な性能が得られることを示す。
論文 参考訳(メタデータ) (2023-11-03T07:18:36Z) - Efficient Risk-Averse Reinforcement Learning [79.61412643761034]
リスク逆強化学習(RL)では、リターンのリスク測定を最適化することが目標である。
特定の条件下では、これは必然的に局所最適障壁につながることを証明し、それを回避するためのソフトリスク機構を提案する。
迷路ナビゲーション,自律運転,資源配分ベンチマークにおいて,リスク回避の改善を示す。
論文 参考訳(メタデータ) (2022-05-10T19:40:52Z) - Risk Preferences of Learning Algorithms [0.0]
広く使われている学習アルゴリズムである$varepsilon$-Greedyは、突発的なリスク回避を示す。
このバイアスを修正する2つの方法について議論する。
論文 参考訳(メタデータ) (2022-05-10T01:30:24Z) - A Manifold View of Adversarial Risk [23.011667845523267]
本研究は,2種類の新しい対向リスク,通常の方向に沿った摂動による通常の対向リスク,多様体内の摂動による対向リスクについて検討する。
通常のリスクと人的リスクの両方がゼロであっても、標準的な敵のリスクはゼロである可能性があるという悲観的なケースを示します。
論文 参考訳(メタデータ) (2022-03-24T18:11:21Z) - Risk-Sensitive Reinforcement Learning: Near-Optimal Risk-Sample Tradeoff
in Regret [115.85354306623368]
本研究では,未知の遷移カーネルを持つマルコフ決定過程におけるリスク感応性強化学習について検討する。
確率的に効率的なモデルレスアルゴリズムとして、リスク感性価値反復(RSVI)とリスク感性Q-ラーニング(RSQ)を提案する。
RSVIが $tildeObig(lambda(|beta| H2) cdot sqrtH3 S2AT big) に達したことを証明しています。
論文 参考訳(メタデータ) (2020-06-22T19:28:26Z) - Mean-Variance Policy Iteration for Risk-Averse Reinforcement Learning [75.17074235764757]
割引無限地平線MDPにおけるリスク・アバース制御の枠組みを提案する。
MVPIは、政策評価方法やリスクニュートラル制御手法を棚から外すためのリスク・アバース制御に投入できる点において、非常に柔軟性がある。
この柔軟性は、リスク中立制御とリスク逆制御のギャップを減らし、新しい拡張MDPの開発によって達成される。
論文 参考訳(メタデータ) (2020-04-22T22:23:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。