論文の概要: Safety from Honesty in a Disinterested AI Predictor
- arxiv url: http://arxiv.org/abs/2606.29657v1
- Date: Sun, 28 Jun 2026 23:55:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.999847
- Title: Safety from Honesty in a Disinterested AI Predictor
- Title(参考訳): 興味をそそられたAI予測器における正直からの安全
- Abstract要約: AIシステムがより有能になるにつれて、下流の結果を最適化するトレーニング手順は、暗黙のエージェンシーを導入するリスクを負う。
本稿では,Science AI (SAI) 予測器の安全性に関する公式な議論を行う。
このような予測者は、目標を達成するためにアウトプットを選択するエージェントでなくても、エージェント、アクション、そしてそれらの結果を正直に予測できる、と我々は主張する。
- 参考スコア(独自算出の注目度): 35.35019968815501
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As AI systems become more capable, training procedures that optimize for downstream outcomes risk introducing implicit agency: goal-directed behavior that designers never specified. We present a formal safety argument for the Scientist AI (SAI) Predictor, trained to approximate the Bayesian posterior conditioned on a dataset of "epistemically contextualized" natural-language statements. We argue that such a Predictor can honestly predict agents, actions, and their consequences without itself being an agent that selects outputs to achieve goals. This rests on data representation and on the training procedure. Epistemic contextualization of text distinguishes latent factual claims from communication acts, so expressions of goals are treated as evidence to be explained rather than drives the model adopts. With a posterior-seeking training objective, this is intended to drive the Predictor toward calibrated, cautious predictions. Training proceeds so downstream effects of deploying a prediction never serve as a reward signal; any agency the system needs is supplied by explicit scaffolding constrained by guardrails. We prove that, under assumptions on the training dynamics and on the argued sparsity of dangerous Predictors, the probability that training produces a Predictor whose guarded deployment carries residual harm above a specified threshold is small: a dangerous Predictor would have to underestimate harm in a coordinated way across many queries while such coordinated patterns are rare under the initialization distribution and receive no direct training signal. Safety and accuracy are jointly supported in this framework, since the constraints that secure accuracy are the same ones that make coordinated deception costly. These guarantees against misalignment and agency arising from within the Predictor itself do not preclude the use of the Predictor as part of an agentic system.
- Abstract(参考訳): AIシステムがより有能になるにつれて、下流の結果を最適化するトレーニング手順は、暗黙のエージェンシーを導入するリスクを負う。
我々は,Science AI (SAI) Predictorに対して,自然言語文のデータセットに基づくベイズ的後続条件を近似する訓練を行った。
このような予測者は、目標を達成するためにアウトプットを選択するエージェントでなくても、エージェント、アクション、そしてそれらの結果を正直に予測できる、と我々は主張する。
これはデータ表現とトレーニング手順に依存します。
テキストの認識的文脈化は、潜在的な事実的主張とコミュニケーション行為を区別するので、目的の表現は、モデルが採用するよりも説明すべき証拠として扱われる。
後部探索訓練の目的により、これは予測器を校正され慎重な予測へと駆り立てることを目的としている。
トレーニングは下流での予測の展開による効果が報奨信号として機能しないため、システムに必要ないかなる機関もガードレールによって拘束された明示的な足場によって供給される。
トレーニング力学や危険な予測器の空間性について仮定すると、特定のしきい値を超える残留的な危害をもたらす予測器を生成する確率は小さく、危険な予測器は、多くのクエリをまたいで協調的に危害を過小評価しなければならないが、そのような調整されたパターンは初期化分布下では稀であり、直接の訓練信号を受けない。
安全性と正確性はこのフレームワークで共同でサポートされている。
これらの保証は、予測者内部から生じる不一致及び機関に対する保証は、エージェントシステムの一部としての予測者の使用を妨げない。
関連論文リスト
- When to Answer and When to Defer: A Decision Framework for Reliable Code Predictions [11.136449698197174]
この作業では、不確実性推定、モデルのキャリブレーション、およびコードモデルに対するツールベースの禁忌処理を統合する統一的なフレームワークを導入している。
提案設計では,信頼性の高い正当性確率を割り当てたり,不確実性の下で不確実性を排除したり,不確実性のあるケースを処理するための軽量なプログラム解析手順を実行することができる。
論文 参考訳(メタデータ) (2026-05-19T05:04:42Z) - Rethinking Gaussian Trajectory Predictors: Calibrated Uncertainty for Safe Planning [4.546517638153619]
既存の軌道予測器は主に負の対数的損失に依存しており、これは過度あるいは過度に信頼される分布を予測しがちである。
本稿では,予測の不確実性を校正する新たな損失関数を提案する。
提案手法は,異なる状態領域のガウス軌道予測器によって予測される信頼度の信頼性を著しく向上することを示す。
論文 参考訳(メタデータ) (2026-03-11T04:42:49Z) - Epistemic Reject Option Prediction [6.531546527140475]
高精度なアプリケーションでは、予測モデルは正確な予測を生成するだけでなく、その不確実性を定量化し、伝達する必要がある。
Reject-option 予測は、予測の不確実性が高い場合にモデルを停止させることによってこの問題に対処する。
これは、トレーニングデータが不十分な入力を識別し、信頼できる判断を下すことができる、最初の原則付きフレームワークである。
論文 参考訳(メタデータ) (2025-11-06T22:39:21Z) - Preliminary Investigation into Uncertainty-Aware Attack Stage Classification [81.28215542218724]
この研究は、不確実性の下での攻撃段階推論の問題に対処する。
Evidential Deep Learning (EDL) に基づく分類手法を提案し、ディリクレ分布のパラメータを可能な段階に出力することで予測の不確実性をモデル化する。
シミュレーション環境における予備実験により,提案モデルが精度良く攻撃の段階を推定できることが実証された。
論文 参考訳(メタデータ) (2025-08-01T06:58:00Z) - Confidential Guardian: Cryptographically Prohibiting the Abuse of Model Abstention [65.47632669243657]
不正直な機関は、不確実性の観点からサービスを差別または不正に否定する機構を利用することができる。
我々は、ミラージュと呼ばれる不確実性誘導攻撃を導入することで、この脅威の実践性を実証する。
本研究では,参照データセット上のキャリブレーションメトリクスを分析し,人工的に抑制された信頼度を検出するフレームワークであるConfidential Guardianを提案する。
論文 参考訳(メタデータ) (2025-05-29T19:47:50Z) - Robust Conformal Prediction Using Privileged Information [17.886554223172517]
本研究では,トレーニングデータの破損に対して堅牢な,保証されたカバレッジ率で予測セットを生成する手法を開発した。
我々のアプローチは、i.d仮定の下で有効となる予測セットを構築するための強力なフレームワークである共形予測に基づいている。
論文 参考訳(メタデータ) (2024-06-08T08:56:47Z) - PreCurious: How Innocent Pre-Trained Language Models Turn into Privacy Traps [13.547526990125775]
我々は,攻撃者が事前訓練したモデルをリリースする新たな攻撃面を明らかにするために,PreCuriousフレームワークを提案する。
PreCuriousは、メンバーシップ推論とデータ抽出の両方の一般的なプライバシーリスクを微調整データセット上でエスカレートすることを目的としている。
論文 参考訳(メタデータ) (2024-03-14T16:54:17Z) - Certifiers Make Neural Networks Vulnerable to Availability Attacks [70.69104148250614]
私たちは初めて、逆転戦略が敵によって意図的に引き起こされる可能性があることを示します。
いくつかの入力や摂動のために自然に発生する障害に加えて、敵は故意にフォールバックを誘発するために訓練時間攻撃を使用することができる。
我々は2つの新しいアベイラビリティーアタックを設計し、これらの脅威の実用的妥当性を示す。
論文 参考訳(メタデータ) (2021-08-25T15:49:10Z) - Learning Uncertainty For Safety-Oriented Semantic Segmentation In
Autonomous Driving [77.39239190539871]
自律運転における安全クリティカル画像セグメンテーションを実現するために、不確実性推定をどのように活用できるかを示す。
相似性関数によって測定された不一致予測に基づく新しい不確実性尺度を導入する。
本研究では,提案手法が競合手法よりも推論時間において計算集約性が低いことを示す。
論文 参考訳(メタデータ) (2021-05-28T09:23:05Z) - Heterogeneous-Agent Trajectory Forecasting Incorporating Class
Uncertainty [54.88405167739227]
本稿では,エージェントのクラス確率を明示的に組み込んだヘテロジニアスエージェント軌道予測手法であるHAICUを提案する。
さらに,新たな挑戦的な実世界の自動運転データセットであるpupも紹介する。
軌道予測にクラス確率を組み込むことで,不確実性に直面した性能が著しく向上することを示す。
論文 参考訳(メタデータ) (2021-04-26T10:28:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。