論文の概要: How to Avoid Debate: Scalable AI Safety via Doubly-Efficient Interactive Proofs
- arxiv url: http://arxiv.org/abs/2607.03561v1
- Date: Fri, 03 Jul 2026 18:49:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.648926
- Title: How to Avoid Debate: Scalable AI Safety via Doubly-Efficient Interactive Proofs
- Title(参考訳): 議論を避ける方法:2倍効率のインタラクティブな証明によるスケーラブルなAI安全性
- Authors: Liyan Chen, Yael Tauman Kalai, Zoe Xi,
- Abstract要約: ディベートは、2つのAIモデルが同等の能力を持ち、そのうちの1つは真実であり、現実的ではないと仮定する。
私たちは、AIの安全性に関するエフェシンプルプロデューサのインタラクティブな証明の研究を開始します。
オラクル支援計算に対する2倍効率のシングルプロの対話的証明と議論を示す。
- 参考スコア(独自算出の注目度): 7.943115149662265
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As AI models continue to develop powerful capabilities, it becomes critical that we are able to verify that their output is aligned with our intentions. A recent line of work focuses on verification via debate, a model of interactive proofs where two competing powerful provers, or AI models, debate each other to convince a weak verifier, or a human, of the correctness of their claim. However, debate assumes that the two AI models possess equal abilities and that one of them is truthful, which may not be realistic. In this work, we show \emph{how to avoid debate}: we initiate the study of \emph{single-prover} interactive proofs for AI safety. Prior results in single-prover interactive proofs do not immediately carry over to the AI safety setting: for example, they do not work when the computation has access to an oracle, such as to human judgment or an external database such as the web. We present doubly-efficient single-prover interactive proofs and arguments for oracle-aided computations (also known as relativizing proofs), in the settings where (1) the computation is robust, in the sense that the output does not change if at most a small fraction of the answers to oracle queries are incorrect, or (2) the oracle is a low-degree polynomial. These results suggest that interactive verification is possible even without debate, under structured or noise-tolerant oracle access.
- Abstract(参考訳): AIモデルが強力な機能を開発し続けるにつれ、アウトプットが私たちの意図と一致していることを検証することが重要になります。
最近の研究は、2つの競合する強力なプロバー(AIモデル)が互いに議論し合い、弱い検証者(または人間)が彼らの主張の正しさを納得させる、インタラクティブな証明のモデルである、議論による検証に焦点を当てている。
しかし、議論は2つのAIモデルが同等の能力を持ち、そのうちの1つは真実であり、現実的ではないかもしれないと仮定している。
本稿では,AIの安全性に関する「emph{single-prover}」の対話的証明の研究を開始する。
例えば、計算が人間の判断やWebのような外部データベースなど、託宣にアクセスできる場合、それらは機能しない。
本稿では,(1) オラクルクエリに対する回答の少なくとも一部が誤りである場合,(2) オラクルが低次多項式である場合,その出力が変化しないような設定において,オラクル支援計算(相対性証明とも呼ばれる)に対する2倍効率のシングルプロデューサの対話的証明と引数を示す。
これらの結果から, 構造的, 耐雑音性を有するオラクルアクセス下では, 議論なく, 対話的検証が可能であることが示唆された。
関連論文リスト
- Ten Digits on a Train: AI-Assisted Verification of Two Eigenvalue Problems [0.0]
本稿では、そのような2つの計算に関する人間-AIコラボレーションについて報告する。
特異な自己随伴シュルディンガー作用素に対して、証明された零数とディリクレ=ノイマンブラケットは、完全な負スペクトルを10個の十進点に証明する。
微妙な非正規原子分子ベンチマークでは、以前は未解決の共鳴対が分離され、各部材は10桁に囲まれている。
論文 参考訳(メタデータ) (2026-06-22T18:03:59Z) - Characterizing initial human-AI proof formalization workflows [66.06866890889131]
AIシステムのコード生成能力の進歩と、証明を形式化し、検証する人々の能力を変えるための高度な数学的推論の約束への関与。
我々は、AIが人々のフォーマル化に与える影響について、混合メソッド分析を行う。
質的な調査では、人々の好みは多様であるが、形式化におけるAI支援に対する一般的な欲求が示されている。
論文 参考訳(メタデータ) (2026-06-02T22:58:19Z) - An alignment safety case sketch based on debate [3.2504831918078168]
提案された解決策の1つは、システムの出力の欠陥を議論を通じて指摘するために、別の超人的システムを活用することである。
本稿では,AIの安全性に関する議論の価値について概説する。
論文 参考訳(メタデータ) (2025-05-06T21:53:44Z) - On scalable oversight with weak LLMs judging strong LLMs [67.8628575615614]
我々は、2つのAIが1人の裁判官を納得させようとする議論、すなわち1人のAIが1人の裁判官を説得し、質問をする。
大規模言語モデル(LLM)をAIエージェントと人間の判断のためのスタンドインの両方として使用し、判断モデルがエージェントモデルよりも弱いと判断する。
論文 参考訳(メタデータ) (2024-07-05T16:29:15Z) - Are aligned neural networks adversarially aligned? [93.91072860401856]
敵のユーザは、アライメントの試みを回避できるインプットを構築できる。
既存のNLPベースの最適化攻撃は、整列したテキストモデルを確実に攻撃するには不十分であることを示す。
我々は、NLP攻撃の改善が、テキストのみのモデルに対して、同じレベルの逆制御を示す可能性があると推測する。
論文 参考訳(メタデータ) (2023-06-26T17:18:44Z) - The Who in XAI: How AI Background Shapes Perceptions of AI Explanations [61.49776160925216]
私たちは、2つの異なるグループ、つまりAIのバックグラウンドを持つ人々といない人たちの、異なるタイプのAI説明に対する理解について、混合手法による研究を行います。
その結果,(1) 両群は異なる理由から不合理な数に対する信頼を示し,(2) それぞれの群は意図した設計以上の異なる説明に価値を見出した。
論文 参考訳(メタデータ) (2021-07-28T17:32:04Z) - From Checking to Inference: Actual Causality Computations as
Optimization Problems [79.87179017975235]
本稿では、最適化問題として二元非巡回モデルよりも、因果推論の異なる概念を定式化するための新しいアプローチを提案する。
8000ドル以上の変数を持つモデルを用いて,MaxSAT が ILP を上回り,数秒単位でチェック処理を行う場合が多い。
論文 参考訳(メタデータ) (2020-06-05T10:56:52Z) - Debate Dynamics for Human-comprehensible Fact-checking on Knowledge
Graphs [27.225048123690243]
本稿では,議論力学に基づく知識グラフのファクトチェック手法を提案する。
基礎となる考え方は、2つの強化学習エージェント間の議論ゲームとして三重分類のタスクを設定することである。
提案手法では,知識グラフの対話的推論が可能であり,ユーザが追加の議論を提起したり,共通感覚推論や外部情報を考慮した議論を評価できる。
論文 参考訳(メタデータ) (2020-01-09T15:19:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。