論文の概要: The Answer Is Not the Argument
- arxiv url: http://arxiv.org/abs/2609.00264v1
- Date: Mon, 31 Aug 2026 19:06:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.017292
- Title: The Answer Is Not the Argument
- Title(参考訳): 答えは異議ではない
- Abstract要約: チェーンオブ思考監視はAI監視のために提案されているが、評価は、しばしば信頼できる参照回答を提供する。
回答アクセスが推論検証を改善するのか、それとも主に誤った結論を公開するのかを問う。
- 参考スコア(独自算出の注目度): 0.00897008283486962
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-thought monitoring is proposed for AI oversight, yet evaluations often provide monitors with a trusted reference answer. We ask whether answer access improves reasoning verification or mainly exposes incorrect conclusions. We collected 237 step-numbered solutions to 79 Humanity's Last Exam physics questions from three frontier models, with no inserted errors, and independently labelled final-answer correctness and the first false step. The reference standard combined physicist annotations, an independent LLM debate, and source-masked adjudication. This yielded 24 critical traces in which the answer was correct but the trace contained a genuine error. 8 LLM monitors evaluated traces blind, with an unverified or certified answer, or after a blind commitment. Certification raised mean balanced accuracy from 0.637 to 0.796, while exact first-error localization rose from 0.261 to 0.379. Certification changed recall (the fraction of error traces flagged as erroneous) from 0.653 to 0.951 on wrong-answer traces but from 0.521 to 0.438 on critical traces; the contrast had the same direction for all 8 monitors (question-bootstrap 95% CI [+0.256, +0.506]). After blind commitment, monitors shown the answer newly flagged 93.8% of previously passed wrong-answer traces as erroneous, but only 18.0% of critical traces. Answer access therefore improves conclusion-consistency checking rather than independent verification of the supporting argument. For AI safety, these traces provide a benign analogue of reward hacking: an acceptable output does not establish that the process producing it was sound. Although the errors studied here were ordinary and mostly non-load-bearing rather than adversarial, trusted-answer evaluations may similarly overstate monitoring capability when acceptable outputs conceal unsound reasoning.
- Abstract(参考訳): チェーンオブ思考監視はAI監視のために提案されているが、評価は、しばしば信頼できる参照回答を提供する。
回答アクセスが推論検証を改善するのか、それとも主に誤った結論を公開するのかを問う。
我々は、3つのフロンティアモデルから79のHumanityのLast Exam物理問題に対するステップ数237の解を抽出した。
参照標準は、物理学者のアノテーション、独立したLCM論争、およびソース・マズード・アジュディテーションを組み合わせたものである。
この結果、24個の重要な痕跡が得られ、その答えは正しかったが、その痕跡には真の誤りが含まれていた。
8のLSMモニターは、ブラインド、未確認または認定された回答、あるいはブラインドコミット後のトレースを評価した。
認証は平均平衡精度を0.637から0.796に引き上げ、最初のエラーの正確なローカライゼーションは0.261から0.379に上昇した。
認証はリコールを変更(誤りとしてフラグ付けされたエラートレースの割合)は、不正回答トレースでは0.653から0.951に、クリティカルトレースでは0.521から0.438に、コントラストは8つのモニタで同じ方向(クエクションブートストラップ95% CI [+0.256, +0.506])であった。
盲目のコミットメントの後、モニターは答えを新たに93.8%の誤った回答トレースが誤りであるとマークしたが、18.0%の臨界トレースしか表示しなかった。
したがって、回答アクセスは、支持する引数の独立した検証よりも、結論整合性チェックを改善する。
許容可能なアウトプットは、その生成プロセスが健全であることを保証するものではない。
ここで調べられた誤差は、敵対的ではなく、通常であり、ほとんど非負荷であるにもかかわらず、信頼度・回答評価は、許容される出力が不適切な推論を隠蔽した場合に、同様にオーバーステートな監視能力を示す可能性がある。
関連論文リスト
- The Model Proposes, the Code Disposes: A Pre-Registered Ablation of a Verifier-and-Acceptance Stage in an LLM-Orchestrated Offensive-Security Agent [0.0]
決定的コードによって検証が強制されるモデル検証装置である検証受理段階が、LCMが主導する攻撃セキュリティエージェントが報告するものを変更するかどうかを評価する。
本報告では,15回の探索パイロット,20回の予備登録検定アブレーション,および2回の故意に脆弱な検査対象を40回実施した2×2因子分析を行った。
検証者はシステムが提供するものを変更し、決定論的コードは強制と監査性を提供します。
論文 参考訳(メタデータ) (2026-09-14T17:13:05Z) - Decision Shifts, Lost Label Functionality, and an Inconclusive Grounding Audit in Correctness-Gated Multi-Teacher Distillation [0.0]
決定の正しさと根拠は異なる目的である。
固定実験において, 高精度多教師蒸留法について検討した。
未ろ過蒸留と比較して, 正度重み付きアームの精度は+0.1660。
論文 参考訳(メタデータ) (2026-09-09T04:39:56Z) - When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs [0.0]
多数決による自己整合性は、小命令チューニングモデルのGPQAダイアモンド問題において、プロブレム毎の精度を低下させる。
このバージョンでは、最も自然な修復も失敗し、v1が1つとして扱われた3つの信号障害を分離する。
論文 参考訳(メタデータ) (2026-08-11T20:08:51Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong [1.2744523252873352]
ブラックボックス(行動)によるFaithCoT-Benchの人間のアノテーションに対する不誠実なCoTの検出。
答えの正しさはあらゆるレベルで問題を構成する。
論文 参考訳(メタデータ) (2026-07-26T04:43:53Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring [1.0170129555792935]
802.11パケットキャプチャの診断には、専門家のプロトコル知識が必要で、遅く、エンジニア間で一貫性がなく、スケールできない。
LLMベースのアプローチは、キャプチャーから欠落するが製造されたプロトコルイベントを聴取し、未校正された信頼スコアを生成し、テスト中のモデルによって黄金の基準が共同生成されると評価バイアスを被る。
PROBEは3つの障害に対処する多段階パイプラインである。
論文 参考訳(メタデータ) (2026-06-05T03:39:58Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Tracing Uncertainty in Language Model "Reasoning" [46.61902399979181]
言語モデル(LM)は、一般的にChain-of-Thoughtまたはテストタイムスケーリングと呼ばれ、しばしばベンチマークのパフォーマンスを改善する。
本研究では,LMが生成する中間トークン列である「推論」トレースを進化的モデル状態として扱うことにより,これらのダイナミクスを考察する。
論文 参考訳(メタデータ) (2026-05-08T14:16:37Z) - The Verification Tax: Fundamental Limits of AI Auditing in the Rare-Error Regime [0.0]
最も引用されているキャリブレーションの結果は、CIFAR-100上での温度スケーリング後のECEの0.012は、統計的ノイズフロアより下である。
モデル誤差率のエプシロンによるキャリブレーション誤差を推定するミニマックスレートは Theta((Lepsilon/m)2/3) であり、推定器が打ち負かせない。
論文 参考訳(メタデータ) (2026-04-14T16:48:24Z) - SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio [0.038379177968040606]
言語モデル推論のための単一パス不確実性フレームワークであるSELFDOUBTを提案する。
私たちのキーシグナルであるHedge-to-Verify Ratio(HVR)は、推論トレースが不確実性マーカーを含むかどうかを検出し、もしそうであれば、明示的な自己チェック行動によってオフセットされているかどうかを検出する。
SELFDOUBTは単一の観測された推論軌道で動作し、任意のプロプライエタリなAPI上でのレイテンシとコスト制約によるデプロイメントに適している。
論文 参考訳(メタデータ) (2026-04-07T19:19:29Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。