論文の概要: From Neural Network Decisions to Training Cases: An Exact Account via Case-Based Decision Theory
- arxiv url: http://arxiv.org/abs/2607.11347v1
- Date: Mon, 13 Jul 2026 10:08:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.424686
- Title: From Neural Network Decisions to Training Cases: An Exact Account via Case-Based Decision Theory
- Title(参考訳): ニューラルネットワーク決定から訓練事例へ:事例ベース決定理論による厳密な説明
- Abstract要約: 固定されたニューラル表現に装着したOLSアクションの読み出しは、正確なケースベース分解を許容することを示す。
この分解は、トレーニングケースにスコアをトレースする監査信号を生成し、アクションコヒーレンスを測定し、弱いサポートを識別する。
- 参考スコア(独自算出の注目度): 2.394494660847436
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Neural networks increasingly guide decisions in high-stakes domains such as medical diagnosis, credit approval, and energy bidding. Audit in these settings requires case-level evidence: which training cases support an action and what outcomes they carried. Case-based decision theory (CBDT) formalizes this reasoning by aggregating outcome support from remembered cases. We show that an OLS action readout fitted on a fixed neural representation admits an exact case-based decomposition. Each action score is a weighted sum of training-case returns, with coefficients determined by empirical Gram geometry. We identify a sufficient regime for CBDT similarity semantics; outside it, the coefficients should generally be treated as signed Gram-geometric influence. The decomposition yields audit signals that trace scores to training cases, measure action coherence, and identify weak support. Across synthetic CBDT, PJM, Adult Income, and Default Credit tasks, the method recovers case-level preference structure and achieves the highest mean Top-30 consistency among compared attribution baselines, while remaining competitive on support reconstruction. The audit requires only fitting an OLS top-layer probe, without retraining the representation or accessing the original optimization trajectory; probe fidelity is measured by score reconstruction.
- Abstract(参考訳): ニューラルネットワークは、医療診断、信用承認、エネルギー入札といった高額な領域での意思決定をますます導く。
これらの設定の監査には、どのトレーニングケースがアクションをサポートし、どのような結果をもたらすかというケースレベルの証拠が必要です。
事例ベース意思決定理論(CBDT)は、記憶された事例からの成果支援を集約することで、この推論を定式化する。
固定されたニューラル表現に装着したOLSアクションの読み出しは、正確なケースベース分解を許容することを示す。
各アクションスコアはトレーニングケースリターンの重み付けされた総和であり、経験的グラム幾何学によって係数が決定される。
我々はCBDT類似性セマンティクスの十分な規則を特定し、その外部では、係数は一般に符号付きグラム幾何学的影響として扱われるべきである。
この分解は、トレーニングケースにスコアをトレースする監査信号を生成し、アクションコヒーレンスを測定し、弱いサポートを識別する。
CBDT,PJM,アダルト・インカム,デフォールト・クレジットのタスク全体にわたって,提案手法はケースレベルの選好構造を回復し,属性ベースラインの上位30の一貫性を達成しつつ,サポートリコンストラクションの競争力を維持した。
オーディションでは,表象を調整したり,元の最適化軌道にアクセスしたりすることなく,OLS上層プローブのみを適合させることが求められ,プローブの忠実度はスコア再構成によって測定される。
関連論文リスト
- Gated Decoupled Compositional Bandits: A Unified Theory of Contextual Bandits with Supervised-Calibrated Action Scaling and Pre-Execution Gating [0.0]
GDCB(Gated Decoupled Compositional Bandits)
GDCBは3つの構造的革新を持つ文脈的バンディットアルゴリズムのファミリーである。
このアルゴリズムのクラスを形式化し、その統計的挙動を特徴づける4つの構造定理を証明する。
論文 参考訳(メタデータ) (2026-08-22T14:58:25Z) - More Data, Worse Decisions? Preference Reversals in Neural Networks under Gram Incompatibility [9.196757973061198]
ケースベース決定理論(CBDT)は、その構成公理を通じて要求を定式化する。
この特性が、通常最小二乗(OLS)出力ヘッドを持つ固定表現ニューラルネットワークに対していつ保持されるかを検討する。
意思決定からタスク定義ユーティリティ損失まで、厳密なペアの逆転をトレースする3段階の監査を開発する。
論文 参考訳(メタデータ) (2026-07-28T18:52:47Z) - Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training [30.22002300048916]
大規模言語モデルテストタイムトレーニング(TTT)は、しばしばローカルプロキシメトリクスによって評価される。
TTTメモリを校正する行動評価フレームワークを導入する。
論文 参考訳(メタデータ) (2026-07-01T03:07:17Z) - Process-Verified Reinforcement Learning for Theorem Proving via Lean [47.294932573003756]
リーン証明アシスタント自体が、象徴的なプロセスのオラクルとして機能できることを示します。
LeanLeanとDeepSeek-V1.5の実験によると、戦術レベルの監視は、ほとんどの設定で結果のみのベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-18T10:40:55Z) - BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation [51.22170603236523]
幻覚緩和のためのバランスドトークンレベルの政策最適化フレームワークを提案する。
BalTOはチェック可能な事実クレームを抽出し、参照コンテキストに対して検証し、トークンレベルのラベルに対するクレームレベルの判断をプロジェクトする。
ConFiQA、RAGTruth、FinLLM-Evalの実験では、BALTOは6つのモデルで最高の忠実さを達成している。
論文 参考訳(メタデータ) (2026-06-14T16:25:59Z) - RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards [76.17893114021757]
長い形式のレポートを計画し、調査し、エビデンスを評価し、合成する深層研究システムには、根本的な答えがなく、多くのツール強化された決定にまたがる。
本研究では,ルーブリックは最終回答評価者だけでなく,ポリシーの実行,判断フィードバック,エージェントメモリを構成する共有インターフェースとして機能すべきである,と論じる。
我々は、段階的な政策分解とリフレクションに基づくメタ政治進化を組み合わせたルーリック誘導強化学習フレームワークEMを導入する。
論文 参考訳(メタデータ) (2026-05-11T17:40:38Z) - Reasoning Provenance for Autonomous AI Agents: Structured Behavioral Analytics Beyond State Checkpoints and Execution Traces [0.0]
Agent Execution Record (AER) は構造化された推論プリミティブであり、すべてのステップで第一級クエリ可能なフィールドとしてインテント、観察、推論をキャプチャする。
AERが集団レベルの行動分析を可能にする方法を示す: 推論パターンマイニング、信頼度校正、クロスエージェント比較、モックリプレイによる反事実回帰テスト。
論文 参考訳(メタデータ) (2026-03-23T08:27:54Z) - The Emergence of Lab-Driven Alignment Signatures: A Psychometric Framework for Auditing Latent Bias and Compounding Risk in Generative AI [0.0]
本稿では,不確実性の下での潜在特性推定を定量化する新しい監査フレームワークを提案する。
この研究は最適化バイアス、Sycophancy、Status-Quo Legitimizationを含む9つの次元にわたる主要なモデルを監査している。
論文 参考訳(メタデータ) (2026-02-19T06:56:01Z) - APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards [61.52322047892064]
テスト時間スケーリング(TTS)は、Large Reasoning Models(LRM)の機能を大幅に強化した。
我々は, LRM が推論過程において最終回答を得た後も, 再検討なしに反復的自己検証を頻繁に行うことを観察した。
本稿では,Anchor-based Process Reward (APR)を提案する。
論文 参考訳(メタデータ) (2026-01-31T14:53:20Z) - Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning [14.632557283678898]
検証可能なプロセスリワードモデル(VPRM)は、中間推論ステップを決定論的、ルールベースの検証によってチェックする強化学習フレームワークである。
医療エビデンス合成のためのリスク・オブ・バイアス評価にVPRMを適用した。
その結果、VPRMは最先端モデルよりも20%高いF1、検証可能な結果報酬より6.5%高いF1を達成することがわかった。
論文 参考訳(メタデータ) (2026-01-23T23:22:20Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning [52.144281362465996]
本稿では,強化学習を長期シナリオに適用するためのEAPO(Evidence-Augmented Policy Optimization)を提案する。
最初にEvidence-Augmented Reasoningパラダイムを確立し、Tree-Structued Evidence Smplingを介して検証する。
次に、報酬モデルがグループ相対エビデンス・リワードを計算する特殊なRLアルゴリズムを導入する。
トレーニングを通して正確な監視を維持するため、適応的リワード・ポリティ共進化機構をさらに取り入れる。
論文 参考訳(メタデータ) (2026-01-15T11:40:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。