論文の概要: Auditable Release Control for Pedagogical Leakage in LLM Tutors
- arxiv url: http://arxiv.org/abs/2608.00515v1
- Date: Sat, 01 Aug 2026 08:24:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.732303
- Title: Auditable Release Control for Pedagogical Leakage in LLM Tutors
- Title(参考訳): LLMチュータのペダゴジカルリークに対する可聴リリース制御
- Abstract要約: 大規模な言語モデルチューターは、その開示が承認される前に答えや決定的な推論を明らかにするのに役立ちます。
我々は、この状態および行動依存的障害を、教育的漏洩認識認可として定式化し、完全修復境界を導入する。
グローバルA1は0の多数と54のユーティリティフラグを獲得し、自動安全と実用性において適合Qを上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model tutors can be correct and helpful yet disclose an answer or decisive reasoning before that disclosure is authorized. We formalize this state- and action-dependent failure as pedagogical leakage and introduce an authorization-aware complete-mediation boundary. A selector emits one of five disclosure contracts, trusted policy gates privileged modes, and a renderer proposes language. A single release function applies inspectable checks, optional cumulative verification, and action-specific fallback; replayable traces separate selection, generation, verification, and enforcement failures. Matched component attribution exposes a safety-utility frontier. On 599 fixed Gemini 3.5 proposals, strict mediation reduces blinded three-model panel-majority leakage flags from 181 to 0 (paired problem-cluster difference -30.22 points, 95% CI [-35.00,-25.72]), while replacing 581 responses and lowering helpfulness. Checker-triggered fallback alone yields 11 majority flags; adding the semantic verifier yields 14 and no reliable marginal gain. A global A1 scaffold yields 0 majority and 54 any-judge flags, outperforming fitted Q on automatic safety and utility. In an externally timestamped replication over 40 unseen problem clusters and 480 attack sequences, high-assurance release reduces majority flags from 42 to 8 (-7.08 points, 95% CI [-13.13,-2.29]); seven failures persist, one is introduced, and mean helpfulness falls by .192. These results establish an auditable release boundary and failure attribution under declared contracts, not universal semantic safety or learning gains.
- Abstract(参考訳): 大規模な言語モデルチューターは、その開示が承認される前に答えや決定的な推論を明らかにするのに役立ちます。
我々は、この状態依存障害と行動依存障害を教育的漏洩として定式化し、認可対応の完全修復境界を導入する。
セレクタは、5つの公開契約のうちの1つを発行し、信頼されたポリシーゲートは特権モードを発行し、レンダラーは言語を提案する。
単一のリリース関数は、インスペクタブルチェック、オプションの累積検証、アクション固有のフォールバックを適用している。
一致したコンポーネント属性は、安全ユーティリティフロンティアを公開する。
599年のGemini 3.5の提案では、厳格な調停によりブラインドされた3モデルパネル・マジョリティのリークフラグが181から0(問題クラスタの差-30.22点、95%CI [-35.00,-25.72])まで減少し、581の応答を置き換え、補助力を低下させた。
チェッカートリガーされたフォールバックだけで11個のフラグが得られ、セマンティック検証が14となり、信頼性のあるマージンゲインが得られない。
グローバルなA1足場は0の多数と54の非ジャッジフラグを獲得し、自動安全と実用性において適合Qを上回っている。
40の未確認問題クラスタと480の攻撃シーケンスにまたがる外部のタイムスタンプによるレプリケーションでは、ハイアサランスリリースは、多数派フラグを42から8に削減する(7.08ポイント、95% CI [-13.13,-2.29])。
これらの結果は、普遍的なセマンティック安全性や学習利益ではなく、宣言された契約の下で、監査可能なリリースバウンダリと失敗への帰結を確立します。
関連論文リスト
- Engineering Reliable Commit Gates for Agentic AI: Cost-Aware Verification Portfolios under Common-Mode Data Failures [4.287745257410248]
コスト対応コミットゲートのランタイム保証ベンチマークを提案する。
48のタスクテンプレートは、6つの障害レジームで2,880のシナリオを生成する。
結果は明確なエビデンスライン、コストアウェアの選択、コミットタイムの実施を動機付けます。
論文 参考訳(メタデータ) (2026-09-10T01:42:40Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI [0.152292571922932]
SAGEは安全第一、認可分離アーキテクチャである。
署名されたリリースマニフェスト、多様な検知器、堅牢なリスクエンベロープ、最小リスクデフォルト、アウトプットチェック、保護された監査チェーン、封じ込め、ロールバックを組み合わせる。
正式な結果は、安全性の優先、保守的な検出器境界、モノトーン放出ゲーティング、タンパー証拠記録、認可カットを確立する。
論文 参考訳(メタデータ) (2026-07-24T21:36:28Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Hallucination as Exploit: Evidence-Carrying Multimodal Agents [10.441697487723568]
マルチモーダルエージェントはますます、スクリーンショットやドキュメント、Webページからツールコールを選択している。
本稿では,自由形式モデルテキストを不許容な証拠として扱うエビデンス搬送型マルチモーダルエージェント(ECA)を提案する。
ECAは不透明なモデルの信念を検証者、スキーマ、実装レベルで監査可能な残留物に変換する。
論文 参考訳(メタデータ) (2026-05-18T23:40:43Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation [6.604874054866016]
本稿では,証拠満足度がセットレベル特性であることを示す,透過的なアグリゲーションプロトコルSURE-RAGを提案する。
共有ペアレベルのクレームエビデンス検証器は、SURE-RAGが集約した局所的関係分布を解釈可能な応答レベル信号に生成する。
制御されたマルチホップベンチマークであるHotpotQA-RAG v3をアーティファクト・アウェア・プロトコルで評価した。
論文 参考訳(メタデータ) (2026-05-05T09:05:40Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。