論文の概要: Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs
- arxiv url: http://arxiv.org/abs/2604.16753v1
- Date: Fri, 17 Apr 2026 23:55:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 14:04:47.812543
- Title: Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs
- Title(参考訳): 技能を信頼する時を知る: シングルエージェントLDMの遅延評価と疫学的警戒
- Authors: Eren Unlu,
- Abstract要約: 本稿では,人間の認知制御を単一エージェントアーキテクチャに変換することに焦点を当てる。
遅延プロシージャプローブ機構の形式化とメタ認知スキルカードの導入により、MESA-Sはそのトークン集約実行からスキルユーティリティの認識を分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As large language models (LLMs) transition into autonomous agents integrated with extensive tool ecosystems, traditional routing heuristics increasingly succumb to context pollution and "overthinking". We argue that the bottleneck is not a deficit in algorithmic capability or skill diversity, but the absence of disciplined second-order metacognitive governance. In this paper, our scientific contribution focuses on the computational translation of human cognitive control - specifically, delayed appraisal, epistemic vigilance, and region-of-proximal offloading - into a single-agent architecture. We introduce MESA-S (Metacognitive Skills for Agents, Single-agent), a preliminary framework that shifts scalar confidence estimation into a vector separating self-confidence (parametric certainty) from source-confidence (trust in retrieved external procedures). By formalizing a delayed procedural probe mechanism and introducing Metacognitive Skill Cards, MESA-S decouples the awareness of a skill's utility from its token-intensive execution. Evaluated under an In-Context Static Benchmark Evaluation natively executed via Gemini 3.1 Pro, our early results suggest that explicitly programming trust provenance and delayed escalation mitigates supply-chain vulnerabilities, prunes unnecessary reasoning loops, and prevents offloading-induced confidence inflation. This architecture offers a scientifically cautious, behaviorally anchored step toward reliable, epistemically vigilant single-agent orchestration.
- Abstract(参考訳): 大規模言語モデル(LLM)が広範なツールエコシステムと統合された自律エージェントへと移行するにつれ、従来のルーティングヒューリスティックは、文脈汚染や「過度に考える」傾向にある。
ボトルネックはアルゴリズム能力やスキルの多様性の欠如ではなく、二階のメタ認知的ガバナンスの規律が欠如している、と我々は主張する。
本稿では,人間の認知制御の計算的変換,特に遅れた評価,エピステマティック・ビジャランス,および近位領域のオフロードを単一エージェントアーキテクチャへ変換することに焦点を当てる。
MESA-S(Metacognitive Skills for Agents, Single-Adnt)は,スカラー信頼度推定を,ソース信頼度から自己自信(パラメトリック確実性)を分離するベクトルに変換する予備的フレームワークである。
遅延プロシージャプローブ機構の形式化とメタ認知スキルカードの導入により、MESA-Sはそのトークン集約実行からスキルユーティリティの認識を分離する。
Gemini 3.1 Proでネイティブに実行されたIn-Context Static Benchmark評価に基づいて評価した結果,信頼性の保証と遅延エスカレーションがサプライチェーンの脆弱性を軽減し,不要な推論ループを突発し,オフロードによる信頼性インフレーションを防止することが示唆された。
このアーキテクチャは、科学的に慎重で、行動的に固定されたステップを、信頼性があり、懐疑的なシングルエージェントオーケストレーションに向けて提供します。
関連論文リスト
- The Cognitive Circuit Breaker: A Systems Engineering Framework for Intrinsic AI Reliability [0.0]
大規模言語モデル(LLM)は、ミッションクリティカルなソフトウェアシステムにますます多くデプロイされている。
本稿では,遅延のオーバーヘッドを最小限に抑えた本質的な信頼性監視を実現する,新しいシステムエンジニアリングフレームワークであるCognitive Circuit Breakerを提案する。
本稿では,認知的不協和の統計的に有意な検出,アーキテクチャに依存したout-of-Distribution(OOD)の一般化,およびこのフレームワークがアクティブな推論パイプラインに無視可能な計算オーバーヘッドを付加することを示す。
論文 参考訳(メタデータ) (2026-04-15T02:34:37Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Confidence-Based Response Abstinence: Improving LLM Trustworthiness via Activation-Based Uncertainty Estimation [7.3923284353934875]
本稿では,大規模言語モデル(LLM)出力の正しさと密接に一致したRAGシステムにおける信頼度推定手法を提案する。
提案手法は、生のフィードフォワードネットワーク(FFN)を自己回帰信号として活用することにより、事前の不確実性定量化手法を拡張した。
我々の結果は、アクティベーションに基づく信頼度モデリングが、信頼性の高いRAGデプロイメントへのスケーラブルでアーキテクチャを意識したパスを提供することを示した。
論文 参考訳(メタデータ) (2025-10-15T16:55:56Z) - Agentic Metacognition: Designing a "Self-Aware" Low-Code Agent for Failure Prediction and Human Handoff [0.0]
自律エージェントの非決定論的性質は信頼性の課題を示す。
二次的な「メタ認知」層は一次LCNC剤を活発に監視する。
人間のイントロスペクションにインスパイアされたこのレイヤは、差し迫ったタスクの失敗を予測するように設計されている。
論文 参考訳(メタデータ) (2025-09-24T06:10:23Z) - Aurora: Are Android Malware Classifiers Reliable and Stable under Distribution Shift? [51.12297424766236]
AURORAは、その信頼性と運用上のレジリエンスに基づいて、マルウェア分類器を評価するためのフレームワークである。
AURORAは、ポイント・イン・タイムのパフォーマンスを超えるように設計されたメトリクスのセットによって補完される。
さまざまなドリフトのデータセットにわたるSOTAフレームワークの脆弱性は、ホワイトボードへの復帰の必要性を示唆している。
論文 参考訳(メタデータ) (2025-05-28T20:22:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。