論文の概要: From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents
- arxiv url: http://arxiv.org/abs/2606.20661v1
- Date: Tue, 09 Jun 2026 17:17:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 20:32:07.190315
- Title: From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents
- Title(参考訳): 知識から行動へ: LLMエージェントの自己認識能力のベンチマーク
- Authors: Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King,
- Abstract要約: エージェントのメタ認知判断(Knowing)を自発的実行(Acting)から切り離して認知行動アライメントを評価するフレームワークであるKAPROを紹介する。
実験の結果,自己認識能力はタスク成功と強く相関するが,内部能力設定では著しく低下することがわかった。
プロプライエタリで推論指向のモデルは、より信頼性の高い認知ゲーティングを示します。
- 参考スコア(独自算出の注目度): 69.07911499189129
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The integration of external tools has transitioned LLM agents from passive responders to autonomous systems. However, current benchmarks prioritize execution success, neglecting self-awareness capability, the ability to discern whether a problem requires necessary external resources or can be solved via internal parametric knowledge. To address this, we introduce KAPRO (Knowing-Acting Quadrant PRObe), a framework that evaluates cognitive-behavioral alignment by decoupling an agent's metacognitive judgment (Knowing) from its spontaneous execution (Acting). We further construct KAware, a dataset rigorously partitioning tasks into external, internal, and hybrid subspaces to systematically probe these epistemic boundaries. Extensive experiments across diverse agent architectures show that self-awareness capability is strongly correlated with task success but degrades sharply in internal-capability settings. Moreover, open-source and instruction-following models exhibit stronger tool overuse due to shallow pattern matching, while proprietary and reasoning-oriented models demonstrate more reliable cognitive gating. Benchmark and codes are available at https://github.com/AI-Santiago/KAware.
- Abstract(参考訳): 外部ツールの統合により、LLMエージェントは受動的応答器から自律システムへと移行した。
しかし、現在のベンチマークは実行の成功を優先し、自己認識能力を無視し、問題が外部リソースを必要とするか、あるいは内部パラメトリック知識によって解決できるかを識別する能力を持っている。
そこで我々は,エージェントのメタ認知判断(知識)を,その自発的実行(行動)から切り離して認知行動アライメントを評価するフレームワークであるKAPRO(Knowing-Acting Quadrant PRObe)を紹介する。
さらに、これらの疫学的境界を体系的に調査するために、タスクを外部、内部、およびハイブリッドサブスペースに厳格に分割するデータセットであるKAwareを構築します。
多様なエージェントアーキテクチャにわたる大規模な実験により、自己認識能力はタスクの成功と強く相関するが、内部能力設定では著しく低下することが示された。
さらに、オープンソースおよび命令追従モデルでは、パターンマッチングが浅いため、ツールの過剰使用が強くなり、プロプライエタリおよび推論指向モデルはより信頼性の高い認知ゲーティングを示している。
ベンチマークとコードはhttps://github.com/AI-Santiago/KAware.comで公開されている。
関連論文リスト
- SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition [28.17858615204594]
Grounded Multimodal Named Entity Recognition (GMNER)は、名前付きエンティティを抽出し、画像とテキストのペア内で視覚領域をローカライズすることを目的としている。
オープンワールドのソーシャルメディアプラットフォームでは、GMNERは長い尾を持ち、急速に進化し、目に見えない存在であるため、依然として挑戦的だ。
本研究では、内部知識の活用と外部知識探索を調和させるエンドツーエンドのエージェントフレームワークであるSAKEを提案する。
論文 参考訳(メタデータ) (2026-04-22T03:17:36Z) - The Cognitive Circuit Breaker: A Systems Engineering Framework for Intrinsic AI Reliability [0.0]
大規模言語モデル(LLM)は、ミッションクリティカルなソフトウェアシステムにますます多くデプロイされている。
本稿では,遅延のオーバーヘッドを最小限に抑えた本質的な信頼性監視を実現する,新しいシステムエンジニアリングフレームワークであるCognitive Circuit Breakerを提案する。
本稿では,認知的不協和の統計的に有意な検出,アーキテクチャに依存したout-of-Distribution(OOD)の一般化,およびこのフレームワークがアクティブな推論パイプラインに無視可能な計算オーバーヘッドを付加することを示す。
論文 参考訳(メタデータ) (2026-04-15T02:34:37Z) - Why Cognitive Robotics Matters: Lessons from OntoAgent and LLM Deployment in HARMONIC for Safety-Critical Robot Teaming [2.779709069421631]
コンテンツ中心の認知アーキテクチャであるOntoAgentと戦術的リアクティブレイヤを組み合わせた,認知ロボティックなアーキテクチャであるHARMONICを提案する。
その結果、LCMは行動する前に自身の知識状態を常に評価しておらず、診断的推論や行動選択において下流の障害を引き起こすことが明らかとなった。
これらの知見は、認知アーキテクチャが推論の主要な権威を保持する物理的に具体化されたシステムの設計を支援する。
論文 参考訳(メタデータ) (2026-03-20T09:31:36Z) - Improving Chain-of-Thought for Logical Reasoning via Attention-Aware Intervention [4.584629831500306]
非インタラクティブなエンドツーエンドフレームワークは、モデル自体に推論が現れることを可能にする。
本研究は,数発のプロンプトに構造情報を導入することで,論理的推論演算子に整合したパターンのアテンションヘッドのサブセットを活性化することを示す。
本研究では,AAI(Attention-Aware Intervention)を提案する。AAI(Attention-Aware Intervention)は,その論理パターンによって認識される選択された頭部の注意点を重み付けする推論時間介入手法である。
論文 参考訳(メタデータ) (2026-01-14T19:10:10Z) - Agentic Knowledgeable Self-awareness [79.25908923383776]
KnowSelfはデータ中心のアプローチで、人間のような知識のある自己認識を持つエージェントを応用する。
我々の実験により、KnowSelfは、外部知識を最小限に使用して、様々なタスクやモデルにおいて、様々な強力なベースラインを達成できることが実証された。
論文 参考訳(メタデータ) (2025-04-04T16:03:38Z) - Interactive Agents to Overcome Ambiguity in Software Engineering [61.40183840499932]
AIエージェントは、あいまいで不明確なユーザー指示に基づいて、タスクを自動化するためにますますデプロイされている。
不安定な仮定をし、明確な質問をしないことは、最適以下の結果につながる可能性がある。
対話型コード生成設定において,LLMエージェントが不明瞭な命令を処理する能力について,プロプライエタリモデルとオープンウェイトモデルを評価して検討する。
論文 参考訳(メタデータ) (2025-02-18T17:12:26Z) - Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger [49.81945268343162]
我々は,外部ツール利用のための適応型意思決定戦略であるMeCoを提案する。
MeCoは、表現空間内の高レベル認知信号をキャプチャすることで、メタ認知スコアを定量化する。
MeCoは微調整不要で、最小限のコストがかかる。
論文 参考訳(メタデータ) (2025-02-18T15:45:01Z) - RCAgent: Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models [46.476439550746136]
近年,クラウド根本原因分析(RCA)における言語モデル (LLM) の適用が活発に検討されている。
RCAgentは、実用的でプライバシに配慮した産業RCA利用のためのツール強化LDM自律エージェントフレームワークである。
RCAgentはGPTファミリではなく、内部的にデプロイされたモデル上で動作し、フリーフォームのデータ収集とツールによる包括的な分析を行うことができる。
論文 参考訳(メタデータ) (2023-10-25T03:53:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。