論文の概要: Callability Is Not Operability: Controlled Interface Interventions for LLM Agents
- arxiv url: http://arxiv.org/abs/2608.23628v1
- Date: Sun, 23 Aug 2026 07:13:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.429281
- Title: Callability Is Not Operability: Controlled Interface Interventions for LLM Agents
- Title(参考訳): コールビリティは操作性ではない - LLMエージェントのインタフェース介入制御-
- Abstract要約: 我々は,エージェントが操作上の不確実性の下で安全に継続するために必要なアクション関連状態と意味をツールインターフェースが公開するかどうかを検討する。
我々は,エージェントファーストツーリング(AFT)によるツールの操作性,選択的機能発見,実行ライフサイクルとリカバリ,明示的な外部効果セマンティクス,マシン可読結果,および後条件検証を対象とするインターフェース機構のセットを運用する。
- 参考スコア(独自算出の注目度): 21.5112880944537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A tool call can be perfectly valid yet still leave an autonomous agent unable to determine what to do next. For example, if an external effect commits but its response is lost, committed and uncommitted states may become indistinguishable to the agent even though they require different continuation actions. We study this gap between callability and operability: whether a tool interface exposes the action-relevant state and semantics needed for an agent to continue safely under operational uncertainty. We operationalize tool operability through Agent-First Tooling (AFT), a set of interface mechanisms spanning selective capability discovery, execution lifecycle and recovery, explicit external-effect semantics, machine-readable results, and postcondition verification. We introduce AFT-Bench, a controlled interface-intervention framework that holds the task, backend, initial state, injected failure, agent, and language model fixed while varying the interface exposed to the agent.
- Abstract(参考訳): ツールコールは完全に有効だが、自律的なエージェントが次に何をすべきかを判断できないままだ。
例えば、外部効果がコミットされるが、その応答が失われると、コミットされた状態とコミットされていない状態は、異なる継続アクションを必要とするにもかかわらず、エージェントに区別不能になる可能性がある。
ツールインターフェースがエージェントに必要なアクション関連状態とセマンティクスを公開するかどうかを,運用上の不確実性の下で安全に継続する。
我々は,エージェントファーストツーリング(AFT)によるツールの操作性,選択的機能発見,実行ライフサイクルとリカバリ,明示的な外部効果セマンティクス,マシン可読結果,および後条件検証を対象とするインターフェース機構のセットを運用する。
AFT-Benchは、タスク、バックエンド、初期状態、インジェクションされた障害、エージェント、言語モデルを保持し、エージェントに露出したインターフェースを変更しながら修正する、制御されたインターフェイスインターベンションフレームワークである。
関連論文リスト
- When Tool Calls Succeed but Workflows Fail: Anomalies at the Agent-Tool Boundary [0.0]
再試行、投機的実行、部分的な障害の下では、結果の外部状態はワークフローの意図した解決と矛盾する可能性がある。
高度なトランザクションモデルは関連する障害に対処するが、下位レベルの操作が依存するセマンティクスを公開すると仮定する。
本研究では,外界における事象をランタイムの観測から切り離すエフェクト・ヒストリー・モデルと,連続する8つの外部効果異常のカタログをコントリビュートする。
論文 参考訳(メタデータ) (2026-09-14T11:31:06Z) - Agent-Integrated Software: Interaction Contracts and Continuous Assurance [14.374598285839275]
信頼性のある統合には、タスクレベルのインタラクションとアプリケーションの振る舞いを明確に対応する必要があります。
本稿では,エージェント・インテグレート・ソフトウェア(AIS)を,従来のコア,ダイレクトインタラクション,組込みエージェントを組み合わせたソフトウェアパターンとして紹介する。
この視点は、アプリケーションの抽象化、開発サポート、制御された実行、品質評価、そして人間の監督にまたがる研究課題を発展させます。
論文 参考訳(メタデータ) (2026-09-10T11:17:19Z) - ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents [56.187590188698955]
大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-03T12:52:04Z) - Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures [0.0]
現実世界のシステムは、ディスパッチ後のタイムアウト、遅延可視性、部分的な状態更新など、非原子的な振る舞いを示す。
これらのミスマッチは、重複アクション、タスク成功、不要なツール実行などの信頼性の問題を引き起こす。
ライトウェイトで検証対応のツールラッパーが導入されており、ツールコールをポストコンディション検証、バリデーション前ロジック、イデオロケーションキーで拡張する。
論文 参考訳(メタデータ) (2026-07-31T16:16:14Z) - ToolGuardian: Declarative Security for AI Agent-Tool Interactions [0.0]
既存の防衛は、弱いメタデータ、崩壊特性、および政策判断に依存している。
本稿では,エージェントとツールのインタラクションをセキュアにするためのポリシー駆動型フレームワークであるToolGuardianを提案する。
論文 参考訳(メタデータ) (2026-07-23T21:53:34Z) - Beyond the Black Box: Interpretability of Agentic AI Tool Use [0.0]
本稿では,スパースオートエンコーダと線形プローブ上に構築された機械論的・解釈可能性ツールキットを提案する。
フレームワークは各アクションの前にモデル状態を読み出し、ツールが必要かどうか、そして次のツールアクションがいかに適切かの両方を推測する。
我々は、NVIDIA Nemotron関数呼び出しデータセットから多段階の軌道上のプローブをトレーニングし、GPT-OSS 20BとGemma 3 27Bモデルに同じワークフローを適用する。
論文 参考訳(メタデータ) (2026-05-07T19:47:30Z) - Hybrid Inspection and Task-Based Access Control in Zero-Trust Agentic AI [4.092829002386613]
侵入されたまたは悪意のあるエージェントアプリケーションは、ツールコールを改ざんしたり、結果を偽造したり、対象の意図したタスクの範囲を超えて許可を求めることができる。
本稿では,ゼロトラスト・インターセプション・レイヤによって実現される決定論的および意味論的制御を組み合わせた,ハイブリッド・ランタイム実行モデルを提案する。
タスクに関連性のある非関連ツールコールを含むマルチターンインタラクションを備えた対話ツールデータセットを新たに生成する。
論文 参考訳(メタデータ) (2026-05-04T15:00:37Z) - ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Intrinsic Adaptation [60.25542764389203]
LLM(Large Language Models)を利用したエージェントシステムは、複雑で長期のタスクに対処する上で、顕著な可能性を示している。
既存のアプローチでは、手動のオーケストレーションやランタイムベースのパッチを頼りにしており、一般化の貧弱さと最適化の断片化に悩まされることが多い。
ツール駆動の自己修正を可能にする新しいパラダイムであるToolSelfを提案する。
論文 参考訳(メタデータ) (2026-02-08T09:27:18Z) - Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning [58.432996881401415]
最近の作業では、エージェント推論を可能にするために、外部ツールで大きな言語モデル(LLM)を拡張している。
本稿では,入力プロンプトを書き換えることのみでエージェント推論を妨害するスポンジツールアタック(STA)を提案する。
STAは、意味的忠実度の高い原文からの良心的な即興的な書き直しを生成する。
論文 参考訳(メタデータ) (2026-01-24T19:36:51Z) - The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution [63.61358761489141]
LLM(Large Language Model)ベースのエージェントは、カスタマーサービス、Webナビゲーション、ソフトウェアエンジニアリングといった現実世界のアプリケーションで広く使われている。
本稿では,タスク結果に関係なく,エージェントの動作を駆動する内部要因を識別する,テキスト汎用エージェント属性のための新しいフレームワークを提案する。
標準ツールの使用やメモリ誘起バイアスのような微妙な信頼性リスクなど、さまざまなエージェントシナリオでフレームワークを検証する。
論文 参考訳(メタデータ) (2026-01-21T15:22:21Z) - Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval [49.85856484781787]
本稿では,ILMエージェントを検索プロセスのアクティブマニピュレータに高める新しいパラダイムであるInteract-RAGを紹介する。
我々は、ゼロショット実行と相互作用軌跡の合成を可能にする推論強化ワークフローを開発する。
6つのベンチマーク実験により、Interact-RAGは他の高度な手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2025-10-31T15:48:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。