論文の概要: Empty Commitments: When Agents Promise What Their Runtime Cannot Deliver
- arxiv url: http://arxiv.org/abs/2610.01045v1
- Date: Thu, 01 Oct 2026 04:37:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.89563
- Title: Empty Commitments: When Agents Promise What Their Runtime Cannot Deliver
- Title(参考訳): Emptyのコミット: エージェントがランタイムが提供できないことを約束する時
- Abstract要約: 私たちはそのような約束を空の約束と呼ぶ。
壊れた約束とは異なり、その空白はエージェントの構成だけで従う。
次に、測定プロトコルを記述します。
- 参考スコア(独自算出の注目度): 5.666793530582859
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A chatbot that says "I will remind you tomorrow" will not run again until the user writes. We call such a promise an empty commitment: a promise of an action after the current turn that nothing in the agent's tools or runtime can carry out. Unlike a broken promise, its emptiness follows from the agent's configuration alone; no later trajectory is needed. We define empty commitments on top of commitment semantics, with three failure types, an anchoring condition for promises that a tool could make real, and a response-level outcome taxonomy. We then describe a measurement protocol: follow-up requests run in five setups that add one persistence affordance at a time, with the environment either left implicit or stated.
- Abstract(参考訳): と書かれたチャットボットは、ユーザーが書くまで再び実行されない。
エージェントのツールやランタイムには何も実行できない、現在のターン後のアクションの約束です。
壊れた約束とは異なり、その空さはエージェントの構成だけで従う。
コミットメントセマンティクスの上に空のコミットメントを定義します。3つの失敗タイプ、ツールが現実にできるという保証のアンカー条件、レスポンスレベルの結果の分類です。
フォローアップリクエストは5つのセットアップで実行され、一度に1つの永続化能力が追加されます。
関連論文リスト
- StateComp: Learning When to Compress History in Long Horizon Agents [55.84813053778976]
本研究では,現在エージェントの状態に応じて過去のインタラクションを安全に圧縮できるフレームワークであるState Conditioned Compression(StateComp)を提案する。
WorkBenchBuddyの実験では、StateCompはタスク性能を維持しながら総エージェントと要約トークンを52.27%削減し、表現抽出において12.67倍の高速化を実現している。
論文 参考訳(メタデータ) (2026-09-23T03:34:08Z) - Five Primitives for Governing Autonomous AI Agents at Runtime [0.0]
自律的なAIエージェントの管理は問題であり、モデルアライメントの問題ではない、と私たちは主張する。
行動を起こす前に答えなければならない質問から5つのプリミティブを導き出す。
エージェントのアクションが実行前にポリシーに対して媒介される実装について述べる。
論文 参考訳(メタデータ) (2026-08-27T06:53:11Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - Stale Does Not Mean Unsafe: Guard Precision for Tool-Using LLM Agents under Infrastructure State Races [4.287745257410248]
ツールを使用する言語モデルエージェントは、スケジューラ、データパイプライン、オブジェクトストア、アクセス制御システムを変更する傾向にある。
我々は、宣言された安全規定を破る無効化レースを、述語保存と無関係なレースから分離し、ランタイムガードがそれらを正確に区別するかを問う。
我々の決定論的シミュレータは、信頼できる状態から可視的に分離し、4つの領域の16のインフラストラクチャータスクに5つの非原子的障害機構を注入する。
論文 参考訳(メタデータ) (2026-08-25T04:53:33Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - AgentAbstain: Do LLM Agents Know When Not to Act? [19.223843408018997]
既存の評価は、エージェントがいつ禁じるべきかを知るのではなく、タスクの成功に焦点を当てている。
エージェント禁忌のための最初の体系的評価枠組みとして,ツールを用いたLDMエージェントの動作を検知するキャリブレーション能力について述べる。
AgentAbstainは、エージェントネイティブな分類に基づくペアタスクのベンチマークである。
論文 参考訳(メタデータ) (2026-07-11T00:57:36Z) - Think Twice Before You Act: Protecting LLM Agents Against Tool Description Poisoning via Isolated Planning [48.99783163807576]
クロスツール記述中毒は、エージェントの軌道を操縦するためにプランナー可視のツールメタデータを操作することができる。
重要な観察は、有毒な記述がステップを越えた計画コンテキストに留まり、その後のツール選択に対する継続的な影響を可能にすることである。
我々は,孤立計画と呼ばれる新しい概念に基づく新しいシステムレベルの防衛ツールであるTool-Guardを提案する。
論文 参考訳(メタデータ) (2026-06-18T20:31:08Z) - Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools [3.430756791229312]
ツール拡張された言語エージェントは、おそらく将来のツールコールを遅延を隠すために投機的に発行する。
これらの呼び出しは、エージェントがブランチにコミットする前に、外部サービスにユーザー意図を推論する。
我々は、コミット前の観察を第一級効果として扱うランタイム抽象化である、投機的ツールプライバシ契約を提案する。
論文 参考訳(メタデータ) (2026-06-01T16:53:19Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - PREPING: Building Agent Memory without Tasks [65.75870568959644]
Prepingはプロポーザル誘導型メモリ構築フレームワークである。
コアとなるのは、将来の実践を形作る構造化制御状態であるプロジェクタメモリである。
トライアルでは、Prepingはメモリなしのベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-05-11T04:34:43Z) - Towards Using Promises for Multi-Agent Cooperation in Goal Reasoning [15.924281804465254]
一般的に使われているゴール改善メカニズムであるゴールライフサイクルに、約束をどのように組み込むことができるかを示す。
次に、時間付き初期リテラルに接続することで、特定の目標を計画する際にPromiseをどのように使用できるかを示す。
論文 参考訳(メタデータ) (2022-06-20T15:57:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。