論文の概要: Dude, Where's My State? Execution Information Requirements for Stateful Agents
- arxiv url: http://arxiv.org/abs/2609.32687v2
- Date: Mon, 05 Oct 2026 06:31:56 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:35:35.355973
- Title: Dude, Where's My State? Execution Information Requirements for Stateful Agents
- Title(参考訳): 私の状態はどこにあるのか? ステートフルエージェントのための実行情報要求
- Abstract要約: 本研究では,個々の作業の難易度から情報需要,維持,回復を別々に変化させるような,既知の依存関係を持つタスクを生成するフレームワークを開発する。
エージェント実行トレースを使用してセマンティックグラフを構築し,実際のタスクに対する情報要求を計測するVESTIGEも導入する。
- 参考スコア(独自算出の注目度): 10.501126275738219
- License:
- Abstract: Long-running agents must preserve information that later steps depend on. We introduce the Execution Information Requirement (EIR), a lower bound on the information that must remain accessible for correct completion under specified task and access conditions. We develop LACUNA, a framework that generates tasks with known dependencies and varies information demand, retention, and recovery separately from the difficulty of individual operations. Across four models, restoring a missing result raises accuracy on affected recall steps to 100%, compared with 0% for equal-length irrelevant information. Sufficient storage alone does not ensure success: retention policies can discard required results, errors can propagate through later computations, and agents can stop before recovery is complete. We also introduce VESTIGE, which uses agent execution traces to construct semantic graphs and measure information demand for real tasks. Across 72,562 software-agent trajectories, VESTIGE reveals a steeper distance-related decline in solution-relevant rereading for failed runs (RR 0.951 per distance doubling), while adjusted peak demand alone is not associated with failure. Together, these contributions support evaluating whether agents preserve and recover the information their tasks require.
- Abstract(参考訳): 長期にわたるエージェントは、後続のステップが依存する情報を保存する必要がある。
本稿では,特定のタスクやアクセス条件下で,正しい完了のためにアクセスしなくてはならない情報の下位境界である実行情報要求(EIR)を導入する。
LACUNAは、既知の依存関係を持つタスクを生成し、個々の操作の難易度から情報要求、保持、回復を別々に変化させるフレームワークである。
4つのモデルにまたがって、欠落した結果の復元により、影響のあるリコールステップの精度が100%向上する。
保持ポリシーは必要な結果を破棄し、エラーは後の計算を通じて伝播し、エージェントは回復が完了する前に停止することができる。
エージェント実行トレースを使用してセマンティックグラフを構築し,実際のタスクに対する情報要求を測定するVESTIGEも導入する。
VESTIGEは72,562本のソフトウェアエージェント軌道を越え、故障したランニング(RR 0.951/km)に対する解関連リリードの急激な減少を明らかにし、調整されたピーク需要だけでは失敗とは無関係である。
これらのコントリビューションは、エージェントが必要とする情報を保存し、回復するかどうかを評価することを支援する。
関連論文リスト
- Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems [0.519554837386174]
構造化データタスクでは、不正なトレースによってベンチマーク正解が生成される。
本稿では,回答の裏側で記録された計算が明確かどうかを評価するためのデプロイメント信頼性基準であるTrace Integrityを紹介する。
また,CAIT (Correct Answer / Invalid Trace) レートを導入し,回答のみの評価が計算支援出力をどれだけ成功させるかを測定する。
論文 参考訳(メタデータ) (2026-08-26T17:15:24Z) - Beyond End-to-End Success: Diagnosing Failures in Long-Horizon Security LLM Agents [8.355245794476078]
本稿では,チェックポイントでセキュリティタスクを計測し,機能露出前後の障害を分離する診断手法を提案する。
我々は,発見情報の再利用の遅れ,観察状態の再利用,失敗戦略からの回復,不確実な結果の意思決定を含む4つのタスクファミリーの方法論を評価する。
論文 参考訳(メタデータ) (2026-08-20T20:55:22Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories [16.13133177152883]
Retrievalは、重要かもしれない過去の軌跡を特定することができるが、ユーザー、エンティティ、制約、環境状態が変わった後、エージェントがその軌跡をどのように使うべきかは明記していない。
我々は,この再検索後の再利用ステップを,長期記憶のボトルネックとして認識する。
クエリ条件の再利用(QCR)によってフレームワークをインスタンス化する。
論文 参考訳(メタデータ) (2026-08-13T05:39:49Z) - Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents [15.526916927007049]
LLMエージェントは、選択のための自然言語記述と計画のための教示体を使用して、ますますサードパーティのスキルに依存している。
Convergent Detour Hijacking(CDH)を紹介します。
複数 LLM バックエンドと 491 のホールドアウトタスクを単一タスクおよび複数ターン条件下で評価した。
論文 参考訳(メタデータ) (2026-08-12T17:12:49Z) - FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search [11.638321375070047]
LLMエージェントトラジェクトリにおける障害帰属の診断フレームワークであるFALATを提案する。
我々は、アルゴリズム生成と手作りのマルチエージェント障害軌跡を含むWho&WhenベンチマークでFALATを評価する。
論文 参考訳(メタデータ) (2026-05-30T15:11:35Z) - LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents [63.75550089045995]
ロングホライズン検索エージェントは、理由として急速に成長する作業状況を管理し、ツールを呼び、情報を観察しなければならない。
エージェントの軌道の一部は、タスクに対する現在の関連性に応じて、異なるレベルで細部まで維持される。
我々は10kの合成軌道上にQwen3-30B-A3Bを微調整した長距離探索エージェントであるLongSeekerを開発した。
論文 参考訳(メタデータ) (2026-05-06T17:54:16Z) - AgentFold: Long-Horizon Web Agents with Proactive Context Management [98.54523771369018]
LLM ベースの Web エージェントは情報検索を大いに約束するが,その有効性はコンテキスト管理における基本的なトレードオフによって妨げられる。
本稿では,プロアクティブなコンテキスト管理を中心としたエージェントパラダイムであるAgentFoldを紹介する。
単純な微調整により,BrowseCompでは36.2%,BrowseComp-ZHでは47.3%を達成した。
論文 参考訳(メタデータ) (2025-10-28T17:51:50Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。