論文の概要: How Strongly Should Task State Influence an LLM Agent?
- arxiv url: http://arxiv.org/abs/2609.25686v1
- Date: Tue, 22 Sep 2026 04:42:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.226343
- Title: How Strongly Should Task State Influence an LLM Agent?
- Title(参考訳): タスク状態がLLMエージェントに与える影響について
- Abstract要約: ロングホライズンに割り当てられた作業は、タスクの状態を追跡するためにLLMエージェントを必要とする。
表示、説明、強制された状態からどれだけの信頼性があるかは、誰も知りません。
タスクルール、モデル、ペア化されたエピソードを修正し、タスク状態がエージェントにどれだけ強く到達するかを変える。
- 参考スコア(独自算出の注目度): 20.501736782803743
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon assigned work requires an LLM agent to track the state of a task: which steps are done, blocked, cancelled, or open to repetition. Agent systems either keep this state as text in the prompt and rely on the model to read that text, or move the state into a module that enforces it, and each system is evaluated as a whole, so no one knows how much reliability comes from the state being shown, told, or enforced. We fix the task rules, the model, and paired episodes and vary how strongly task state reaches the agent: a raw transcript, an exact checklist, per-turn directives from a state machine compiled from the brief and advanced only by execution receipts, or an enforcement gate on that machine that refuses state-violating actions; every episode is scored by exact payload matching against dynamic ground truth. Across three models, two reasoning regimes, and two domains, four findings hold without per-turn reasoning: displaying accurate state is unreliable, an unverified ledger the agent writes itself beats an accurate checklist it is shown, directives help in proportion to the model's obedience, and enforcement needs no obedience but is bounded by the correctness of its state and by the matcher that maps requests to steps; per-turn reasoning at a 235B agent compresses these separations without repairing the text rungs. The same gate, compiled from $τ^2$-bench's airline policy, raises a 235B agent's pass$^1$ from 0.39 to 0.54 and changes nothing for a 35B agent that rarely violates the policy; on PM-Bench, where acting turns on recognizing a cue rather than on state, showing the record is the best rung--matching or beating both gates and reversing the ledger-over-checklist finding--and enforcing the matcher's judgement drops a 35B agent below its raw transcript. Enforcement pays when failures are state-decidable and frequent, and hurts when the gate's judgement is wrong.
- Abstract(参考訳): ロングホライズンに割り当てられた作業では、LLMエージェントがタスクの状態を追跡する必要がある。
エージェントシステムは、この状態をプロンプト内のテキストとして保持し、そのテキストを読むためにモデルに依存するか、あるいはそれを強制するモジュールに状態を移動させ、各システムは全体として評価されるため、表示、指示、強制される状態からどれだけの信頼性があるかは誰も知らない。
我々は、タスクルール、モデル、ペア化されたエピソードを修正し、エージェントがどれだけ強いタスク状態に達するかを変化させる:生の書き起こし、正確なチェックリスト、実行レシートによってコンパイルされた簡潔かつ高度な状態マシンからのターン毎のディレクティブ、または、状態違反行為を拒否するマシン上の強制ゲート。
正確な状態の表示は信頼できない、エージェント自身が記述した未検証の台帳が正確なチェックリストを破る、ディレクティブがモデルの従順性に比例して助ける、そして強制は従順性を必要としないが、その状態の正しさと、235Bエージェントでのターン当たりの推論はテキストラングを修復することなくこれらの分離を圧縮する。
同じゲートは、$τ^2$-benchの航空政策からコンパイルされ、235Bエージェントのパス^1$を0.39から0.54に引き上げ、ポリシーにほとんど違反しない35Bエージェントに対して何も変更しない。
実行は、失敗が国家決定可能で頻繁な場合の報酬であり、ゲートの判断が間違っていれば傷つく。
関連論文リスト
- Agent Safety Should Be a Runtime Contract [7.813225070853552]
エージェントの安全性は、ハーネスによって強制されるランタイム契約であるべきです。
予防顔は 危険な行動を妨害する
明らかな顔は 良い行動が実際に起こった証拠が必要です
論文 参考訳(メタデータ) (2026-08-11T08:01:05Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Safety Invariants for Agents Orchestrating Irreversible State Transitions: A Four-Dimensional Formalism Evaluated on Public Ledgers [0.0]
フォーマリズムを使って、実行忠実性( executionfidelity)と呼ばれる保証を記述し、証明します。
7つの安全不変量は、経験から数えられるのではなく、忠実性条件に由来するもので、保証を解除する。
システムはデプロイされ、8つのチェーンにまたがる108のプロダクション書き込み操作によって、障害分類が復活する。
論文 参考訳(メタデータ) (2026-08-01T17:29:42Z) - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures [1.0742675209112622]
障害モードは、不特定性、能力エラー、エージェントハーネスエラーの3つのメカニズムから派生したものとして研究する。
我々はClayBuddyを提案する。ClayBuddyはユーザの好みを形作るハーネスで、モデルのインセッションで修正してこれらのエラーを軽減できる。
論文 参考訳(メタデータ) (2026-06-13T18:29:53Z) - PocketAgents: A Manifest-Driven Library of Autonomous Defense Agents [0.589889361990138]
本稿では,自律型防衛エージェントのマニフェスト駆動型ライブラリであるPocketAgentsを紹介する。
各エージェントは、マニフェスト、プロンプト、ランタイムコンテキストの3つのデータファイルとしてインストールされる。
実験により、型付き境界はLLM駆動の防御を測定可能で、測定可能で、帰属可能であることが示された。
論文 参考訳(メタデータ) (2026-05-20T19:52:24Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - A New Bandit Setting Balancing Information from State Evolution and
Corrupted Context [52.67844649650687]
本稿では,2つの確立されたオンライン学習問題と包括的フィードバックを組み合わせた,逐次的意思決定方式を提案する。
任意の瞬間にプレーする最適なアクションは、エージェントによって直接観察できない基礎となる変化状態に付随する。
本稿では,レフェリーを用いて,コンテキストブレイジットとマルチアームブレイジットのポリシーを動的に組み合わせるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-11-16T14:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。