論文の概要: Agent Behavior as Code: Efficient and Robust LLM Agents with Programmatic Specifications
- arxiv url: http://arxiv.org/abs/2610.04824v1
- Date: Sun, 04 Oct 2026 00:14:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 08:36:26.982882
- Title: Agent Behavior as Code: Efficient and Robust LLM Agents with Programmatic Specifications
- Title(参考訳): コードとしてのエージェント動作:プログラム仕様付き効率的かつロバストなLDMエージェント
- Abstract要約: $textbfA$gent $textbfB$ehavior as $textbfC$ode $textbfAgent$ (ABCAgent)
ABCAgentはシンボリックプログラムを使用してエージェントの動作を実行時に完全に指定し、強力なFMエージェントがそのプログラムを柔軟性のために編集する。
ABCAgentを6つのエージェントベンチマークで評価し、その中の2つは、派生プログラムが目的とするタスクの変種に対していかにうまく一般化するかをテストするために構築したものである。
- 参考スコア(独自算出の注目度): 12.078898144306182
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI agents based on foundation models (FMs) have demonstrated strong capabilities to perform complex open-ended tasks. However, they face some common challenges in practice: (a) agent behavior can deviate drastically even for semantically similar tasks, leading to catastrophically propagated errors; (b) high cost and latency due to FM calls, repeated in full whenever a task recurs with different inputs; (c) FMs' limited context and instruction following capability confine how well agents manage the ever-growing execution context and follow complex plans. We introduce $\textbf{A}$gent $\textbf{B}$ehavior as $\textbf{C}$ode $\textbf{Agent}$ (ABCAgent), which uses a symbolic program (e.g., Python code with potential neural functions) to fully specify the agent's behavior at runtime, with a powerful FM agent editing that program for flexibility. Behavior is thus specified without premature variable binding, and its execution is deterministic. We evaluate ABCAgent on six agent benchmarks, two of which we construct to test how well a derived program generalizes to variants of the task it was written for. ABCAgent matches a model-matched neural agent on GAIA and augmented GAIA, and surpasses it where robustness and long control flows matter: 98.3% against 97.3% on GSM-Symbolic ($p = 0.001$), 71.9% against 47.4% $\mathrm{Pass}^4$ on the telecom domain of $τ^2$-bench ($p = 0.0001$), and more records written correctly at every loop length on our control-flow-augmented WorkArena benchmark. For more parametric task families, ABCAgent is also significantly superior in efficiency. Without authoring a new program, ABCAgent solves 92.6% of GSM-Symbolic instances and 20.1% of augmented GAIA variants, which yields $5.2\times$ lower latency and $7.0\times$ lower cost on GSM-Symbolic, 19% lower cost on augmented GAIA, and $9.5\times$ lower agent latency on $τ^2$-telecom.
- Abstract(参考訳): 基礎モデル(FM)に基づくAIエージェントは、複雑なオープンエンドタスクを実行する強力な能力を示している。
しかし、それらは実際、いくつかの共通の課題に直面します。
(a)エージェントの動作は、意味論的に類似したタスクであっても、劇的に逸脱し、破滅的に伝播するエラーを引き起こす。
b) FM呼び出しによるコストとレイテンシが高く、タスクが異なる入力で再帰するたびに、完全に繰り返します。
(c)FMの限られたコンテキストと命令に従う能力は、エージェントがいつまでも成長し続ける実行コンテキストを管理し、複雑な計画に従うかを規定する。
このプログラムはシンボリックプログラム(例えば、潜在的な神経機能を持つPythonコード)を使用して、エージェントの動作を実行時に完全に指定し、強力なFMエージェントがそのプログラムを柔軟性のために編集する。
したがって、振る舞いは初期変数バインディングなしで指定され、その実行は決定論的である。
ABCAgentを6つのエージェントベンチマークで評価し、その中の2つは、派生プログラムが目的とするタスクの変種に対していかにうまく一般化するかをテストするために構築したものである。
ABCAgentはGAIAと強化GAIAのモデルマッチングニューラルエージェントにマッチし、GSM-Symbolic(p = 0.001$)で98.3%、GSM-Symbolic(p = 0.001$)で71.9%、通信ドメインで47.4%$\mathrm{Pass}^4$(p = 0.0001$)で98.3%、制御フローの増大したWorkArena(英語版)ベンチマークで正しいループ長で記録されている。
よりパラメトリックなタスクファミリでは、ABCAgentは効率もかなり優れている。
新しいプログラムの認可なしにABCAgentはGSM-Symbolicインスタンスの92.6%と拡張GAIAインスタンスの20.1%を解決し、GSM-Symbolicの5.2\times$低レイテンシと7.0\times$低コスト、強化GAIAの19%低コスト、$τ^2$-telecomの9.5\times$低エージェントレイテンシを得られる。
関連論文リスト
- TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework [0.9012337166501982]
CohenBenchはオープンソースのコンパイラベースのフレームワーク上のタスクのベンチマークである。
エージェントのパッチを適用して、フレームワークのテストスイートを実行することで、各実行をグレードする。
3つのフロンティアモデルファミリーと1つのオープンウェイトモデルにまたがる7つの符号化エージェントを評価した。
論文 参考訳(メタデータ) (2026-06-04T01:42:40Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - LACUNA: Safe Agents as Recursive Program Holes [3.2613419151327343]
LLMエージェントはますますコードを記述することで振る舞うが、エージェントを駆動するランタイムとモデルが記述するコードの間には分割が持続する。
我々は、安全性を維持しながら、この分割を閉じるエージェントのためのプログラミングモデルであるLACUNAを紹介する。
我々のプリミティブは、通常の制御フローとしてReActループ、サブエージェント、スキル、並列分解、マルチモデル計画を表現する。
論文 参考訳(メタデータ) (2026-05-27T15:27:25Z) - The Bureaucracy of Speed: Structural Equivalence Between Memory Consistency Models and Multi-Agent Authorization Revocation [0.0]
我々はアイデンティティとアクセス管理のための能力コヒーレンスシステムを開発した。
安全定理は、実行カウント リリース 一貫性指向のコヒーレンス戦略に対する無許可の操作を束縛する。
ティックベースの離散イベントシミュレーションは、機能ごとの安全性を保証する。
論文 参考訳(メタデータ) (2026-03-10T16:37:02Z) - Beyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM Agents [31.789859492703016]
エージェント・ツール通信ループは、Large Language Model (LLM)エージェントにおけるクリティカルアタックサーフェスである。
既存のDoS(DoS)攻撃は、この新しいパラダイムには効果がない。
正常に完了したタスクのヒントのもと、ツール層で機能するステルスで多ターンの経済DoS攻撃を導入する。
論文 参考訳(メタデータ) (2026-01-16T02:47:45Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z) - On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents [58.79302663733703]
大規模言語モデルに基づくマルチエージェントシステムは、専門家エージェントの協力により、様々なタスクにまたがる優れた能力を示している。
不器用なエージェントや悪意のあるエージェントが与える影響 - システム全体のパフォーマンスにおいて、頻繁にタスクでエラーを犯すものは、いまだに過小評価されていない。
本稿では,下流タスクにおける障害要因下での各種システム構造のレジリエンスについて検討する。
論文 参考訳(メタデータ) (2024-08-02T03:25:20Z) - Communication Efficient Parallel Reinforcement Learning [34.77250498401055]
我々は、$m$エージェントが$s$状態と$a$アクションを持つ$m$同一および独立環境と相互作用する問題を考える。
我々はエージェントが不適切なコミュニケーションラウンドで後悔を最小限に抑えるアルゴリズムを見つけることを目的としている。
論文 参考訳(メタデータ) (2021-02-22T02:46:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。