論文の概要: DynaSaur: Large Language Agents Beyond Predefined Actions
- arxiv url: http://arxiv.org/abs/2411.01747v2
- Date: Wed, 04 Jun 2025 16:26:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-06-05 16:24:48.748153
- Title: DynaSaur: Large Language Agents Beyond Predefined Actions
- Title(参考訳): DynaSaur: 事前定義されたアクション以上の大きな言語エージェント
- Authors: Dang Nguyen, Viet Dac Lai, Seunghyun Yoon, Ryan A. Rossi, Handong Zhao, Ruiyi Zhang, Puneet Mathur, Nedim Lipka, Yu Wang, Trung Bui, Franck Dernoncourt, Tianyi Zhou,
- Abstract要約: 既存のLLMエージェントシステムは、通常、各ステップで固定セットと事前定義されたセットからアクションを選択する。
動作を動的に生成・構成できるLLMエージェントフレームワークを提案する。
このフレームワークでは、汎用プログラミング言語で書かれたプログラムを生成し実行することで、エージェントが環境と対話する。
- 参考スコア(独自算出の注目度): 108.75187263724838
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Existing LLM agent systems typically select actions from a fixed and predefined set at every step. While this approach is effective in closed, narrowly scoped environments, it presents two major challenges for real-world, open-ended scenarios: (1) it significantly restricts the planning and acting capabilities of LLM agents, and (2) it requires substantial human effort to enumerate and implement all possible actions, which is impractical in complex environments with a vast number of potential actions. To address these limitations, we propose an LLM agent framework that can dynamically create and compose actions as needed. In this framework, the agent interacts with its environment by generating and executing programs written in a general-purpose programming language. Moreover, generated actions are accumulated over time for future reuse. Our extensive experiments across multiple benchmarks show that this framework significantly improves flexibility and outperforms prior methods that rely on a fixed action set. Notably, it enables LLM agents to adapt and recover in scenarios where predefined actions are insufficient or fail due to unforeseen edge cases. Our code can be found in https://github.com/adobe-research/dynasaur.
- Abstract(参考訳): 既存のLLMエージェントシステムは、通常、各ステップで固定セットと事前定義されたセットからアクションを選択する。
このアプローチは閉ざされた狭い範囲の環境では有効であるが,(1)LLMエージェントの計画と行動能力を著しく制限し,(2)複雑な環境では実現不可能な全てのアクションを列挙し実施するためには,相当な人的努力が必要である。
これらの制約に対処するために,動作を動的に生成し,必要に応じて構成できるLLMエージェントフレームワークを提案する。
このフレームワークでは、汎用プログラミング言語で書かれたプログラムを生成し実行することで、エージェントが環境と対話する。
さらに、生成したアクションは、将来の再利用のために時間とともに蓄積されます。
複数のベンチマークにまたがる広範な実験により、このフレームワークは柔軟性を著しく向上し、固定されたアクションセットに依存する先行メソッドよりも優れていることが示された。
特に、LLMエージェントは、事前に定義されたアクションが不十分であったり、予期せぬエッジケースのために失敗するシナリオに適応し、回復することができる。
私たちのコードはhttps://github.com/adobe-research/dynasaur.comで確認できます。
関連論文リスト
- SynWorld: Virtual Scenario Synthesis for Agentic Action Knowledge Refinement [81.30121762971473]
SynWorldは、エージェントが自律的に環境を探索し、最適化し、アクションに対する理解を深めることを可能にするフレームワークである。
実験の結果,SynWorldは新しい環境下での行動知識の学習に効果的で汎用的なアプローチであることを実証した。
論文 参考訳(メタデータ) (2025-04-04T16:10:57Z) - Talk Structurally, Act Hierarchically: A Collaborative Framework for LLM Multi-Agent Systems [10.67359331022116]
textitTalk 構造的には、Act Hierarchically (TalkHier) はコンテキスト豊富な交換のための構造化通信プロトコルを導入する新しいフレームワークである。
textitTalkHierは、推論スケーリングモデル(OpenAI-o1)、オープンソースのマルチエージェントモデル(AgentVerseなど)など、さまざまな種類のSoTAを追い越している。
論文 参考訳(メタデータ) (2025-02-16T12:26:58Z) - AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents [52.13695464678006]
本研究は, 観察空間と行動空間を簡略化することで, LLMベースのWebエージェントを強化する。
AgentOccam は以前の最先端および同時処理を 9.8 (+29.4%) と 5.9 (+15.8%) で上回っている。
論文 参考訳(メタデータ) (2024-10-17T17:50:38Z) - Language Models can Infer Action Semantics for Symbolic Planners from Environment Feedback [26.03718733867297]
言語モデルを用いた行動予測法(PSALM)を提案する。
PSALMはシンボルプランナーとLarge Language Models(LLM)の強みを活用することでアクションセマンティクスを学習する
実験の結果、PSALMは計画の成功率を36.4%(Claude-3.5)から100%に向上させ、基礎となる真理ドメインのアクションセマンティクスを推論する以前の作業よりも効率的に環境を探索する。
論文 参考訳(メタデータ) (2024-06-04T21:29:56Z) - Executable Code Actions Elicit Better LLM Agents [76.95566120678787]
この研究は、Pythonコードを使用して、Large Language Model(LLM)エージェントのアクションを統一されたアクション空間(CodeAct)に統合することを提案する。
Pythonインタプリタと統合されたCodeActは、コードアクションを実行し、事前アクションを動的に修正したり、マルチターンインタラクションを通じて新しい観察に新しいアクションを発行することができる。
CodeActのパフォーマンス向上は、解釈可能なコードを実行し、自然言語を使ってユーザとコラボレーションすることで、環境と対話するオープンソースのLLMエージェントを構築する動機となります。
論文 参考訳(メタデータ) (2024-02-01T21:38:58Z) - Formally Specifying the High-Level Behavior of LLM-Based Agents [24.645319505305316]
LLMはタスク固有の微調整モデルを必要とせずに、課題を解決するための有望なツールとして登場した。
現在、このようなエージェントの設計と実装はアドホックであり、LLMベースのエージェントが自然に適用できる様々なタスクは、エージェント設計に一律に適合するアプローチが存在しないことを意味する。
エージェント構築のプロセスを簡単にする最小主義的生成フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-12T17:24:15Z) - LASER: LLM Agent with State-Space Exploration for Web Navigation [57.802977310392755]
大規模言語モデル(LLM)は、Webナビゲーションのようなインタラクティブな意思決定タスクにうまく適応している。
以前のメソッドでは、モデルに対して前方のみの実行モードを暗黙的に仮定しており、そこでは、オンコンテキストの例として、オラクルのトラジェクトリのみを提供する。
本稿では,対話型タスクを状態空間探索としてモデル化することを提案する。
論文 参考訳(メタデータ) (2023-09-15T05:44:08Z) - AgentBench: Evaluating LLMs as Agents [88.45506148281379]
大規模言語モデル(LLM)は、従来のNLPタスクを超えた現実的な実用的ミッションをターゲットとして、ますます賢く自律的になってきています。
我々は,現在8つの異なる環境からなるベンチマークであるAgentBenchを紹介し,LLM-as-Agentの推論と意思決定能力を評価する。
論文 参考訳(メタデータ) (2023-08-07T16:08:11Z) - Generating Executable Action Plans with Environmentally-Aware Language
Models [4.162663632560141]
大量のテキストデータセットを使用してトレーニングされた大規模言語モデル(LLM)は、最近、ロボットエージェントのアクションプランを生成することを約束している。
本稿では,環境に配慮したアクションプラン作成手法を提案する。
論文 参考訳(メタデータ) (2022-10-10T18:56:57Z) - Language Models as Zero-Shot Planners: Extracting Actionable Knowledge
for Embodied Agents [111.33545170562337]
自然言語で表現された高レベルなタスクを、選択された実行可能なステップのセットに基底付ける可能性について検討する。
事前学習したLMが十分に大きく、適切に誘導された場合、ハイレベルなタスクを効果的に低レベルな計画に分解できることがわかった。
本稿では,既存の実演の条件を規定し,計画が許容可能な行動に意味的に変換される手順を提案する。
論文 参考訳(メタデータ) (2022-01-18T18:59:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。