Fugu-MT 論文翻訳(概要): Agent models: Internalizing Chain-of-Action Generation into Reasoning models

論文の概要: Agent models: Internalizing Chain-of-Action Generation into Reasoning models

arxiv url: http://arxiv.org/abs/2503.06580v1
Date: Sun, 09 Mar 2025 12:19:47 GMT
ステータス: 翻訳完了
システム内更新日: 2025-03-11 20:09:44.49611
Title: Agent models: Internalizing Chain-of-Action Generation into Reasoning models
Title（参考訳）: エージェントモデル:アクションの連鎖生成を推論モデルに内部化する
Authors: Yuxiang Zhang, Yuqi Yang, Jiangming Shu, Xinyan Wen, Jitao Sang,
Abstract要約: 我々は、emphChain-of-Action(CoA)の発生を内部化するemphLarge Agent Models(LAMs)を配置する。提案するAutoCoAフレームワークは,教師付き微調整(SFT)と強化学習(RL)を組み合わせたものである。主なコンポーネントは、ステップレベルのアクショントリガー、軌道レベルのCoA、実際の環境相互作用コストを低減するための内部世界モデルである。
参考スコア（独自算出の注目度）: 15.954047804223379
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Traditional agentic workflows rely on external prompts to manage interactions with tools and the environment, which limits the autonomy of reasoning models. We position \emph{Large Agent Models (LAMs)} that internalize the generation of \emph{Chain-of-Action (CoA)}, enabling the model to autonomously decide when and how to use external tools. Our proposed AutoCoA framework combines supervised fine-tuning (SFT) and reinforcement learning (RL), allowing the model to seamlessly switch between reasoning and action while efficiently managing environment interactions. Main components include step-level action triggering, trajectory-level CoA optimization, and an internal world model to reduce real-environment interaction costs. Evaluations on open-domain QA tasks demonstrate that AutoCoA-trained agent models significantly outperform ReAct-based workflows in task completion, especially in tasks that require long-term reasoning and multi-step actions. Code and dataset are available at https://github.com/ADaM-BJTU/AutoCoA
Abstract（参考訳）: 従来のエージェントワークフローは、ツールと環境とのインタラクションを管理する外部のプロンプトに依存しており、推論モデルの自律性を制限する。我々は、emph{Chain-of-Action (CoA) の生成を内包する \emph{Large Agent Models (LAMs) を配置し、モデルが外部ツールの使用時期と使い方を自律的に決定できるようにする。提案するAutoCoAフレームワークは、教師付き微調整(SFT)と強化学習(RL)を組み合わせることで、モデルが環境相互作用を効率的に管理しながら推論と動作をシームレスに切り替えることを可能にする。主なコンポーネントは、ステップレベルのアクショントリガー、軌道レベルのCoA最適化、実際の環境相互作用コストを低減するための内部世界モデルである。オープンドメインQAタスクの評価は、AutoCoA訓練されたエージェントモデルがタスク完了におけるReActベースのワークフロー、特に長期の推論とマルチステップアクションを必要とするタスクにおいて、著しく優れていることを示している。コードとデータセットはhttps://github.com/ADaM-BJTU/AutoCoAで入手できる。

関連論文リスト

Digi-Q: Learning Q-Value Functions for Training Device-Control Agents [73.60512136881279]
Digi-QはVLMベースのアクション値Q関数を訓練し、エージェントポリシーを抽出する。 Digi-Qは、Android-in-the-Wildのユーザスケールデバイス制御タスクにおいて、いくつかの従来手法より優れている。
論文参考訳（メタデータ） (2025-02-13T18:55:14Z)
CoMAL: Collaborative Multi-Agent Large Language Models for Mixed-Autonomy Traffic [11.682456863110767]
CoMALは、交通の流れを最適化するために、自動運転車間のコラボレーションによって、混在する自律交通問題に対処するために設計されたフレームワークである。 CoMALは大きな言語モデル上に構築されており、対話的な交通シミュレーション環境で動作する。
論文参考訳（メタデータ） (2024-10-18T10:53:44Z)
MOSS: Enabling Code-Driven Evolution and Context Management for AI Agents [7.4159044558995335]
動的コンテキスト管理システムとコード生成を統合する新しいフレームワークであるMOSS(llM-oriented Operating System Simulation)を紹介する。フレームワークの中核は、最小限の知識原則を強制するために、インバージョン・オブ・コントロールコンテナとデコレータを併用する。我々は,このフレームワークがエージェント開発における効率性と能力をいかに向上させるかを示し,チューリング完全エージェントへの移行におけるその優位性を強調した。
論文参考訳（メタデータ） (2024-09-24T14:30:21Z)
xLAM: A Family of Large Action Models to Empower AI Agent Systems [111.5719694445345]
AIエージェントタスク用に設計された大規模なアクションモデルであるxLAMをリリースする。 xLAMは、複数のエージェント能力ベンチマークで例外的なパフォーマンスを提供する。
論文参考訳（メタデータ） (2024-09-05T03:22:22Z)
AutoAct: Automatic Agent Learning from Scratch for QA via Self-Planning [54.47116888545878]
AutoActはQAのための自動エージェント学習フレームワークである。大規模アノテートデータやクローズドソースモデルからの合成計画軌道は依存していない。
論文参考訳（メタデータ） (2024-01-10T16:57:24Z)
Interactive Autonomous Navigation with Internal State Inference and Interactivity Estimation [58.21683603243387]
本稿では,関係時間的推論を伴う3つの補助的タスクを提案し,それらを標準のディープラーニングフレームワークに統合する。これらの補助的なタスクは、他の対話的エージェントの行動パターンを推測するための追加の監視信号を提供する。提案手法は,標準評価指標の観点から,頑健かつ最先端のパフォーマンスを実現する。
論文参考訳（メタデータ） (2023-11-27T18:57:42Z)
You Only Look at Screens: Multimodal Chain-of-Action Agents [37.118034745972956]
Auto-GUIは、インターフェースと直接対話するマルチモーダルソリューションである。そこで本研究では,エージェントが実行すべきアクションを決定するためのチェーン・オブ・アクション手法を提案する。我々は,30$Kのユニークな命令を持つ新しいデバイス制御ベンチマークAITWに対するアプローチを評価した。
論文参考訳（メタデータ） (2023-09-20T16:12:32Z)
Chain-of-Skills: A Configurable Model for Open-domain Question Answering [79.8644260578301]
検索モデルは、現実世界の知識集約的なタスクに欠かせない要素である。最近の研究はカスタマイズされたメソッドに焦点を合わせ、モデルの転送可能性とスケーラビリティを制限している。本稿では,各モジュールがデータセット間で再利用可能なキースキルに対応するモジュールレトリバーを提案する。
論文参考訳（メタデータ） (2023-05-04T20:19:39Z)
Self-Consistent Models and Values [42.53364554418915]
環境の学習モデルは、環境に関する予測を行う柔軟な方法を備えた強化学習(RL)エージェントを提供する。本研究は,学習モデルと価値関数を共存させることによって,モデルに基づくRLを増大させる手法について検討する。我々のアプローチは、Dynaのような古典的な計画手法とは異なる。
論文参考訳（メタデータ） (2021-10-25T12:09:42Z)
AutoFIS: Automatic Feature Interaction Selection in Factorization Models for Click-Through Rate Prediction [75.16836697734995]
自動特徴相互作用選択(AutoFIS)と呼ばれる2段階のアルゴリズムを提案する。 AutoFISは、目標モデルを収束させるためにトレーニングするのと同等の計算コストで、因子化モデルに対する重要な特徴的相互作用を自動的に識別することができる。 AutoFISはHuawei App Storeレコメンデーションサービスのトレーニングプラットフォームにデプロイされている。
論文参考訳（メタデータ） (2020-03-25T06:53:54Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。