論文の概要: A Context Engineering Framework for Improving Enterprise AI Agents based on Digital-Twin MDP
- arxiv url: http://arxiv.org/abs/2603.22083v1
- Date: Mon, 23 Mar 2026 15:15:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.74777
- Title: A Context Engineering Framework for Improving Enterprise AI Agents based on Digital-Twin MDP
- Title(参考訳): Digital-Twin MDPに基づくエンタープライズAIエージェント改善のためのコンテキストエンジニアリングフレームワーク
- Authors: Xi Yang, Aurelie Lozano, Naoki Abe, Bhavya, Saurabh Jha, Noah Zheutlin, Rohan R. Arora, Yu Deng, Daby M. Sow,
- Abstract要約: オフライン強化学習(RL)によるLCMベースのエンタープライズエージェント改善のための軽量・モデルに依存しないフレームワークを提案する。
提案されているDT-MDP (DT-MDP-CE) フレームワークは、3つの主要なコンポーネントから構成されている。
ケーススタディでは、IT自動化の企業指向ドメインにおいて、このフレームワークを代表的タスクに適用する。
- 参考スコア(独自算出の注目度): 10.796028927771154
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite rapid progress in AI agents for enterprise automation and decision-making, their real-world deployment and further performance gains remain constrained by limited data quality and quantity, complex real-world reasoning demands, difficulties with self-play, and the lack of reliable feedback signals. To address these challenges, we propose a lightweight, model-agnostic framework for improving LLM-based enterprise agents via offline reinforcement learning (RL). The proposed Context Engineering via DT-MDP (DT-MDP-CE) framework comprises three key components: (1) A Digital-Twin Markov Decision Process (DT-MDP), which abstracts the agent's reasoning behavior as a finite MDP; (2) A robust contrastive inverse RL, which, armed with the DT-MDP, to efficiently estimate a well-founded reward function and induces policies from mixed-quality offline trajectories; and (3) RL-guided context engineering, which uses the policy obtained from the integrated process of (1) and (2), to improve the agent's decision-making behavior. As a case study, we apply the framework to a representative task in the enterprise-oriented domain of IT automation. Extensive experimental results demonstrate consistent and significant improvements over baseline agents across a wide range of evaluation settings, suggesting that the framework can generalize to other agents sharing similar characteristics in enterprise environments.
- Abstract(参考訳): 企業自動化と意思決定のためのAIエージェントの急速な進歩にもかかわらず、彼らの実世界のデプロイメントとさらなるパフォーマンス向上は、限られたデータ品質と量、複雑な実世界の推論要求、セルフプレイの困難、信頼性の高いフィードバック信号の欠如によって制限されている。
これらの課題に対処するために、オフライン強化学習(RL)を通してLLMベースのエンタープライズエージェントを改善するための軽量でモデルに依存しないフレームワークを提案する。
提案するDT-MDP(DT-MDP-CE)フレームワークは,(1)エージェントの推論動作を有限のMDPとして抽象化するDigital-Twin Markov Decision Process(DT-MDP),(2)DT-MDPに武装した頑健なコントラスト逆RLを用いて,良質な報酬関数を効率的に推定し,混合品質のオフライン軌道からポリシーを誘導する,(3)(1)と(2)の統合プロセスから得られたポリシーを利用するRL誘導コンテキストエンジニアリング,の3つの主要なコンポーネントから構成される。
ケーススタディでは、IT自動化の企業指向ドメインにおいて、このフレームワークを代表的タスクに適用する。
大規模な実験結果から、幅広い評価設定において、ベースラインエージェントよりも一貫した顕著な改善が示され、このフレームワークがエンタープライズ環境で同様の特徴を共有する他のエージェントに一般化できることが示唆された。
関連論文リスト
- EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots [68.29056647487519]
Embodied AIは、高忠実度シミュレーションと大規模データ収集によって実現されている。
しかし、このスケーリング能力は、労働集約的な手作業の監視に依存しているため、いまだにボトルネックになっている。
実装ポリシーを自律的に構築するための LLM エージェントの能力を評価するベンチマークである textscEmboCoach-Bench を紹介する。
論文 参考訳(メタデータ) (2026-01-29T11:33:49Z) - ORPR: An OR-Guided Pretrain-then-Reinforce Learning Model for Inventory Management [9.138155308817215]
プレトレイン-Then-Reinforce」アプローチは、AIの適応的認識をオペレーションリサーチの構造的厳密さと調和させる。
構造化OR論理で導かれる場合、軽量でドメインインフォームドモデルにより最先端の性能とロバストな転送性が得られることを示す。
論文 参考訳(メタデータ) (2025-12-22T03:39:43Z) - Semantic-Driven AI Agent Communications: Challenges and Solutions [25.74271088658268]
本稿では,意味駆動型AIエージェント通信フレームワークを提案する。
第一に、意味適応伝達は、様々な環境にモデルを効率的に適応させるために、実または生成サンプルと微調整を適用する。
第二に、セマンティック・ライトウェイト・トランスミッションはプルーニング、量子化、知覚対応サンプリングを取り入れ、モデルの複雑さを低減し、エッジエージェントの計算負担を軽減する。
第三に、セマンティックな自己進化制御では、分散階層的な意思決定を用いて多次元資源を最適化し、動的環境における堅牢なマルチエージェント協調を可能にする。
論文 参考訳(メタデータ) (2025-10-01T00:52:37Z) - Agentic AI Reasoning for Mobile Edge General Intelligence: Fundamentals, Approaches, and Directions [74.35421055079655]
大規模言語モデル(LLM)は、強力な推論と自律的な意思決定能力を備えたエージェント人工知能(AI)の出現を可能にした。
Mobile Edge General Intelligence (MEGI)は、リアルタイムでプライバシ保護の推論をネットワークエッジにもたらす。
本稿では,MEGIにおけるLLM推論の効率的な展開のための共同最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:53:48Z) - The Landscape of Agentic Reinforcement Learning for LLMs: A Survey [103.32591749156416]
エージェント強化学習(Agentic RL)の出現は、大規模言語モデル(LLM RL)に適用された従来の強化学習からパラダイムシフトを示している。
本研究では, LLM-RLの縮退した単段階マルコフ決定過程(MDPs)と, エージェントRLを定義する部分可観測マルコフ決定過程(POMDPs)とを対比することにより, この概念シフトを定式化する。
論文 参考訳(メタデータ) (2025-09-02T17:46:26Z) - AgentCDM: Enhancing Multi-Agent Collaborative Decision-Making via ACH-Inspired Structured Reasoning [8.566904810788213]
AgentCDMはマルチエージェントシステムにおける協調的意思決定を強化するための構造化フレームワークである。
認知バイアスを内部化し、意思決定を受動的回答の選択からアクティブな仮説評価と構築へとシフトさせる。
複数のベンチマークデータセットの実験は、AgentCDMが最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-08-16T09:46:04Z) - ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning [53.817538122688944]
Reinforced Meta-thinking Agents (ReMA) を導入し,Large Language Models (LLMs) の推論からメタ思考行動を求める。
ReMAは、推論プロセスを2つの階層的なエージェントに分解する。戦略上の監視と計画を生成するハイレベルなメタ思考エージェントと、詳細な実行のための低レベルな推論エージェントである。
単ターン実験による実験結果から、ReMAは複雑な推論タスクにおいて単エージェントRLベースラインよりも優れることが示された。
論文 参考訳(メタデータ) (2025-03-12T16:05:31Z) - Macro-Action-Based Multi-Agent/Robot Deep Reinforcement Learning under
Partial Observability [4.111899441919164]
最先端のマルチエージェント強化学習(MARL)手法は、様々な複雑な問題に対して有望な解決策を提供してきた。
まず,MacDec-POMDPに対する値に基づくRL手法を提案する。
3つの訓練パラダイムの下でマクロアクションに基づくポリシー勾配アルゴリズムを定式化する。
論文 参考訳(メタデータ) (2022-09-20T21:13:51Z) - The Gradient Convergence Bound of Federated Multi-Agent Reinforcement
Learning with Efficient Communication [20.891460617583302]
連立学習パラダイムにおける協調的意思決定のための独立強化学習(IRL)の検討
FLはエージェントとリモート中央サーバ間の過剰な通信オーバーヘッドを生成する。
本稿では,システムの実用性向上のための2つの高度な最適化手法を提案する。
論文 参考訳(メタデータ) (2021-03-24T07:21:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。