論文の概要: GEM: Graph-Enhanced Mixture-of-Experts with ReAct Agents for Dialogue State Tracking
- arxiv url: http://arxiv.org/abs/2605.04449v1
- Date: Wed, 06 May 2026 03:25:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.623347
- Title: GEM: Graph-Enhanced Mixture-of-Experts with ReAct Agents for Dialogue State Tracking
- Title(参考訳): GEM: 対話状態追跡のためのアクティクトエージェントを用いたグラフ強化ミックス-オブ-エクササイズ
- Abstract要約: 本稿では,言語モデルとグラフ構造化対話理解とReActエージェントに基づく推論を組み合わせた新しいフレームワークGEMを提案する。
MultiWOZ 2.2では、GEMは65.19%のジョイントゴール精度を達成する。
ReAct 統合によるグラフ強化型混在型アーキテクチャは,構造化された対話表現と動的エキスパートルーティングとエージェントベースの推論を組み合わせることで,対話状態追跡の強力なパラダイムを提供することを示す。
- 参考スコア(独自算出の注目度): 3.510382824661669
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dialogue State Tracking (DST) requires precise extraction of structured information from multi-domain conversations, a task where Large Language Models (LLMs) struggle despite their impressive general capabilities. We present GEM (Graph-Enhanced Mixture-of-Experts), a novel framework that combines language models and graph-structured dialogue understanding with ReAct agent-based reasoning for superior DST performance. Our approach dynamically routes between specialized experts: a Graph Neural Network that captures dialogue structure and turn-level dependencies, and a finetuned T5-Small encoder-decoder for sequence modeling, coordinated by an intelligent router. For complex value generation tasks, we integrate ReAct agents that perform structured reasoning over dialogue context. On MultiWOZ 2.2, GEM achieves 65.19% Joint Goal Accuracy, substantially outperforming end-to-end LLM approaches (best: 38.43%) and surpassing state-of-the-art (SOTA) methods including TOATOD (63.79%), D3ST (58.70%), and Diable (56.48%). Our graph-enhanced mixture-of-experts architecture with ReAct integration demonstrates that combining structured dialogue representation with dynamic expert routing and agent-based reasoning provides a powerful paradigm for dialogue state tracking, achieving superior accuracy while maintaining computational efficiency through selective expert activation.
- Abstract(参考訳): 対話状態追跡(DST)は、多ドメイン会話から構造化された情報を正確に抽出する必要がある。
GEM(Graph-Enhanced Mixture-of-Experts)は,言語モデルとグラフ構造化対話理解を組み合わせた新しいフレームワークである。
我々のアプローチは,対話構造とターンレベルの依存関係をキャプチャするグラフニューラルネットワークと,インテリジェントルータによってコーディネートされたシーケンスモデリングのための微調整T5-Smallエンコーダデコーダの2つを動的にルーティングする。
複雑な値生成タスクに対して、対話コンテキスト上で構造化推論を行うReActエージェントを統合する。
MultiWOZ 2.2では、GEMは65.19%のジョイントゴール精度を達成し、エンドツーエンドのLCMアプローチ(38.43%)を大幅に上回り、TOATOD(63.79%)、D3ST(58.70%)、Diable(56.48%)といった最先端(SOTA)手法を上回りました。
ReAct統合によるグラフ強化型混合処理アーキテクチャは、構造化された対話表現と動的エキスパートルーティングとエージェントベースの推論を組み合わせることで、対話状態の追跡に強力なパラダイムを提供し、選択的な専門家アクティベーションを通じて計算効率を向上しつつ、優れた精度を達成できることを実証する。
関連論文リスト
- Dynamic Knowledge Fusion for Multi-Domain Dialogue State Tracking [14.34658776558061]
マルチドメインDSTに適用可能な動的知識融合フレームワークを開発する。
マルチドメイン・ダイアログ・ベンチマークから得られた結果から,本手法は対話追跡の精度と一般化を著しく向上することが示された。
論文 参考訳(メタデータ) (2026-03-11T03:29:26Z) - AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent [80.83250816918861]
o3やDeepSeek-R1のようなLarge Reasoning Models (LRM)は、長いチェーン・オブ・シークレットを持つ自然言語推論において顕著な進歩を遂げている。
しかし、計算的に非効率であり、複雑な数学的操作を必要とする問題を解く際には精度に苦しむ。
本稿では,言語モデルの推論能力とコードインタプリタの計算精度をシームレスに統合するエージェントフレームワークであるAgentMathを紹介する。
論文 参考訳(メタデータ) (2025-12-23T19:57:49Z) - AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding [73.05946667683259]
最近の大規模言語モデル(MLLM)は、強い認識を示すが、多話者、対話中心の設定に苦戦している。
本質的にエージェント的なタスクを中心に設計されたベンチマークであるAMUSEを紹介します。
我々は、報酬最適化と本質的なマルチモーダル自己評価を統合するデータ効率の高いエージェントアライメントフレームワークRAFTを提案する。
論文 参考訳(メタデータ) (2025-12-18T07:01:47Z) - MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling [115.74855199827596]
MiroThinkerは、ツール拡張推論と情報検索機能を向上させるために設計されたオープンソースの研究エージェントである。
モデルサイズやコンテキスト長のみをスケールアップする以前のエージェントとは異なり、MiroThinker氏はモデルレベルでのインタラクションスケーリングについて検討している。
論文 参考訳(メタデータ) (2025-11-14T18:52:07Z) - Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window [88.85901839023803]
DeepMinerは、高機能なトレーニングタスクと動的コンテキストウィンドウを導入することで、そのような能力を引き出す新しいフレームワークである。
We developed DeepMiner-32B, which is a significant performance improvements across multiple search agent benchmarks。
論文 参考訳(メタデータ) (2025-10-09T14:31:39Z) - ContextualLVLM-Agent: A Holistic Framework for Multi-Turn Visually-Grounded Dialogue and Complex Instruction Following [0.2999888908665658]
MMDR-Bench(Multi-Modal Dialogue Reasoning Benchmark)は,300の複雑なマルチターン対話シナリオからなる新しいデータセットである。
また,既存のLVLMを高度な推論と命令追従機能で拡張する包括的フレームワークであるCoLVLM Agent(Contextual LVLM Agent)を提案する。
MMDR-Benchを用いた実験により,CoLVLM Agentは高い性能を示し,平均評価スコアは4.03。
論文 参考訳(メタデータ) (2025-08-21T02:09:02Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs [2.238122883754112]
CIMRは、コンテキスト対応の反復推論と自己補正モジュールを導入した、新しいフレームワークである。
CIMRの精度は91.5%で、GPT-4V、LLaVA-1.5、MiniGPT-4、InstructBLIPなどの最先端モデルを上回る。
論文 参考訳(メタデータ) (2025-07-22T18:39:18Z) - Efficient Dialogue State Tracking by Masked Hierarchical Transformer [0.3441021278275805]
我々は、リッチリソース言語によるトレーニングセットと低リソース言語によるテストセットを備えた言語間ダイアログ状態トラッカーを構築した。
スロット操作分類タスクと状態追跡タスクを共同学習する手法を定式化する。
論文 参考訳(メタデータ) (2021-06-28T07:35:49Z) - Modeling Long Context for Task-Oriented Dialogue State Generation [51.044300192906995]
本稿では,シンプルで効果的な発話タグ付け手法と双方向言語モデルを用いたマルチタスク学習モデルを提案する。
提案手法は,入力対話コンテキストシーケンスが長い場合に,ベースラインの性能が著しく低下する,という問題を解決する。
本実験では,MultiWOZ 2.0データセットにおいて,ベースラインに対して7.03%の相対的改善を実現し,新しい最先端のジョイントゴール精度を52.04%に設定した。
論文 参考訳(メタデータ) (2020-04-29T11:02:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。