論文の概要: MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
- arxiv url: http://arxiv.org/abs/2607.29320v1
- Date: Fri, 31 Jul 2026 11:51:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.699935
- Title: MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
- Title(参考訳): MAGA:構造的アクション蒸留によるGUIエージェントの多相自己融合
- Abstract要約: 既存のGUIエージェントは通常ドメイン固有であり、デプロイメントとユーザエクスペリエンスを制限します。
構造化動作に応じてトレーニング信号を再配置するMAGAを導入する。
平均成功率が最も高く、8Bで最強のベースラインを2.0%上回り、教師とほぼ同じ平均パフォーマンスを達成している。
- 参考スコア(独自算出の注目度): 24.418648271458906
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Graphical user interface (GUI) agents based on large language models are increasingly deployed across mobile, web, and desktop environments. However, existing agents are typically domain-specific, limiting the deployment and user experience. This motivates the consolidation of specialized models into a single cross-environment policy. Weight merging directly merges domain-specific experts but can corrupt executable actions under expert disagreement, while on-policy distillation (OPD) avoids conflicting teacher supervision yet still treats all response tokens equally during distillation, ignoring that action tokens are the only interface between the environment and the agent. To address this, We introduce MAGA that re-allocates training signal according to the structured action. Based on the correctness of the generated action, it suppresses unnecessary or invalid distillation signals and focuses learning on erroneous actions. Besides, a training-only hint optimizes the supervision signal provided by domain-specific teachers without changing the student input. Across two model scales, MAGA achieves the highest mean success rate, outperforming the strongest baseline by 2.0% at 8B and achieves almost the same average performance with teachers.
- Abstract(参考訳): 大規模言語モデルに基づくグラフィカルユーザインタフェース(GUI)エージェントは、モバイル、Web、デスクトップ環境に展開されつつある。
しかしながら、既存のエージェントは通常ドメイン固有であり、デプロイメントとユーザエクスペリエンスを制限します。
このことは、特別なモデルを単一の環境横断ポリシーに統合する動機となっている。
軽量化はドメイン固有の専門家と直接統合するが、専門家の意見の相違の下で実行可能なアクションを破損させる可能性がある一方で、オンライン蒸留(OPD)は教師の監督の矛盾を避ける一方で、蒸留中に全ての応答トークンを等しく扱い、アクショントークンが環境とエージェントの間の唯一のインターフェースであることを無視している。
そこで我々は,MAGAを導入し,構造化動作に応じてトレーニング信号を再配置する。
生成した動作の正確性に基づいて、不要または無効な蒸留信号を抑制し、誤動作の学習に焦点を当てる。
さらに、訓練専用のヒントは、生徒の入力を変更することなく、ドメイン固有の教師によって提供される監督信号を最適化する。
2つのモデルスケールで、MAGAは最高平均成功率を達成し、8Bにおいて最強のベースラインを2.0%上回り、教師とほぼ同じ平均パフォーマンスを達成する。
関連論文リスト
- SAGA: Structure-Attended Generative Action Embedding Model that encodes Multi-Surface User Action Sequences [2.1762024189048224]
SAGAは、多面的ユーザインタラクションシーケンスをエンコードする生成アクション埋め込みモデルである。
SAGAの中心はフィールド単位のトークン化スキーマで、各アクションイベントを複数のフィールドレベルのトークンに分解する。
論文 参考訳(メタデータ) (2026-08-15T22:11:34Z) - dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - What Makes Interaction Trajectories Effective for Training Terminal Agents? [55.62817294510983]
Terminal-Legoは、現実世界の問題を環境検証されたエージェントタスクに変換するスケーラブルなパイプラインである。
下着剤であるDeepSeek-V3.2の軌跡を微調整した学生は、はるかに強力な一般化を示している。
Qwen3-32Bは15.3kの終端レゴ軌道しか持たず、終端ベンチ2.0で24.3%のスコアを獲得し、データボリュームの30倍以上で確立された以前のSOTAのパフォーマンスと競合する。
論文 参考訳(メタデータ) (2026-06-02T10:37:47Z) - Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning [42.1534425503333]
CrossAgentは異種作用空間をマスターし、軌道の各ステップで最も効果的なインターフェースを自律的に選択する統合エージェントモデルである。
オープンソースのMinecraft環境における800以上のタスクの実験は、CrossAgentが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2025-12-10T14:52:29Z) - Improving Multimodal Distillation for 3D Semantic Segmentation under Domain Shift [62.50795372173394]
我々は,ライダーポイント雲のセマンティックセグメンテーションのための教師なし領域適応において,視覚基盤モデル(VFM)を利用したレシピの同定を行う。
その結果、パイプラインは4つの広く認識され、困難な設定で、最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-11-21T17:57:43Z) - Robust Anti-Backdoor Instruction Tuning in LVLMs [53.766434746801366]
大規模視覚言語モデル(LVLM)のための軽量で認証に依存しない防御フレームワークについて紹介する。
私たちのフレームワークは、命令チューニングの下で、アダプタモジュールとテキスト埋め込み層のみを微調整します。
Flickr30kとMSCOCOに対する7つの攻撃に対する実験は、我々の攻撃の成功率をほぼゼロに低下させることを示した。
論文 参考訳(メタデータ) (2025-06-04T01:23:35Z) - Agent-Environment Alignment via Automated Interface Generation [10.469261669159367]
大言語モデル(LLM)エージェントは、対話的な意思決定タスクにおいて印象的な推論能力を示している。
エージェントの内部の期待と、発行されたアクションの影響と、環境における実際の状態遷移との間には、しばしばミスマッチが発生します。
我々は,環境の静的情報とエージェントに返されるステップワイズ観測の両方を強化するインタフェースであるtextbfALIGNを提案する。
論文 参考訳(メタデータ) (2025-05-27T11:44:50Z) - Structured Agent Distillation for Large Language Model [56.38279355868093]
本研究では,LLMをベースとした大規模エージェントを小さな学生モデルに圧縮するフレームワークであるStructured Agent Distillationを提案する。
提案手法は, [REASON] と [ACT] にトラジェクトリを分割し, 各コンポーネントを教師の行動に合わせるためにセグメント特異的な損失を適用した。
ALFWorld、HotPotQA-ReAct、WebShopの実験は、我々のアプローチがトークンレベルと模倣学習のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-05-20T02:01:55Z) - Towards Effective Federated Graph Foundation Model via Mitigating Knowledge Entanglement [9.87623531653534]
グラフ基礎モデル(GFM)は強力なドメイン一般化を提供するが、通常は単一のマシンで訓練される。
我々は,新しい分散GFMトレーニングパラダイムであるFedGFMを提案する。
主な課題は知識の絡み合いであり、多分野の知識は区別できない表現に融合する。
2つのコアモジュールを持つ拡張フレームワークであるFedGFM+を,知識の絡み合いを軽減するために提案する。
論文 参考訳(メタデータ) (2025-05-19T04:06:32Z) - InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners [41.22438639369124]
InfiGUI-R1は、Actor2Reasonerフレームワークを通じて開発されたMLLMベースのGUIエージェントである。
本研究では,教師モデルからMLLMへのクロスモーダル空間推論能力の伝達に空間推論蒸留を用いる。
Reinforcement Learning(強化学習)を用いて基礎的推論を熟考する。
論文 参考訳(メタデータ) (2025-04-19T09:25:55Z) - LACMA: Language-Aligning Contrastive Learning with Meta-Actions for
Embodied Instruction Following [142.25438780561603]
本稿では,メタアクションの概念を導入し,言語命令とエージェントのアクション空間間の意味的ギャップを埋める。
強力なマルチモーダルトランスフォーマーベースラインと比較して、目に見えない環境での絶対的な成功率は4.5%に達する。
論文 参考訳(メタデータ) (2023-10-18T21:43:07Z) - Contrastive Mean Teacher for Domain Adaptive Object Detectors [20.06919799819326]
平均教師の自己学習は、オブジェクト検出のための教師なしドメイン適応において強力なパラダイムであるが、低品質の擬似ラベルに苦しむ。
提案するContrastive Mean Teacher (CMT)は、2つのパラダイムが自然に統合され、有益な学習信号が最大化される統一的汎用フレームワークである。
CMTは、Fogdy Cityscapesで51.9%のmAPを達成し、これまでで最高の2.1%のmAPを達成している。
論文 参考訳(メタデータ) (2023-05-04T17:55:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。