論文の概要: WinDOM: Self-Family Distillation for Small-Model GUI Grounding
- arxiv url: http://arxiv.org/abs/2606.25964v1
- Date: Wed, 24 Jun 2026 15:35:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.38635
- Title: WinDOM: Self-Family Distillation for Small-Model GUI Grounding
- Title(参考訳): WinDOM: 小型GUIグラウンドリングのための自給自足蒸留
- Authors: Chengheng Li-Chen, Zhiqian Zhou, Hao Chen, Nicolas Chauvin,
- Abstract要約: 小型の(2B$2B)GUIグラウンドエージェントは、デバイス上のデプロイメント、アクセシビリティツール、低コストのイテレーションに魅力的です。
本研究では,高額な人的アノテーションを使わずに境界ボックス学習データを取得する方法と,教師付き微調整と強化学習の併用方法の2つのオープンレシピ問題に対処する。
- 参考スコア(独自算出の注目度): 4.953369796913278
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Small ($\sim$2B) GUI-grounding agents are attractive for on-device deployment, accessibility tooling, and low-cost iteration, but at this scale they face two open recipe questions: how to obtain bounding-box training data without expensive human annotation, and how to combine supervised fine-tuning with reinforcement learning. We address both, with the explicit goal of pushing small-model performance rather than scaling up. WinDOM is a $54{,}425$-record grounding corpus harvested by driving an open-source Windows 11 web reimplementation under headless Playwright, with bounding boxes read directly off the DOM and no OCR or human annotation. Self-Family Distillation (SFD) is a single rejection-sampling cold-start parameterised only by the teacher choice: either an EMA of the student (no external model) or a frozen larger same-family teacher. We then treat the saturation depth of the SFD cold-start as an explicit GRPO hyperparameter. On a Qwen3.5-2B student, the under-saturated cold-start is a better GRPO initialiser than the converged one: SFD-4B with Early-init RL gains $+5.4$ OOD-mean ($+3.5$ ScreenSpot-Pro, $+7.0$ OSWorld-G, $+5.8$ ScreenSpot-V2) over the base. The same-size EMA mode lands within roughly one OOD-mean point of the cross-size $4$B variant ($65.2$ vs $66.3$) without an external teacher.
- Abstract(参考訳): 小型($2B)のGUIグラウンドエージェントは、デバイス上でのデプロイメント、アクセシビリティツール、低コストのイテレーションに魅力的なものだが、この規模では、高価な人間のアノテーションなしでバウンディングボックストレーニングデータを取得する方法と、教師付き微調整と強化学習を組み合わせる方法という、2つのオープンレシピの疑問に直面している。
スケールアップではなく、小さなモデルのパフォーマンスを向上するという明確な目標を掲げて、両方に対処しています。
WinDOMは、540{,}425$-recordのグラウンドコーパスで、オープンソースのWindows 11 Web再実装をヘッドレスのPlaywrightで実行することで取得される。
自己家族蒸留 (Self-Family Distillation, SFD) は、教師の選択によってのみパラメータ化される単一の拒絶サンプリングコールドスタートである。
次に,SFDコールドスタートの飽和深度を明示的なGRPOハイパーパラメータとして扱う。
Qwen3.5-2Bの学生の場合、飽和度の低いコールドスタートは、収束したよりもGRPOの初期値として優れている: SFD-4B with Early-init RL gains $+5.4$ OOD-mean $+3.5$ ScreenSpot-Pro, $+7.0$ OSWorld-G, $+5.8$ ScreenSpot-V2)。
同サイズのEMAモードは、外部教師なしで4ドルB(65.2ドル対6.3ドル)のOOD平均点のほぼ1つに収まる。
関連論文リスト
- Stage-1 Controls the Entropy Regime, Not the Outcome [3.595796837069228]
2段階のポストトレーニングは、視覚言語モデルにますます使われている。
OPD用72B VLM教師を用いたQwen2.5-VL-7Bを用いた小規模データ研究において,Stage-1が実際にどのような制御を行うのかを問う。
論文 参考訳(メタデータ) (2026-06-08T05:49:09Z) - Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation [50.55853275866995]
リアルタイムのインタラクティブなビデオ生成には、低レイテンシ、ストリーミング、コントロール可能なロールアウトが必要である。
本稿では,フレームワイドの自己回帰を1~2ステップのサンプリングで行うという,よりアグレッシブな設定について検討する。
原理的かつスケーラブルなパイプラインである textbfCausal Forcing++ を提案する。
論文 参考訳(メタデータ) (2026-05-14T17:46:36Z) - Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training [20.04756350098974]
ラベル付き検証可能なトレーニングデータがバインディング制約である場合、各チェックされた例は、最も情報のあるモデルと報酬密度に割り当てるべきである。
スパース・シークエンス・レベルの報酬は、より良い振る舞いを探索し発見できるモデルにおいて最も有用であるが、より密集したトークンレベルの教師監督は、その振る舞いをより小さなデプロイメントモデルに圧縮するのにより適している。
論文 参考訳(メタデータ) (2026-05-12T17:57:48Z) - Zephyr: Direct Distillation of LM Alignment [59.03530095974505]
ユーザ意図に合わせた,より小さな言語モデルの実現を目指しています。
従来の研究では、より大規模なモデルに教師付き微調整(dSFT)を適用することにより、タスクの精度が大幅に向上することが示されている。
蒸留直接選好最適化(dDPO)を用いて,意図のアライメントを大幅に改善したチャットモデルを学習する。
論文 参考訳(メタデータ) (2023-10-25T19:25:16Z) - Enabling Differentially Private Federated Learning for Speech Recognition: Benchmarks, Adaptive Optimizers and Gradient Clipping [42.2819343711085]
DP付きFLは、少なくとも数百万のユーザを抱える場合、強力なプライバシー保証の下で有効であることを示す。
ASR の DP と FL の高 (低い) 個体群に外挿した場合, 単語誤り率を 1.3% に抑えたユーザレベル (7.2, 10-9$)-DP (4.5, 10-9$)-DP を実現する。
論文 参考訳(メタデータ) (2023-09-29T19:11:49Z) - Depth Dependence of $\mu$P Learning Rates in ReLU MLPs [72.14317069090407]
我々は、最大更新(mu$P)学習率の$n$と$L$に依存することを研究する。
我々は、$L3/2.$のように、$L$の非自明な依存があることを発見した。
論文 参考訳(メタデータ) (2023-05-13T01:10:49Z) - Differentially Private Deep Learning with ModelMix [14.445182641912014]
そこで本研究では,中間モデル状態のランダムアグリゲーションを行う, Em ModelMix と呼ばれる汎用最適化フレームワークを提案する。
トレーニング軌跡のエントロピーを利用した複合プライバシー分析を強化する。
本研究は,勾配クリッピングの効果に関する公式な研究である。
論文 参考訳(メタデータ) (2022-10-07T22:59:00Z) - High-dimensional Asymptotics of Feature Learning: How One Gradient Step
Improves the Representation [89.21686761957383]
2層ネットワークにおける第1層パラメータ $boldsymbolW$ の勾配降下ステップについて検討した。
我々の結果は、一つのステップでもランダムな特徴に対してかなりの優位性が得られることを示した。
論文 参考訳(メタデータ) (2022-05-03T12:09:59Z) - R-Drop: Regularized Dropout for Neural Networks [99.42791938544012]
ドロップアウト(Dropout)は、ディープニューラルネットワークのトレーニングを規則化する、強力で広く使用されているテクニックである。
モデルトレーニングにおけるドロップアウト時の単純な正規化戦略、すなわちR-Dropを導入し、異なるサブモデルの出力分布を互いに整合させる。
論文 参考訳(メタデータ) (2021-06-28T08:01:26Z) - Fine-Grained Gap-Dependent Bounds for Tabular MDPs via Adaptive
Multi-Step Bootstrap [84.66885506098724]
本稿では,アダプティブ・マルチステップ・ブートストラップ (AMB) を用いた表層有限水平マルコフ決定過程 (MDP) のモデルフリーアルゴリズムを提案する。
AMBは,部分最適ギャップの逆の和でのみスケールする,ギャップ依存的後悔境界を達成できることを示す。
また、AMB は $frac|Z_mul|Delta_min$ regret という追加の $frac|Z_mul|Delta_min$ を被っていることも示しています。
論文 参考訳(メタデータ) (2021-02-09T07:46:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。