論文の概要: CapField-OPD: Learning Continuous Capability Fields via Joint-Anchored Multi-Teacher On-Policy Distillation for Flow Models
- arxiv url: http://arxiv.org/abs/2609.34658v2
- Date: Tue, 29 Sep 2026 03:28:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.759199
- Title: CapField-OPD: Learning Continuous Capability Fields via Joint-Anchored Multi-Teacher On-Policy Distillation for Flow Models
- Title(参考訳): CapField-OPD:フローモデルのためのマルチ教師オンポリティ蒸留による連続的能力場学習
- Abstract要約: CapField-OPDは、複数の教師を明示的な機能座標を通じて、継続的な機能フィールドに統合する。
CapField-OPDは、セマンティクス保存の急激なバリエーションの下で、望まれる機能を確実に呼び出すことを示す。
継続的機能制御と座標ベースのテストタイムスケーリングをサポートする。
- 参考スコア(独自算出の注目度): 36.096981343084046
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward-specialized post-training produces strong experts for flow-based generative models, while multi-teacher on-policy distillation (OPD) consolidates their capabilities into a single student. Existing methods, however, route each prompt to a single teacher according to its semantic category, implicitly binding the desired capability to prompt content. This coupling makes capability invocation vulnerable to prompt perturbations and prevents users from explicitly adjusting the strength of the desired capability at inference time. In this work, we introduce CapField-OPD, an OPD framework that integrates multiple teachers into a continuous capability field through explicit capability coordinates. We use teacher models as anchors to construct this field, with the coordinates determining how their outputs are combined. Each capability configuration thus receives a unique supervision target, and capability control no longer depends on prompt semantics. Since the training anchors may not be optimal at inference time, we further profile the learned field on a small calibration set. The coordinate with the highest mean reward serves as the recommended default, while coordinates that are frequently optimal offer a promising candidate set for test-time scaling. Extensive experiments on compositional generation, text rendering, and visual aesthetics demonstrate that CapField-OPD consolidates multiple specialized teachers into a single student while preserving or surpassing their performance, reliably invokes the desired capabilities under semantics-preserving prompt variations, and supports continuous capability control and coordinate-based test-time scaling.
- Abstract(参考訳): Reward-specialized post-trainingはフローベース生成モデルの強力なエキスパートを輩出する一方、マルチテラーオンポリス蒸留(OPD)は、その能力を1人の学生に集約する。
しかし、既存の方法では、各プロンプトをそのセマンティックカテゴリに従って1つの教師にルーティングし、希望する能力を暗黙に結び付けてコンテンツをプロンプトする。
この結合により、迅速な摂動に弱い機能呼び出しが可能になり、ユーザは推論時に所望の能力の強度を明示的に調整することができない。
本稿では,複数の教師を明示的な能力座標により連続的な能力場に統合するOPDフレームワークであるCapField-OPDを紹介する。
このフィールドを構築するために教師モデルを使用し、それらの出力をどのように組み合わせるかを座標で決定します。
これにより、各機能構成にはユニークな監視対象が与えられ、機能制御はプロンプトセマンティクスに依存しなくなる。
トレーニングアンカーは推論時に最適ではない可能性があるので、学習したフィールドを小さな校正セットでプロファイルする。
最も高い平均報酬の座標は推奨デフォルトとして機能し、しばしば最適な座標はテスト時間スケーリングのための有望な候補セットを提供する。
CapField-OPDは、複数の専門教師を1人の学生に集約し、パフォーマンスを保存または超越させ、セマンティックス保存の即時変化の下で望ましい能力を確実に呼び出すとともに、継続的な能力制御と座標ベースのテストタイムスケーリングをサポートすることを実証している。
関連論文リスト
- Learning What to Activate: Combinatorial Capability Allocation for Long-Horizon Multimodal Agents [9.100664015233678]
ロングホライゾンのマルチモーダルエージェントは、知覚、検索、推論、検証、実行のための特別な能力に依存している。
既存の設計は、通常、固定された機能セットを起動するか、事前に定義されたワークフローを起動し、かなりの計算オーバーヘッドを発生させる。
スパース条件比較から,デプロイ可能な機能-サブセットポリシを回復するオンライン学習フレームワークであるtextscCoCAを紹介する。
論文 参考訳(メタデータ) (2026-08-20T13:39:47Z) - DanceOPD: On-Policy Generative Field Distillation [62.31008793798276]
本研究では,フローマッチングモデルのためのオンライン生成フィールド蒸留フレームワークであるDanceOPDを紹介する。
各サンプルを1つの機能フィールドにルーティングし、1つの低雑音の学生が引き起こした状態をクエリし、単純な速度MSE目的のトレーニングを行う。
T2I, 編集, リアリズム-フィールド吸収, CFG吸収に関する総合的な実験により, 提案手法は多機能化を図っている。
論文 参考訳(メタデータ) (2026-06-25T17:59:58Z) - Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning [13.499744113926505]
DRAPEは、MCITのために連続インスタンス固有のソフトプロンプトを合成するプロンプト学習フレームワークである。
DRAPEは、代表的なプロンプトベースとLoRAベースの連続学習ベースライン間の最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-11T15:59:06Z) - Cross-Sample Relational Fusion: Unifying Domain Generalization and Class-Incremental Learning [83.67663266193308]
CIL(Class-Incremental Learning)は、学習システムにおいて、それまでの知識を維持しつつ、新しいクラスを学ぶことを必要とする。
自動運転車のような現実のシナリオでは、晴れた日に都市部の道路で訓練されたシステムは、後に農村部や高速道路環境で運用する必要がある。
ドメインシフトと破滅的な忘れを同時に解決する統合フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-09T09:49:13Z) - Multiple Stochastic Prompt Tuning for Few-shot Adaptation under Extreme Domain Shift [14.85375816073596]
クラス毎に複数の学習可能なプロンプトを導入し,分布シフトによる視覚表現の多様なモードをキャプチャする。
これらのプロンプトは学習可能なガウス分布としてモデル化され、プロンプトパラメータ空間の効率的な探索を可能にする。
実験と最先端手法との比較により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2025-06-04T13:18:04Z) - Scalable In-Context Q-Learning [68.9917436397079]
textbfScalable textbfIn-textbfContext textbfQ-textbfLearning (textbfSICQL)を提案する。
textbfSICQLは動的プログラミングとワールドモデリングを利用して、ICRLを効率的な報酬とタスクの一般化に向けて制御する。
論文 参考訳(メタデータ) (2025-06-02T04:21:56Z) - Self-regulating Prompts: Foundational Model Adaptation without
Forgetting [112.66832145320434]
本稿では,PromptSRCと呼ばれる自己正規化フレームワークを提案する。
PromptSRCはタスク固有の汎用表現とタスクに依存しない汎用表現の両方に最適化するプロンプトを導く。
論文 参考訳(メタデータ) (2023-07-13T17:59:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。