論文の概要: Sequentially-Controlled Interactive Multi-Particle Flow-Maps for Online Feedback-Driven Search
- arxiv url: http://arxiv.org/abs/2607.01144v1
- Date: Wed, 01 Jul 2026 16:27:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.989809
- Title: Sequentially-Controlled Interactive Multi-Particle Flow-Maps for Online Feedback-Driven Search
- Title(参考訳): オンラインフィードバック駆動検索のための逐次制御型対話型マルチパーティクルフローマップ
- Authors: Binglin Ji, Anindya Sarkar, Hengchang Lu, Jens Sjölund, Yevgeniy Vorobeychik,
- Abstract要約: IMPFM (Sequentially-Controlled Interactive Multi-Particle Flow-Maps) は、オンラインフィードバック駆動検索のサンプル効率向上のためのフレームワークである。
IMPFMは、フローマップを利用した粒子間での原則的かつ効率的な後部サンプル共有機構を導入している。
その結果,多粒子相互作用を意識したFeynman-Kac整流器が得られた。
- 参考スコア(独自算出の注目度): 26.617381371184635
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: While generative models have enabled training-free reward alignment, current methods typically excel in local exploration within narrow regions of the underlying distribution. These approaches struggle when preferences are unknown a priori and only revealed through sequential feedback-a scenario demanding broad exploration to uncover high-utility regions. To address this, we propose Sequentially-Controlled Interactive Multi-Particle Flow-Maps (IMPFM), a framework for sample-efficient online feedback-driven search. IMPFM progressively transports a group of interactive particles toward the target distribution, maintaining the broad coverage essential for heterogeneous preference alignment. IMPFM introduces a principled and efficient posterior sample sharing mechanism across particles powered by flow maps. By correcting individual particle drift with the collective posterior samples of the entire ensemble at each resampling step, the framework maximizes sample utility to enable global exploration while actively mitigating reward over-optimization, typical of standard control frameworks. Paired with a principled exploration-exploitation reweighting mechanism involving multi-particle interaction, this sequentially corrected multi-particle dynamics explicitly preserves structural diversity and overcomes the weight degeneracy inherent to standard SMC samplers. Crucially, we prove that the resulting sampling framework yields a multi-particle interaction-aware Feynman-Kac corrector that progressively steers the multi-particle system toward a KL-tilted target distribution, facilitating global exploration and preventing mode collapse. Extensive empirical evaluations and rigorous ablations across diverse search and alignment tasks confirm the efficacy of IMPFM over existing baselines.
- Abstract(参考訳): 生成モデルはトレーニング不要な報酬アライメントを可能にしているが、現在の手法は一般に、基礎となる分布の狭い領域内での局所的な探索に優れている。
これらのアプローチは、優先順位が不明で、シーケンシャルなフィードバックによってのみ明らかにされる場合に苦労する。
そこで本研究では,サンプル効率の高いオンラインフィードバック駆動検索フレームワークであるIMPFM(Interactive Multi-Particle Flow-Maps)を提案する。
IMPFMは、対話的な粒子群を対象の分布に向かって徐々に輸送し、不均一な選好アライメントに不可欠な広い範囲を維持する。
IMPFMは、フローマップを利用した粒子間での原則的かつ効率的な後部サンプル共有機構を導入している。
各再サンプリングステップにおける全アンサンブルの集合的後部サンプルを用いて個々の粒子のドリフトを補正することにより、サンプルユーティリティを最大化し、グローバルな探索を可能にし、標準制御フレームワークの典型である報酬過剰最適化を積極的に緩和する。
この逐次補正された多粒子力学は、構造的多様性を明示的に保ち、標準SMCサンプリング器に固有の重量縮退を克服する。
重要なことに, 得られたサンプリングフレームワークは多粒子相互作用を意識したFeynman-Kac補正器となり, KL型ターゲット分布に向けて段階的に多粒子系を操り, グローバルな探索とモード崩壊の防止を図っている。
多様な探索およびアライメントタスクにおける広範な経験的評価と厳密な改善は、既存のベースラインに対するIMPFMの有効性を裏付けるものである。
関連論文リスト
- N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization [55.14402862283128]
我々は,グループ相対政策最適化フレームワークに統合された新しい探索戦略であるN-GRPOを紹介する。
トークンレベルのサンプリングやネイティブな埋め込みレベルのノイズに頼るのではなく、Semantic Neighbor Mixingを活用する。
N-GRPOは、数学推論ベンチマークの強いベースラインよりも一貫した改善を達成し、また分布外タスクの堅牢な一般化能力を示す。
論文 参考訳(メタデータ) (2026-06-09T12:21:27Z) - Mixture Prototype Flow Matching for Open-Set Supervised Anomaly Detection [41.96735569500412]
Open-set supervised Anomaly Detection (OSAD) は、限られた異常監視を用いて、目に見えない異常を識別することを目的としている。
通常の特徴分布から構造付きガウス混合プロトタイプ空間への連続的な変換を学習するフレームワークを提案する。
MPFMは、シングルおよびマルチアノマリー設定の両方で、様々なベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-04T10:36:43Z) - From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space [78.36537400975298]
グループ相対政策最適化(GRPO)は、テキスト・ツー・イメージ(T2I)フローモデルにおいて、優先順位調整のための強力なフレームワークとして登場した。
条件空間を拡大することで関係探索を強化する新しい手法であるMulti-View GRPOを提案する。
MV-GRPOは最先端手法よりも優れたアライメント性能を実現する。
論文 参考訳(メタデータ) (2026-03-13T04:35:13Z) - Active Flow Matching [14.437387789022354]
アクティブフローマッチング(AFM)は、フローに沿った条件付きエンドポイント分布を操作するための変動目的を再構成する。
我々は、自己正規化重要度サンプリングを用いて、前方および逆のKullback-Leibler(KL)変異を導出する。
論文 参考訳(メタデータ) (2026-03-01T02:50:07Z) - SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning [50.93295951454092]
本稿では,カーネル化類似性を用いたサンプル軌道上で定義された設定レベル多様性の目的について紹介する。
提案手法は,各サンプル軌跡に対する余剰余剰貢献を導出し,この目的を政策最適化のためのプラグイン・アドバンテージ・シェーピング用語として統合する。
様々なモデルスケールで実験を行い、提案アルゴリズムの有効性を示し、様々なベンチマークでPass@1とPass@Kの双方において、強いベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-01T07:13:20Z) - Flow Density Control: Generative Optimization Beyond Entropy-Regularized Fine-Tuning [59.11663802446183]
フローおよび拡散生成モデルは、事前情報を保持しながらタスク固有の目的を最適化するために適応することができる。
本研究では,フロー密度制御(FDC)を導入し,複雑な問題をより単純な微調整タスクの特定のシーケンスに還元する。
我々は,近年のミラーフローの理解を活用して,現実的な仮定の下で提案されたスキームの収束保証を導出する。
論文 参考訳(メタデータ) (2025-11-27T17:19:01Z) - G$^2$RPO: Granular GRPO for Precise Reward in Flow Models [74.21206048155669]
本稿では,サンプリング方向の高精度かつ包括的な報酬評価を実現する新しいグラニュラー-GRPO(G$2$RPO)フレームワークを提案する。
複数の拡散スケールで計算された利点を集約するマルチグラニュラリティ・アドバンテージ・インテグレーション・モジュールを導入する。
G$2$RPOは既存のフローベースGRPOベースラインを著しく上回る。
論文 参考訳(メタデータ) (2025-10-02T12:57:12Z) - Annealing Flow Generative Models Towards Sampling High-Dimensional and Multi-Modal Distributions [6.992239210938067]
Annealing Flow (AF) は、高次元および多モード分布からサンプリングするための連続正規化フロー (CNF) 上に構築された手法である。
論文 参考訳(メタデータ) (2024-09-30T17:48:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。