論文の概要: FIS-OT: Feature-Induced Optimal Transport for Unsupervised Action Segmentation
- arxiv url: http://arxiv.org/abs/2608.29980v1
- Date: Sun, 30 Aug 2026 19:10:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.140521
- Title: FIS-OT: Feature-Induced Optimal Transport for Unsupervised Action Segmentation
- Title(参考訳): FIS-OT:unsupervised Action Segmentationのための特徴誘発最適輸送
- Abstract要約: 教師なしのアクションセグメンテーションは難しいタスクです。
ラベルなしでビデオのアクションカテゴリやバウンダリを見つける。
既存の Optimal Transport (OT) メソッドは、グローバルな制約を使用する。
これにより、ローカル情報の使用を見落としてしまう。
FIS-OTを提案する。これは、新しい特徴誘発構造的最適輸送フレームワークである。
- 参考スコア(独自算出の注目度): 4.0884287430909305
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unsupervised action segmentation is a challenging task. It involves finding action categories and boundaries in videos without labels. Existing Optimal Transport (OT) methods use global constraints. This causes them to overlook the use of local information. Furthermore, existing Optimal transport architectures are prone to confirmation bias because they overly trust the pseudo-labels they generate. This causes models to learn from noise in the early training stages. To address these issues, we propose FIS-OT. It is a novel Feature-Induced Structured Optimal Transport framework. First, we introduce a Feature Enhanced Generator (FEG) module. It serves as an internal regularizer. By using triplet loss, FEG captures local consistency. It provides robust supervision that is independent of noisy pseudo-labels. Second, we propose a Feature-Induced Residual Structural Prior. This combines a fixed temporal backbone with dynamic feature similarities. This design ensures temporal continuity. It also allows the solver to adapt to complex action structures. Finally, we establish a cyclic optimization loop. This aligns local feature learning with global structural alignment. Extensive experiments on the three datasets show the effectiveness of our method.
- Abstract(参考訳): 教師なしのアクションセグメンテーションは難しいタスクです。
ラベルなしでビデオのアクションカテゴリやバウンダリを見つける。
既存の Optimal Transport (OT) メソッドは、グローバルな制約を使用する。
これにより、ローカル情報の使用を見落としてしまう。
さらに、既存の最適輸送アーキテクチャは、彼らが生成する擬似ラベルを過度に信頼しているため、バイアスの確認が難しい。
これにより、モデルは初期のトレーニング段階でノイズから学習する。
これらの課題に対処するため,我々はFIS-OTを提案する。
これは、新しい特徴誘発構造的最適輸送フレームワークである。
まず、機能強化ジェネレータ(FEG)モジュールを紹介する。
内部レギュレータとして機能する。
三重項損失を用いることで、FEGは局所的な一貫性を捉える。
ノイズの多い擬似ラベルとは無関係に、堅牢な監視を提供する。
第2に,特徴誘発残留構造優先法を提案する。
これは固定時間バックボーンと動的特徴類似性を組み合わせたものである。
この設計は時間的連続性を保証する。
また、解法は複雑な作用構造に適応することができる。
最後に、循環最適化ループを確立する。
これにより、局所的な特徴学習とグローバルな構造的アライメントが整合する。
3つのデータセットに対する大規模な実験により,本手法の有効性が示された。
関連論文リスト
- Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion [31.189038928192648]
Co2Sは半教師付きRSセグメンテーションフレームワークで、ビジョン言語モデルと自己教師型モデルとを融合する。
テキスト埋め込みと学習可能なクエリを利用した,明示的でシンプルなセマンティックコガイダンス機構が導入された。
6つの一般的なデータセットに対する実験は,提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2025-12-28T18:24:19Z) - DynaPURLS: Dynamic Refinement of Part-aware Representations for Skeleton-based Zero-Shot Action Recognition [51.80782323686666]
textbfDynaPURLSは、堅牢でマルチスケールなビジュアル・セマンティック対応を確立する統一的なフレームワークである。
我々のフレームワークは、グローバルな動きと局所的な身体部分のダイナミクスの両方を含む階層的なテキスト記述を生成するために、大きな言語モデルを活用する。
NTU RGB+D 60/120とPKU-MMDを含む3つの大規模ベンチマークデータセットの実験は、DynaPURLSが先行技術よりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2025-12-12T10:39:10Z) - CADTrack: Learning Contextual Aggregation with Deformable Alignment for Robust RGBT Tracking [68.71826342377004]
RGB-Thermal (RGBT) トラッキングは、堅牢な全天候物体追跡のために可視および熱赤外モードを活用することを目的としている。
既存のRGBTトラッカーはモダリティの相違を解決するのに苦労している。
RGBT追跡のためのCADTrackと呼ばれる,変形可能なアライメントによるコンテキストアグリゲーション(Contextual Aggregation)を提案する。
論文 参考訳(メタデータ) (2025-11-22T08:10:02Z) - REALIGN: Regularized Procedure Alignment with Matching Video Embeddings via Partial Gromov-Wasserstein Optimal Transport [7.952582509792969]
実世界の命令データには、しばしばバックグラウンドセグメント、繰り返しアクション、順番に示されるステップが含まれている。
正規化部分グロモフ・ワッサースタイン最適輸送(R-FPGWOT)に基づく手続き学習のための自己指導型フレームワークREALIGNを紹介する。
KOTとは対照的に、我々の定式化は部分的なアライメントスキームの下で視覚的対応と時間的関係を共同でモデル化する。
論文 参考訳(メタデータ) (2025-09-29T07:32:14Z) - Delving into Dynamic Scene Cue-Consistency for Robust 3D Multi-Object Tracking [16.366398265001422]
3D多目的追跡は、自動運転分野において重要かつ困難な課題である。
本稿では,この原理を実現するために動的シーンCue-Consistency Tracker(DSC-Track)を提案する。
論文 参考訳(メタデータ) (2025-08-15T08:48:13Z) - GLCP: Global-to-Local Connectivity Preservation for Tubular Structure Segmentation [16.961703984508457]
本稿では,グローバル・ローカル・コネクティビティ保護(GLCP)フレームワークを提案する。
さらに,DAR(Dual-Attention-based Refinement)モジュールを設計し,セグメンテーション品質をさらに向上する。
我々のGLCPは、いくつかの最先端手法と比較して管状構造セグメンテーションの精度と連続性を向上する。
論文 参考訳(メタデータ) (2025-07-28T20:49:45Z) - SuperFlow++: Enhanced Spatiotemporal Consistency for Cross-Modal Data Pretraining [62.433137130087445]
SuperFlow++は、連続するカメラペアを使用して事前トレーニングと下流タスクを統合する新しいフレームワークである。
SuperFlow++は様々なタスクや運転条件で最先端のメソッドよりも優れています。
強力な一般化性と計算効率により、SuperFlow++は、自動運転におけるデータ効率の高いLiDARベースの認識のための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2025-03-25T17:59:57Z) - AttenScribble: Attentive Similarity Learning for Scribble-Supervised
Medical Image Segmentation [5.8447004333496855]
本稿では,単純かつ効果的なスクリブル教師あり学習フレームワークを提案する。
我々は、任意の完全畳み込みネットワーク(FCN)バックボーンの内部特徴層の上に、接続可能な空間自己アテンションモジュールを作成する。
この注意深い類似性は、セグメンテーション予測と視覚親和性の一貫性を課する新たな正規化損失をもたらす。
論文 参考訳(メタデータ) (2023-12-11T18:42:18Z) - Multi-body SE(3) Equivariance for Unsupervised Rigid Segmentation and
Motion Estimation [49.56131393810713]
本稿では、SE(3)同変アーキテクチャと、この課題に教師なしで取り組むためのトレーニング戦略を提案する。
本手法は,0.25Mパラメータと0.92G FLOPを用いて,モデル性能と計算効率を両立させる。
論文 参考訳(メタデータ) (2023-06-08T22:55:32Z) - Adaptive Spot-Guided Transformer for Consistent Local Feature Matching [64.30749838423922]
局所的特徴マッチングのための適応スポットガイド変換器(ASTR)を提案する。
ASTRは、統一された粗いアーキテクチャにおける局所的な一貫性とスケールのバリエーションをモデル化する。
論文 参考訳(メタデータ) (2023-03-29T12:28:01Z) - LiDAR-based Panoptic Segmentation via Dynamic Shifting Network [56.71765153629892]
LiDARベースのパノプティカルセグメンテーションは、オブジェクトとシーンを統一的に解析することを目的としている。
本稿では,ポイントクラウド領域における効果的な単視分割フレームワークとして機能する動的シフトネットワーク(DS-Net)を提案する。
提案するDS-Netは,現在の最先端手法よりも優れた精度を実現する。
論文 参考訳(メタデータ) (2020-11-24T08:44:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。