論文の概要: Improving Temporal Action Segmentation via Constraint-Aware Decoding
- arxiv url: http://arxiv.org/abs/2605.10149v1
- Date: Mon, 11 May 2026 07:55:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.621395
- Title: Improving Temporal Action Segmentation via Constraint-Aware Decoding
- Title(参考訳): Constraint-Aware Decodingによる時間的行動分割の改善
- Authors: Yeo Keat Ee, Debaditya Roy, Chen Li, Hao Zhang, Basura Fernando,
- Abstract要約: 時間的アクションセグメンテーション(TAS)は、未編集のビデオをラベル付きアクションセグメンテーションに分割する。
本稿では,TAS予測を強化する軽量な制約ベースの改善フレームワークを提案する。
提案手法は, 構造予測誤差を補正することにより, 完全教師付きTASモデルと半教師付きTASモデルの両方を改善する。
- 参考スコア(独自算出の注目度): 18.2371734918413
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Temporal action segmentation (TAS) divides untrimmed videos into labeled action segments. While fully supervised methods have advanced the field, challenges such as action variability, ambiguous boundaries, and high annotation costs remain, especially in new or low-resource domains. Grammar-based approaches improve segmentation with structural priors but rely on complex parsing limiting scalability. In this work, we propose a lightweight, constraint-based refinement framework that enhances TAS predictions by integrating statistical structural priors such as transition confidence, action boundary sets, and per-class duration, that can be directly extracted from annotated data. These constraints are integrated into a modified Viterbi decoding algorithm, allowing inference-time refinement without retraining or added model complexity. Our approach improves both fully and semi-supervised TAS models by correcting structural prediction errors while maintaining high efficiency. Code is available at https://github.com/LUNAProject22/CAD
- Abstract(参考訳): 時間的アクションセグメンテーション(TAS)は、未編集のビデオをラベル付きアクションセグメンテーションに分割する。
完全に教師された手法はこの分野を前進させたが、特に新しい領域や低リソース領域では、アクションの可変性、曖昧な境界、高いアノテーションコストといった課題が残っている。
文法に基づくアプローチは、構造的事前のセグメンテーションを改善するが、複雑なパーシング制限スケーラビリティに依存している。
本研究では,注釈付きデータから直接抽出可能な遷移信頼度,行動境界セット,クラスごとの時間といった統計的構造的事前情報を統合することにより,TAS予測を強化する軽量な制約ベース改良フレームワークを提案する。
これらの制約は修正されたビタビ復号アルゴリズムに統合され、再トレーニングやモデル複雑性の追加なしに推論時間の改善が可能となる。
提案手法は,高効率を維持しつつ構造予測誤差を補正することにより,完全教師付きTASモデルと半教師付きTASモデルの両方を改善する。
コードはhttps://github.com/LUNAProject22/CADで入手できる。
関連論文リスト
- IMPACT-Scribe: Interactive Temporal Action Segmentation with Boundary Scribbles and Query Planning [75.72434806468884]
IMPACT-Scribeは高密度ラベリングのための修正駆動のフレームワークである。
不確実性を認識した境界管理、局所的な提案モデリング、コストを意識したクエリ計画、構造化された伝搬、修正駆動適応を組み合わせる。
実験と人間の研究により、このクローズドループの設計は、努力ごとのラベル付け品質を改善し、境界精度を高め、時間とともにより良い人間機械の相互作用を促進することが示されている。
論文 参考訳(メタデータ) (2026-05-03T01:45:58Z) - Boundary-Centric Active Learning for Temporal Action Segmentation [0.34785805439031336]
B-ACTは,高平均境界領域に監督を明示的に割り当てる,クリップ予算のアクティブラーニングフレームワークである。
B-ACTは階層的な2段階のループで動作し、 (i) 予測の不確実性を用いてラベル付きビデオのランク付けとクエリを行い、 (ii) 選択されたビデオの中からトップ$K$境界を選択する。
論文 参考訳(メタデータ) (2026-04-16T15:50:21Z) - Combining Boundary Supervision and Segment-Level Regularization for Fine-Grained Action Segmentation [20.7405249370601]
本稿では,新たに1つの出力チャネルと2つの補助損失項のみを付加することで,細粒度セグメンテーション品質を向上させる軽量なデュアルロストレーニングフレームワークを提案する。
提案手法は,単一チャネル境界予測とCDFに基づくセグメントレベルの正規化損失による時間的局所化を促進する境界回帰損失を組み合わせたものである。
3つのベンチマークデータセット間で、提案手法はセグメントレベルの一貫性とバウンダリ品質を改善し、3つの異なるモデルでより高いF1とEditスコアを得る。
論文 参考訳(メタデータ) (2026-04-02T10:15:33Z) - Decomposing and Composing: Towards Efficient Vision-Language Continual Learning via Rank-1 Expert Pool in a Single LoRA [50.97792275353563]
単一低ランク適応 (LoRA) モジュールを分解可能な Rank-1 エキスパートプールとして再構成する,新しいフレームワークを提案する。
本手法では,このエキスパートプールから[Guided]トークンのセマンティクスに導かれて,疎結合でタスク固有の更新を動的に作成することを学ぶ。
論文 参考訳(メタデータ) (2026-01-30T10:54:51Z) - Towards Generalizable Trajectory Prediction Using Dual-Level Representation Learning And Adaptive Prompting [107.4034346788744]
既存の車両軌道予測モデルは、一般化可能性、予測の不確実性、複雑な相互作用を扱う。
本研究では,(1)自己拡張(SD)とマスドレコンストラクション(MR)による二重レベル表現学習,グローバルコンテキストと細部の詳細の収集,(2)レジスタベースのクエリと事前学習の強化,クラスタリングと抑圧の必要性の排除,(3)微調整中の適応型プロンプトチューニング,メインアーキテクチャの凍結,および少数のプロンプトの最適化といった,新たなトラジェクタ予測フレームワークであるPerceiverを提案する。
論文 参考訳(メタデータ) (2025-01-08T20:11:09Z) - Dynamic Integration of Task-Specific Adapters for Class Incremental Learning [32.124078616314144]
非典型的なクラス インクリメンタルラーニング (NECIL) では、モデルがスクラッチからリトレーニングしたり、古いタスク インクリメンタルを格納したりすることなく、新しいクラスを継続的に取得できる。
本稿では,タスク特化アダプタ統合(TSAI)とパッチレベルモデルアライメントという,タスク特化アダプタの動的統合(DIA)という新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-23T13:01:33Z) - Faster Diffusion Action Segmentation [9.868244939496678]
時間的行動分類(TAS)はビデオ解析において不可欠な課題であり、連続したフレームを別のアクションセグメントに分割し分類することを目的としている。
拡散モデルの最近の進歩は、安定したトレーニングプロセスと高品質な生成能力により、TASタスクにおいて大きな成功を収めている。
本稿では,効率的かつ高性能なTASアルゴリズムであるEffiDiffActを提案する。
論文 参考訳(メタデータ) (2024-08-04T13:23:18Z) - A Simple Baseline for Semi-supervised Semantic Segmentation with Strong
Data Augmentation [74.8791451327354]
セマンティックセグメンテーションのためのシンプルで効果的な半教師付き学習フレームワークを提案する。
単純な設計とトレーニングのテクニックのセットは、半教師付きセマンティックセグメンテーションの性能を大幅に向上させることができる。
本手法は,Cityscapes と Pascal VOC データセットの半教師付き設定において,最先端の処理結果を実現する。
論文 参考訳(メタデータ) (2021-04-15T06:01:39Z) - Boundary-sensitive Pre-training for Temporal Localization in Videos [124.40788524169668]
本稿では,時間的局所化のためのモデル事前学習について,新しい境界感性プレテキスト(BSP)タスクを導入して検討する。
合成された境界により、BSPは境界型を分類することで簡単に実行できる。
大規模な実験により、提案したBSPは既存の行動分類に基づく事前学習法よりも優れ、相補的であることが示された。
論文 参考訳(メタデータ) (2020-11-21T17:46:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。