論文の概要: Lag-aware cross-hand alignment for dual-hand action segmentation
- arxiv url: http://arxiv.org/abs/2607.26215v1
- Date: Tue, 28 Jul 2026 19:31:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.460074
- Title: Lag-aware cross-hand alignment for dual-hand action segmentation
- Title(参考訳): 片手動作分割のためのラグ対応クロスハンドアライメント
- Abstract要約: ラグ・アウェア・クロス・ハンド・アライメント(Lag-Aware Cross-Hand Alignment, LACA)は,手固有の特徴ストリーム間の方向の時間-オフセット分布を明示的に推定する軽量モジュールである。
LACAは、推定オフセットからクロスハンド情報を検索し、学習されたヌル状態を組み込んで、互換性のあるクロスハンド遷移がサポートされていない場合に転送を抑制する。
HA-ViDとATTACHのトレーニングアノテーションの分析では、それぞれ44.7%と48.9%のトランジションアンカーの堅牢な非ゼロのクロスハンドマッチが示されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dual-hand action segmentation commonly fuses left- and right-hand representations at identical temporal indices, although coordinated hand transitions may occur with nonzero and time-varying delays. We introduce Lag-Aware Cross-Hand Alignment (LACA), a lightweight module that explicitly estimates directional temporal-offset distributions between hand-specific feature streams. LACA retrieves cross-hand information from the estimated offsets and incorporates a learned null state to suppress transfer when no compatible cross-hand transition is supported. Alignment is supervised using compatibility-aware targets derived automatically from frame-level training annotations, without requiring additional labels. Analysis of the HA-ViD and ATTACH training annotations reveals robust nonzero cross-hand matches for 44.7% and 48.9% of transition anchors, respectively, compared with 18.6% and 21.3% under temporally shifted controls. When integrated into Polyphony, LACA improves the two-hand mean F1@50 from 40.4 to 42.5 and boundary F1 from 56.5 to 59.6 on HA-ViD, and from 19.9 to 21.8 and 44.7 to 47.9, respectively, on ATTACH, relative to our reproduced Polyphony baseline. These gains require only approximately 0.0086 million additional trainable parameters. We further introduce LACA-C, a future-free variant that restricts alignment and the complete inference pipeline to current and past observations. On ATTACH, LACA-C achieves 83.6% transition-cue recall, a seed-averaged median availability delay of 233~ms, 0.72 false cues per minute, and segmentation-stage throughput of 224.9 current-position predictions per second. These results demonstrate that explicit cross-hand temporal alignment improves both action segmentation and boundary localization while supporting timely future-free perception.
- Abstract(参考訳): デュアルハンドアクションセグメンテーションは、通常、同じ時間指標で左右の表現を融合させるが、調整されたハンドトランジションは非ゼロおよび時間変化の遅延で起こる。
ラグ・アウェア・クロス・ハンド・アライメント(Lag-Aware Cross-Hand Alignment, LACA)は,手固有の特徴ストリーム間の方向の時間-オフセット分布を明示的に推定する軽量モジュールである。
LACAは、推定オフセットからクロスハンド情報を検索し、学習されたヌル状態を組み込んで、互換性のあるクロスハンド遷移がサポートされていない場合に転送を抑制する。
アライメントは、追加のラベルを必要とせず、フレームレベルのトレーニングアノテーションから自動的に派生した互換性を意識したターゲットを使用して管理される。
HA-ViD と ATTACH のトレーニングアノテーションの分析では、時間的にシフトした制御の下では、18.6% と 21.3% に対して、それぞれ44.7% と 48.9% の非ゼロのクロスハンドマッチが堅牢であることが示されている。
ポリフォニーに統合されると、LACAは2手平均F1@50を40.4から42.5に、境界F1を56.5から59.6に、それぞれ19.9から21.8と44.7から47.9に改善する。
これらのゲインには、約0.0086万のトレーニング可能なパラメータしか必要としない。
さらに、LACA-Cは、アライメントと完全な推論パイプラインを現在の観測と過去の観測に制限する将来の自由な変種である。
ATTACHでは、LACA-Cは83.6%のトランジッションキューリコール、233~msのシード平均中央可用性遅延、0.72の偽キュー、秒間224.9の分節ステージスループットを実現している。
これらの結果は, 時間的時間的アライメントが時間的自由な知覚をサポートしながら, 動作のセグメンテーションと境界のローカライゼーションの両方を改善することを示した。
関連論文リスト
- One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control [62.82372407840088]
同点領域勾配は、連続的な更新が出力空間で部分的に逆転する場合においても、ほぼ一定であることを示す。
トークンレベルのリバウンドリスクをランク付けするために,各イテレーションでフォーカスドメインを指定するOSOLを提案する。
OSOLは0.4822のドメイン-マクロ平均に達し、最強の比較ベースラインよりも5.7%向上した。
論文 参考訳(メタデータ) (2026-09-06T08:32:59Z) - ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation [6.874305530359895]
本稿では,凍ったFast-WAMをベースとした教師から,未来を意識した行動等価表現を蒸留する高密度pi0.5ポリシーであるForeTime-VLAを紹介する。
オンラインでは、8フレームの履歴エンコーダが操作フェーズと正規化された時間-遷移とともにこのターゲットを予測する。
テストMAEは0.134119から0.130593 (2.63%)に減少し、ペアリングブートストラップ95%CI:0.82-4.48%の改善、テストL2は2.46-2.93%の遅延コストで3.02%減少する。
論文 参考訳(メタデータ) (2026-08-21T04:40:41Z) - WASABI: Whole-graph Assignment-based Stabilizer for lAne topology By Inter-frame tracking [0.0]
最近の知覚モデルは、360度BEVビュー上の車載センサーから車線トポロジーを推定する。
出力は、検出ミス、LCLCの誤検出、過剰検出、ラベルフリックなどの構造不安定性を保っている。
本稿では,車線トポロジ出力をフレーム内およびフレーム間の両方で安定化する実時間後処理パイプラインWASABIを提案する。
論文 参考訳(メタデータ) (2026-07-22T05:59:22Z) - Reliable Extraction of Clinical Follow-Up Instructions: A Hybrid Neural-Symbolic Pipeline [43.0484058393522]
我々は,ニューラルシンボリックなハイブリッドパイプラインを直接生成に対して試験する。
本研究は,2000点の合成外用コーパスについて検討した。
論文 参考訳(メタデータ) (2026-05-26T05:14:33Z) - Hierarchical Flow Decomposition for Turning Movement Prediction at Signalized Intersections [4.885966337065846]
本研究では,階層型ディープラーニングフレームワークであるHFD-TMを提案する。
旋回運動を初めて予測し、その予測を個々の旋回ストリームに拡張することで、旋回運動を予測する。
テネシー州ナッシュビルの6つの交差点回廊から15分間隔のLiDARデータを6ヵ月間評価し、HFD-TMは1インターバルあたり平均2.49台の絶対誤差を達成している。
論文 参考訳(メタデータ) (2026-04-10T14:03:29Z) - Learning When to Act: Interval-Aware Reinforcement Learning with Predictive Temporal Structure [0.0]
本稿では,経験から認知的ティッチ間の最適間隔を学習する,軽量な時間制御システムを提案する。
また、選択した待ち時間に対する非効率性を明示するインターバルアウェア報酬を提案する。
論文 参考訳(メタデータ) (2026-03-23T16:46:17Z) - Scalable Multi-Task Low-Rank Model Adaptation [43.22544779625565]
マルチタスク低ランク適応(LoRA)を多数のタスクに拡張すると、破滅的なパフォーマンス劣化を引き起こす。
規則化や動的ルーティングのような既存のソリューションは、基本的なトレードオフによって制約されるため、スケールで失敗するのです。
3つの新しい設計を持つスケーラブルなソリューションであるmtLoRAを提案する。
論文 参考訳(メタデータ) (2026-03-02T06:57:11Z) - Temporal Zoom Networks: Distance Regression and Continuous Depth for Efficient Action Localization [6.908972852063454]
時間的行動の局所化は、正確な境界検出と計算効率の両方を必要とする。
我々は、境界距離回帰(BDR)と適応時間制限(ATR)という2つの補完的なイノベーションを通じてこの問題に対処する。
THUMOS14では、ActionFormer++ (55.7% mAP@0.7 at 235G) よりも36%少ないFLOPを用いて、151GのFLOPで56.5% mAP@0.7を達成する。
論文 参考訳(メタデータ) (2025-11-06T00:41:54Z) - Token-Level Inference-Time Alignment for Vision-Language Models [58.41370989069588]
VLM(Vision-Language Models)は、現代のマルチモーダルインテリジェンスの重要なバックボーンとなっている。
本稿では,基本VLMを凍結し,その分布を近似する報酬モデルをトレーニングする軽量フレームワークTITAを提案する。
推測中、暗黙の選好信号は報酬モデルと目標VLMの対数確率比として抽出され、密集した自己回帰フィードバックが得られる。
論文 参考訳(メタデータ) (2025-10-20T09:58:03Z) - Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models [57.474294329887236]
拡散大言語モデル (dLLMs) は反復的 denoising を通じてテキストを生成する。
現在のデコード戦略は、最終的な出力に有利なリッチな中間予測を捨てている。
時間的整合性を利用する2つの相補的手法を導入する。
論文 参考訳(メタデータ) (2025-08-12T17:59:57Z) - Action Segmentation with Joint Self-Supervised Temporal Domain
Adaptation [54.81021693364532]
我々は,アクションセグメンテーションのバリエーションの問題に対処するために,ラベルのないビデオを利用する。
本稿では,2つの自己監督型補助タスクを含む自己監督型時間領域適応(SSTDA)を提案する。
3つの挑戦的なデータセットにおいて、SSTDAは最先端の手法よりも大きなマージンで優れている。
論文 参考訳(メタデータ) (2020-03-05T18:52:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。