論文の概要: Structure over Depth: A Single-Block Spatio-Temporal Transformer for Multi-Entity Reasoning
- arxiv url: http://arxiv.org/abs/2607.23077v1
- Date: Sat, 25 Jul 2026 07:02:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.989029
- Title: Structure over Depth: A Single-Block Spatio-Temporal Transformer for Multi-Entity Reasoning
- Title(参考訳): 深度構造:マルチエンティティ推論のための単一ブロック時変器
- Abstract要約: マルチエンティティの時間データは、エンティティ、時間、およびそれらの相互作用間の依存関係をキャプチャする必要がある。
トランスフォーマーベースのアプローチはよく分解されるが、しばしばこれら不均一な依存関係を暗黙的に学ぶために深いレイヤスタックに依存している。
本稿では,3つ全てを1つのステージ内で明示的にモデル化する構造化時間自己アテンション変換器ブロックを提案する。
我々は,ビデオに基づくグループ活動認識,骨格に基づくヒューマンインタラクション分析,ウェアラブルセンサによる活動認識のアプローチを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modeling multi-entity temporal data requires capturing dependencies across entities, time, and their interactions. Transformer-based approaches perform well but often rely on deep stacks of layers to learn these heterogeneous dependencies implicitly, increasing computational cost. We revisit this problem from a structural perspective and decompose multi-entity temporal dynamics into three interaction types: spatial interactions among entities, temporal interactions across time, and cross interactions coupling the two domains. We propose a structured spatio-temporal transformer block that explicitly models all three within a single stage. It uses parallel spatial and temporal self-attention, followed by bidirectional cross-attention, and combines the outputs through learnable gated fusion. By directly encoding these complementary views, the model reduces the need for deep stacking. We evaluate the approach on video-based group activity recognition, skeleton-based human interaction analysis, and wearable sensor-based activity recognition. Despite its simplicity, the single structured Transformer block matches or outperforms deeper architectures with only 1.76M parameters. The results suggest that depth in prior models partly compensates for implicit and entangled interaction modeling, whereas explicit factorization offers a more efficient and transparent alternative. More broadly, this work supports a structure-first design principle: expressive multi-entity temporal reasoning can emerge by exposing interaction structure rather than relying on depth.
- Abstract(参考訳): 多元性時間データのモデリングには、エンティティ、時間、およびそれらの相互作用間の依存関係をキャプチャする必要がある。
トランスフォーマーベースのアプローチはよく機能するが、これらの不均一な依存関係を暗黙的に学習するため、計算コストが増大する。
我々は、この問題を構造的観点から再考し、マルチエンタリティ時間力学を3つの相互作用タイプ(エンティティ間の空間的相互作用、時間間の時間的相互作用、そして2つのドメイン間の相互相互作用)に分解する。
本稿では,3つ全てを1つのステージ内で明示的にモデル化した時空間変圧器ブロックを提案する。
並列的な空間的・時間的自己意図を使い、次いで双方向の相互意図を持ち、学習可能なゲート融合を通じて出力を結合する。
これらの補完的なビューを直接エンコードすることで、モデルは深い積み重ねの必要性を減らすことができる。
我々は,ビデオに基づくグループ活動認識,骨格に基づくヒューマンインタラクション分析,ウェアラブルセンサによる活動認識のアプローチを評価する。
その単純さにもかかわらず、単一の構造化トランスフォーマーブロックは1.76万のパラメータしか持たず、より深いアーキテクチャにマッチする。
その結果、事前モデルの深さは暗黙的および絡み合った相互作用モデリングを部分的に補うのに対し、明示的分解はより効率的で透明な代替手段を提供することが示された。
より広くは、この研究は構造第一の設計原則を支持している: 表現的多元性時間的推論は、深さに頼るのではなく相互作用構造を露呈することによって現れる。
関連論文リスト
- Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing [7.704586969939547]
ビデオテキストの時間的ローカライゼーションには、自然言語クエリと対応するビデオセグメントの正確なアライメントが必要である。
本稿では,既存手法の2つの限界に対処する新しい枠組みを提案する。
その結果,階層型時間モデルと構造化セマンティック・ルーティングを組み合わせることで,ビデオ言語理解に有効な解が得られた。
論文 参考訳(メタデータ) (2026-07-06T13:52:46Z) - HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions [23.788389187142446]
クロスタイプオブジェクトインタラクションを含む一般化可能な操作は、ロボティクスにおいて決定的だが難しい能力である。
既存の基盤モデルに基づくアプローチは、しばしば、これらのステージの区別を曖昧にするエンドツーエンドの学習を採用する。
We propose HeteroGenManip, a task-conditioned, two-stage framework designed to deouple initial grasp from complex interaction execution。
論文 参考訳(メタデータ) (2026-05-11T08:48:02Z) - TopoOR: A Unified Topological Scene Representation for the Operating Room [54.50897207203292]
手術シーングラフは外科手術室(OR)の複雑さを実体の構造とその関連性に抽象化する。
マルチモーダルな手術室を高次構造としてモデル化する新しいパラダイムであるTopoORを紹介する。
また,多様体の構造やモジュラリティに特有な特徴を明示的に保存する高次アテンション機構を提案する。
論文 参考訳(メタデータ) (2026-03-10T10:19:42Z) - PAct: Part-Decomposed Single-View Articulated Object Generation [45.04652409374895]
アーティキュレートされたオブジェクトは、AI、ロボティクス、VR/ARなど、インタラクティブな3Dアプリケーションの中心である。
明示的な部分認識条件下で部分幾何学, 構成, 調音を合成する, 調音オブジェクト生成のための部分中心生成フレームワークを提案する。
我々の表現は、オブジェクトを可動部品の集合としてモデル化し、それぞれ、部品のアイデンティティと調音の手がかりを付加した潜在トークンで符号化する。
論文 参考訳(メタデータ) (2026-02-16T17:45:44Z) - Diffusion Forcing for Multi-Agent Interaction Sequence Modeling [52.769202433667125]
MAGNetはマルチエージェントモーション生成のための統合された自己回帰拡散フレームワークである。
フレキシブルな条件付けとサンプリングを通じて、幅広いインタラクションタスクをサポートする。
緊密に同期された活動と、ゆるやかに構造化された社会的相互作用の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-12-19T18:59:02Z) - InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs [72.5651722107621]
InterAgentはテキスト駆動型物理ベースのマルチエージェントヒューマノイド制御のためのエンドツーエンドフレームワークである。
本稿では,マルチストリームブロックを備えた自己回帰拡散トランスフォーマーを提案する。
また,空間依存性の微粒化を明示的に捉えた対話グラフのエクスセプション表現を提案する。
論文 参考訳(メタデータ) (2025-12-08T10:46:01Z) - Efficient Multi-Person Motion Prediction by Lightweight Spatial and Temporal Interactions [45.51160285910023]
空間的・時間的相互作用を単純化し,多人数動作予測のための計算効率の良いモデルを提案する。
CMU-Mocap, MuPoTS-3D, 3DPW の標準データセット上で, マルチメトリックの最先端性能を実現する。
論文 参考訳(メタデータ) (2025-07-13T02:16:37Z) - UniTST: Effectively Modeling Inter-Series and Intra-Series Dependencies for Multivariate Time Series Forecasting [98.12558945781693]
フラット化されたパッチトークンに統一された注意機構を含む変圧器ベースモデルUniTSTを提案する。
提案モデルでは単純なアーキテクチャを採用しているが,時系列予測のためのいくつかのデータセットの実験で示されたような,魅力的な性能を提供する。
論文 参考訳(メタデータ) (2024-06-07T14:39:28Z) - A Decoupled Spatio-Temporal Framework for Skeleton-based Action
Segmentation [89.86345494602642]
既存の手法は、弱い時間的モデリング能力に制限されている。
この問題に対処するために、Decoupled Scoupled Framework (DeST)を提案する。
DeSTは計算量が少なく、現在の最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2023-12-10T09:11:39Z) - Spatial-Temporal Graph Enhanced DETR Towards Multi-Frame 3D Object Detection [54.041049052843604]
STEMDは,多フレーム3Dオブジェクト検出のためのDETRのようなパラダイムを改良した,新しいエンドツーエンドフレームワークである。
まず、オブジェクト間の空間的相互作用と複雑な時間的依存をモデル化するために、空間的時間的グラフアテンションネットワークを導入する。
最後に、ネットワークが正のクエリと、ベストマッチしない他の非常に類似したクエリを区別することが課題となる。
論文 参考訳(メタデータ) (2023-07-01T13:53:14Z) - Deep Structural Point Process for Learning Temporal Interaction Networks [7.288706620982159]
時間的相互作用ネットワークは、ユーザとアイテム間の時系列的相互作用からなる。
従来の手法では時間的相互作用ネットワークの構造情報を考慮できず、必然的に準最適結果につながる。
本稿では,時間的相互作用ネットワークを学習するためのDSPP(Deep Structure Point Process)を提案する。
論文 参考訳(メタデータ) (2021-07-08T03:07:34Z) - Cascaded Human-Object Interaction Recognition [175.60439054047043]
マルチステージで粗大なHOI理解のためのカスケードアーキテクチャを提案する。
各段階で、インスタンスローカライゼーションネットワークは、HOI提案を段階的に洗練し、インタラクション認識ネットワークにフィードする。
慎重に設計された人間中心の関係機能により、これらの2つのモジュールは効果的な相互作用理解に向けて協調的に機能する。
論文 参考訳(メタデータ) (2020-03-09T17:05:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。