論文の概要: Semantic Video Communication via Multi-Scale Convolution and Dynamic Routing for Next-Generation Networks
- arxiv url: http://arxiv.org/abs/2607.05093v1
- Date: Mon, 06 Jul 2026 13:52:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.167963
- Title: Semantic Video Communication via Multi-Scale Convolution and Dynamic Routing for Next-Generation Networks
- Title(参考訳): 次世代ネットワークのためのマルチスケールコンボリューションと動的ルーティングによるセマンティックビデオ通信
- Authors: Gengtian Shi, Jinze Yu, Chenhao Wu, Shaofei Wang, Eiji Fukuzawa, Junjie Tang, Hiroshi Onoda, Jiang Liu,
- Abstract要約: セマンティックビデオ通信のための生成AI対応フレームワークを提案する。
帯域幅制限伝送のための効率的な階層的時間的モデリングと,ネットワークエッジデバイスにおける映像コンテンツと自然言語クエリ間のロバストなセマンティックアライメントという2つの重要な課題に対処する。
- 参考スコア(独自算出の注目度): 7.704586969939547
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The exponential growth of video traffic demands novel semantic communication paradigms that transmit meaning rather than raw bits. We present a generative AI-enabled framework for semantic video communication addressing two critical challenges: efficient hierarchical temporal modeling for bandwidth-constrained transmission and robust semantic alignment between video content and natural language queries at network edge devices. Our approach introduces a multi-scale temporal convolutional encoder that captures motion patterns across different temporal granularities with O(T) complexity suitable for resource-constrained IoT deployments. We further propose a capsule-based dynamic routing mechanism that iteratively refines segment-query associations, enabling flexible modeling of non-monotonic semantic alignments essential for goal-oriented communication. These components are unified through a multi-task learning objective optimizing temporal boundary regression, cross-modal alignment, and capsule diversity. Experiments on ActivityNet Captions demonstrate significant improvements, achieving 42.9% Recall@0.5 and 41.1% mean IoU while maintaining computational efficiency critical for edge deployment.
- Abstract(参考訳): ビデオトラフィックの指数的増加は、生のビットではなく意味を伝達する新しい意味コミュニケーションパラダイムを必要とする。
ネットワークエッジデバイスにおける映像コンテンツと自然言語クエリ間のロバストなセマンティックなセマンティックアライメントと帯域制限伝送のための効率的な階層的時間的モデリングという,2つの重要な課題に対処する,セマンティックビデオ通信のための生成AI対応フレームワークを提案する。
提案手法では,資源制約型IoTデプロイメントに適したO(T)複雑性で,時間的粒度の異なる動きパターンをキャプチャするマルチスケールの時間的畳み込みエンコーダを提案する。
さらに、カプセルベースの動的ルーティング機構を提案し、セグメントクエリ関連を反復的に洗練し、ゴール指向通信に不可欠な非モノトニックなセマンティックアライメントの柔軟なモデリングを可能にする。
これらのコンポーネントは、時間的境界回帰、クロスモーダルアライメント、カプセルの多様性を最適化するマルチタスク学習目標を通じて統合される。
ActivityNet Captionsの実験では、42.9%のRecall@0.5と41.1%がIoUを意味し、エッジデプロイメントに不可欠な計算効率を維持している。
関連論文リスト
- Complementary and Contrastive Learning for Audio-Visual Segmentation [74.11434759171199]
本稿では,ローカル情報とグローバル情報の両方を処理可能な新しいフレームワークであるComplementary and Contrastive Transformer(CCFormer)を提案する。
提案手法は,S4, MS3, AVSSデータセットにまたがる最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2025-10-11T06:36:59Z) - Vision Transformer Based Semantic Communications for Next Generation Wireless Networks [3.8095664680229935]
本稿では視覚変換器(ViT)を用いた意味コミュニケーションフレームワークを提案する。
エンコーダ・デコーダ・フレームワークとしてViTを組み込むことで,提案アーキテクチャは画像から高いセマンティック・コンテントへ効率よくエンコードすることができる。
提案したViTネットワークに基づくアーキテクチャは,38dBのPak Signal-versato-noise Ratio(PSNR)を実現する。
論文 参考訳(メタデータ) (2025-03-21T16:23:02Z) - Take What You Need: Flexible Multi-Task Semantic Communications with Channel Adaptation [51.53221300103261]
本稿では,マスク付きオートエンコーダアーキテクチャに基づく,チャネル適応型・マルチタスク対応のセマンティックコミュニケーションフレームワークについて紹介する。
チャネル認識抽出器を用いて、リアルタイムのチャネル条件に応じて、関連情報を動的に選択する。
画像再構成や物体検出などのタスクにおける従来の手法と比較して,本手法の優れた性能を示す実験結果が得られた。
論文 参考訳(メタデータ) (2025-02-12T09:01:25Z) - Adaptive Semantic Token Selection for AI-native Goal-oriented Communications [11.92172357956248]
本稿では,AIネイティブな目標指向通信のための新しい設計を提案する。
我々は、帯域幅と計算量に対する動的推論制約の下でトランスフォーマーニューラルネットワークを利用する。
提案手法は,最先端のトークン選択機構よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-04-25T13:49:50Z) - Agent-driven Generative Semantic Communication with Cross-Modality and Prediction [57.335922373309074]
本稿では,強化学習に基づくエージェント駆動型ジェネリックセマンティックコミュニケーションフレームワークを提案する。
本研究では, エージェント支援型セマンティックエンコーダを開発し, 適応的セマンティック抽出とサンプリングを行う。
設計モデルの有効性をUA-DETRACデータセットを用いて検証し、全体的なA-GSCフレームワークの性能向上を実証した。
論文 参考訳(メタデータ) (2024-04-10T13:24:27Z) - Communication-Efficient Framework for Distributed Image Semantic
Wireless Transmission [68.69108124451263]
IoTデバイスを用いたマルチタスク分散画像伝送のためのFederated Learning-based semantic communication (FLSC)フレームワーク。
各リンクは階層型視覚変換器(HVT)ベースの抽出器とタスク適応トランスレータで構成される。
チャネル状態情報に基づく多重出力多重出力伝送モジュール。
論文 参考訳(メタデータ) (2023-08-07T16:32:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。