論文の概要: DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception
- arxiv url: http://arxiv.org/abs/2606.26398v2
- Date: Tue, 30 Jun 2026 17:31:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.69723
- Title: DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception
- Title(参考訳): DinoLink: 帯域制限付き協調V2X知覚のためのToken-Centric Representation Compression Framework
- Authors: Tianle Zhu, Haohua Que, Handong Yao, Hongyi Xu, Zhipeng Bao,
- Abstract要約: DinoLinkはトークン中心の圧縮フレームワークで、生のピクセルストリーミングを、車両とクラウドの協調推論のための個別のセマンティック通信に置き換える。
提案手法は,制約付きV2Xシナリオにおける高忠実度リモート認識において,DinoLinkをロバストで帯域幅効率のよいものとして実証した。
- 参考スコア(独自算出の注目度): 9.324909804811544
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-precision remote perception is often hindered by the severe bandwidth constraints of Vehicle-to-Everything (V2X) networks. We propose \textit{DinoLink}, a token-centric compression framework that replaces raw pixel streaming with discrete semantic communication for vehicle-cloud collaborative inference. DinoLink employs a dual-sparsity architecture: a saliency-aware selector prunes redundant background tokens, while a Residual Vector Quantization (RVQ) module collapses features into compact codebook indices. By transmitting only lightweight indices and positional priors, DinoLink achieves a $139\times$ bitrate reduction compared to uncompressed transmission while maintaining a competitive 32.8\% mAP on the nuScenes dataset. Deployment simulations further demonstrate a $34.5\times$ acceleration in narrow-band environments, such as LoRa. Our results substantiate DinoLink as a robust, bandwidth-efficient frontend for high-fidelity remote perception in constrained V2X scenarios. The code is publicly available at https://github.com/UGA-MOBILITY-LAB/dino_link.
- Abstract(参考訳): 高精度リモート認識は、V2Xネットワークの厳しい帯域制限によってしばしば妨げられる。
そこで我々は,車両とクラウドの協調推論のために,生のピクセル・ストリーミングを個別のセマンティック・コミュニケーションに置き換えるトークン中心圧縮フレームワークである‘textit{DinoLink} を提案する。
DinoLinkは二重スパーシティアーキテクチャを採用しており、サリエンシ対応セレクタは冗長なバックグラウンドトークンをプーンし、Residual Vector Quantization (RVQ)モジュールは機能をコンパクトなコードブックインデックスに分解する。
軽量なインデックスと位置情報のみを送信することで、nuScenesデータセット上で競合する32.8\% mAPを維持しながら、非圧縮送信と比較して139\times$bitrateの削減を実現している。
デプロイシミュレーションはさらに、LoRaのような狭帯域環境での34.5\times$Accelerationを実証している。
この結果は,制約付きV2Xシナリオにおける高忠実度リモート認識のための,頑健で帯域幅効率のよいフロントエンドとしてDinoLinkを裏付けるものである。
コードはhttps://github.com/UGA-MOBILITY-LAB/dino_linkで公開されている。
関連論文リスト
- TSFLora: Token-Compressed Split Fine-Tuning for Wireless Edge Networks [41.95924024036396]
TSFLoraは、エッジでの通信効率の高いLAM適応のためのトークン圧縮スプリット微調整フレームワークである。
TSFLoraは、注意誘導型トークン選択、トークンマージ、低ビットアクティベーション量子化、LoRAベースの適応を、分割されたフェデレーショントレーニングパイプライン内で組み合わせる。
論文 参考訳(メタデータ) (2026-05-17T08:50:01Z) - Progressive Semantic Communication for Efficient Edge-Cloud Vision-Language Models [0.3004066195320147]
VLM(Vision-Language Models)は、リソース制約のある組み込みプラットフォームへのデプロイが困難である。
クラウドへの完全なオフロード推論は、帯域幅に制限のある環境では現実的ではないことが多い。
エッジクラウドVLM推論のためのプログレッシブセマンティック通信フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T10:16:06Z) - WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference [56.297697169678095]
WISV(Wireless-Informed Semantic Verification)は、分散投機的復号化フレームワークである。
WISVは最大60.8%の許容長の増加、37.3%の対話ラウンドの削減、31.4%のエンドツーエンドレイテンシの改善を実現している。
NVIDIA Jetson AGX OrinとA40搭載サーバからなるハードウェアテストベッド上でWISVを検証する。
論文 参考訳(メタデータ) (2026-04-20T01:29:56Z) - Generation Is Compression: Zero-Shot Video Coding via Stochastic Rectified Flow [1.8898767128464697]
emphGenerative Video Codebook Codec (GVCC)は、事前訓練されたビデオ生成モデルをそれ自体に変換するゼロショットフレームワークである。
この統合されたバックボーン上に構築された3つの条件付け戦略 – emphImage-to-Video (I2V), emphText-to-Video (T2V), emphFirst-Last-Frame-to-Video (FLF2V) – をインスタンス化する。
論文 参考訳(メタデータ) (2026-03-27T16:33:20Z) - Towards Practical Lossless Neural Compression for LiDAR Point Clouds [84.36825469211375]
高精度な幾何学的詳細の極端に広い範囲は、効率的な文脈モデリングを妨げる。
私たちのフレームワークは2つの軽量モジュールで構成されています。
実験では、リアルタイムに競争力のある圧縮性能を示す。
論文 参考訳(メタデータ) (2026-03-26T10:02:07Z) - ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression [19.538318240352424]
ロスレスモデル圧縮は、ビットエクササイズ大言語モデル(LLM)サービスにおけるメモリと帯域幅のボトルネックを軽減するために、非常に有望である。
既存のアプローチは、GPUアーキテクチャと基本的な設計ミスマッチのため、かなり推論が遅くなることが多い。
我々は、効率的なLLM推論のために共同設計されたロスレス圧縮フレームワークZipServを提案する。
論文 参考訳(メタデータ) (2026-03-18T07:21:21Z) - V2X-DSC: Multi-Agent Collaborative Perception with Distributed Source Coding Guided Communication [25.092575199683747]
協調知覚は、マルチエージェント観察を融合させて3次元理解を改善するが、中間機能共有は厳しい帯域幅制約に直面している。
本稿では,帯域幅制限型核融合のための条件付きコーデック(DCC)フレームワークであるV2X-DSCを提案する。
DAIR-V2X、OPV2V、V2X-Realの実験では、KBレベルの通信下での最先端の精度帯域幅トレードオフが示されている。
論文 参考訳(メタデータ) (2026-01-31T12:16:58Z) - VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction [55.66673587952058]
ビデオ理解モデルは、大規模データセットの禁止ストレージと計算コストによって、ますます制限されている。
VideoCompressaはビデオデータ合成のための新しいフレームワークで、動的潜在圧縮として問題を再構成する。
論文 参考訳(メタデータ) (2025-11-24T07:07:58Z) - CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs [89.79139531731637]
ビジョントランスフォーマー (ViT) は様々なビジョンタスクの最先端モデルとして登場した。
本稿では,高次アンダーライン精度,高速アンダーライン推論速度,下流タスクに対する好適なアンダーライン変換性を両立させたViTの合同アンダーライン圧縮法を提案する。
論文 参考訳(メタデータ) (2023-09-27T16:12:07Z) - Attention-based Feature Compression for CNN Inference Offloading in Edge
Computing [93.67044879636093]
本稿では,デバイスエッジ共振器におけるCNN推論の計算負荷について検討する。
エンドデバイスにおける効率的な特徴抽出のための新しいオートエンコーダベースのCNNアーキテクチャ(AECNN)を提案する。
実験の結果、AECNNは中間データを約4%の精度で256倍圧縮できることがわかった。
論文 参考訳(メタデータ) (2022-11-24T18:10:01Z) - Learning for Video Compression with Recurrent Auto-Encoder and Recurrent
Probability Model [164.7489982837475]
本稿では、リカレントオートエンコーダ(RAE)とリカレント確率モデル(RPM)を用いたリカレントラーニングビデオ圧縮(RLVC)手法を提案する。
RAEは、ビデオフレーム間の時間的相関を利用するために、エンコーダとデコーダの両方で繰り返しセルを使用する。
提案手法は,PSNRとMS-SSIMの両方の観点から,最先端の学習ビデオ圧縮性能を実現する。
論文 参考訳(メタデータ) (2020-06-24T08:46:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。