論文の概要: Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference
- arxiv url: http://arxiv.org/abs/2609.01200v1
- Date: Tue, 01 Sep 2026 13:07:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.673859
- Title: Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference
- Title(参考訳): 圧縮AIトラフィック: 分割視覚言語推論における視覚的表現の標準化されたニューラルネットワーク符号化
- Authors: Reza Heidari, Hamed R. Tavakoli, Juho Kannala,
- Abstract要約: ビデオ-MMEの精度は、送信されたBF16テンソルの98%まで圧縮されていない基準に近づき、その後崩壊する。
オープンエンドMLVU生成はLLM判定の下で同じプラトー・アンド・ロバスト性を示す。
- 参考スコア(独自算出の注目度): 15.357950338341285
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When the visual encoder and the language decoder of a vision-language model (VLM) run on different compute nodes, the intermediate visual-token embeddings become a communicated payload rather than an internal activation. We call such machine-consumed intermediate tensors AI traffic and ask how far they can be compressed with a standardized, training-free codec. We insert ISO/IEC 15938-17 Neural Network Coding (NNC) round trips on the complete visual interface of a Qwen3-VL-8B-Instruct video question answering pipeline, comprising the main visual-token representation and the DeepStack feature streams, while leaving weights, prompts, and generation untouched, and sweep the quantization parameter (QP) over a wide rate range. Closed-ended Video-MME accuracy remains close to the uncompressed reference up to a 98% reduction of the transmitted BF16 tensor and only then collapses; open-ended MLVU generation shows the same plateau-and-collapse profile under an LLM judge. This robustness is not due to near-lossless reconstruction: the decoded tensor is heavily discretized, carries substantial row-wise relative L2 error, and has a visibly steeper singular-value decay than its source. Downstream reasoning therefore depends on coarse structure and relative geometry rather than exact floating-point values, which argues for rate-task rather than rate-distortion optimization of AI traffic codecs.
- Abstract(参考訳): 視覚言語モデル(VLM)の視覚エンコーダと言語デコーダが異なる計算ノード上で動作した場合、中間視覚トーケン埋め込みは内部アクティベーションではなく通信ペイロードとなる。
このような機械消費中間テンソルをAIトラフィックと呼び、標準化されたトレーニング不要のコーデックでどの程度圧縮できるかを問う。
Qwen3-VL-8B-Instruct video question answering pipeline, includes the main visual-token representation and the DeepStack feature stream, while left weights, prompts and generation untouched, and sweep the Quantization parameter (QP) over a wide rate range。
クローズドエンドビデオ-MME精度は、送信されたBF16テンソルの98%まで圧縮されていない基準に近づき、その後崩壊する。
このロバスト性は、ほとんどロスレスな再構成によるものではなく、デコードされたテンソルは、非常に離散化されており、行単位の相対的なL2誤差を持ち、ソースよりも目に見えるほど急勾配の特異値崩壊を持つ。
したがって、下流の推論は、正確な浮動小数点値よりも粗い構造と相対幾何学に依存し、AIトラフィックコーデックのレート・歪み最適化よりもレート・タスクを主張する。
関連論文リスト
- PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference [15.233755808671871]
既存の視覚トークンプルーニング法には2つの基本的な制限がある。
ほとんどのアプローチは、ビジョン後エンコーダのみを動作させ、視覚符号化フェーズのかなりの遅延は、最適化されないままである。
視覚エンコーダと大規模言語モデルの両方を高速化するフレームワークである PACE を提案する。
論文 参考訳(メタデータ) (2026-08-27T14:52:09Z) - Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding [49.540751364954666]
Visual Token Codecは、グローバルトークンとパッチトークンを専用のコーディングパスに分離する。
VTCは, 分類, セグメンテーション, 検出タスクにおいて, 代表的VT特徴量ベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-08-09T17:32:04Z) - Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment [15.70133983324942]
自己誘導は、量子化トークンと元の連続埋め込みの両方を処理する際にデコーダの内部特徴多様体を整列するために使用される。
これにより、最小限のトレーニングオーバーヘッドと推論時の変更が不要になる。
XCodec2に適用されたセルフガイダンスは、すべての再構築メトリクスを改善し、最先端の低ビットレートパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-06-11T06:06:02Z) - The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling [0.0]
ビジョンエンコーダのアップグレードによるVLAモデルのスケールアップにより,下流操作性能が向上することが期待される。
この期待は、アクションが離散トークンとして表現されるときに失敗することを示す。
任意のビジュモータパイプラインでは、スケーリングの振る舞いは、最も厳しい情報のボトルネックの位置によって管理される。
論文 参考訳(メタデータ) (2026-04-03T17:06:31Z) - Image Coding for Machines via Feature-Preserving Rate-Distortion Optimization [31.210700220124192]
本研究では,与えられたタスク損失に対する圧縮の効果を低減させる手法として,特徴量間の距離を用いてレート歪み(RDO)を行う方法を示す。
我々は、ブロックベースのエンコーダを用いて歪み項を計算可能にするために、RDOの定式化を単純化する。
複数の特徴抽出器と下流ネットワークに変換されたHEVCを用いたシミュレーションでは、同じタスクの精度で最大で17%のビットレートのセーブが可能であることを示す。
論文 参考訳(メタデータ) (2025-04-03T02:11:26Z) - Boosting Neural Representations for Videos with a Conditional Decoder [28.073607937396552]
Inlicit Neural representations (INRs) は、ビデオストレージと処理において有望なアプローチとして登場した。
本稿では,現在の暗黙的ビデオ表現手法のための普遍的なブースティングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-28T08:32:19Z) - Progressive Fourier Neural Representation for Sequential Video
Compilation [75.43041679717376]
連続学習によって動機づけられたこの研究は、シーケンシャルエンコーディングセッションを通じて、複数の複雑なビデオデータに対して、ニューラル暗黙表現を蓄積し、転送する方法を研究する。
本稿では,FFNR(Progressive Fourier Neural Representation)という,FFNR(Progressive Fourier Neural Representation)という,FFNR(Progressive Fourier Neural Representation)という手法を提案する。
我々は,UVG8/17とDAVIS50のビデオシーケンスベンチマークでPFNR法を検証し,強力な連続学習ベースラインよりも優れた性能向上を実現した。
論文 参考訳(メタデータ) (2023-06-20T06:02:19Z) - Reducing Redundancy in the Bottleneck Representation of the Autoencoders [98.78384185493624]
オートエンコーダは教師なしニューラルネットワークの一種であり、様々なタスクを解くのに使用できる。
本稿では,ボトルネック表現における特徴冗長性を明示的に罰する手法を提案する。
我々は,3つの異なるデータセットを用いた次元削減,MNISTデータセットを用いた画像圧縮,ファッションMNISTを用いた画像デノナイズという,さまざまなタスクにまたがってアプローチを検証した。
論文 参考訳(メタデータ) (2022-02-09T18:48:02Z) - A Coding Framework and Benchmark towards Low-Bitrate Video Understanding [63.05385140193666]
我々は,従来のコーデックとニューラルネットワーク(NN)の両方を活用する,従来型ニューラル混合符号化フレームワークを提案する。
このフレームワークは、動画の移動効率の良いセマンティック表現を確実に保持することで最適化される。
8つのデータセットに3つのダウンストリームタスクを備えた低ビットレートビデオ理解ベンチマークを構築し、このアプローチの顕著な優位性を実証した。
論文 参考訳(メタデータ) (2022-02-06T16:29:15Z) - Scalable Visual Transformers with Hierarchical Pooling [61.05787583247392]
本稿では,視覚的トークンを徐々にプールしてシーケンス長を縮小する階層的ビジュアルトランスフォーマ(hvt)を提案する。
計算の複雑さを増すことなく、深さ/幅/解像度/パッチサイズの寸法をスケールすることで、大きなメリットをもたらします。
当社のHVTはImageNetとCIFAR-100データセットの競合ベースラインを上回っています。
論文 参考訳(メタデータ) (2021-03-19T03:55:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。