論文の概要: CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding
- arxiv url: http://arxiv.org/abs/2607.29637v1
- Date: Fri, 31 Jul 2026 17:15:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.833231
- Title: CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding
- Title(参考訳): CodeShrink: 効率的なマルチモーダルコード理解のための適応型ビジュアル圧縮
- Authors: Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu,
- Abstract要約: CodeShrinkは適応的なビジュアル圧縮フレームワークで、3つのコンポーネントがある。
Blank-Free Renderingは、ホワイトスペースに依存したレイアウトを、コンパクトなレイアウトと明示的な構造マーカーに置き換え、レイアウトによって引き起こされるトークンを削除する。
支配的トークン選択は、推論中にタスク非関連な視覚トークンをプーンするために、命令とコードイメージを共同で解析する。
- 参考スコア(独自算出の注目度): 13.113776703707634
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rendering source code as images offers a promising way to reduce the input costs of Multimodal Large Language Models (MLLMs). Adjusting image resolution can trade visual token cost against content fidelity. However, resolution scaling alone overlooks two sources of inefficiency: blank regions created by line breaks and indentation, and code regions irrelevant to the current instruction. Moreover, the best compression setting varies across inputs, tasks, and models, limiting fixed-ratio strategies. We propose CodeShrink, an adaptive visual compression framework with three components. Blank-Free Rendering replaces whitespace-dependent layouts with compact layouts and explicit structural markers, removing layout-induced tokens. Adaptive Compression Configuration uses a lightweight agent trained with reinforcement learning to predict a per-input setting that balances token efficiency and readability. Dominant Token Selection jointly analyzes the instruction and code image to prune task-irrelevant visual tokens during inference. We evaluate CodeShrink on code question answering, clone detection, and code completion. CodeShrink reduces visual token use by up to 71.2\% while matching or exceeding uncompressed text-only inputs, and consistently outperforms text-based and visual compression baselines across all three tasks. These results show that combining layout compaction, adaptive configuration, and instruction-aware pruning can make multimodal code understanding more efficient. Our code is available at https://github.com/vinsontang1/CodeShrink.
- Abstract(参考訳): ソースコードを画像としてレンダリングすることで、MLLM(Multimodal Large Language Models)の入力コストを削減できる有望な方法を提供する。
画像解像度の調整は、コンテンツの忠実さと視覚トークンコストを交換することができる。
しかし、解像度のスケーリングだけでは、ラインブレークとインデントによって生成された空白領域と、現在の命令とは無関係なコード領域という、2つの非効率な情報源を見落としている。
さらに、最高の圧縮設定は入力、タスク、モデルによって異なり、固定比率戦略が制限される。
3つのコンポーネントを持つ適応型ビジュアル圧縮フレームワークであるCodeShrinkを提案する。
Blank-Free Renderingは、ホワイトスペースに依存したレイアウトを、コンパクトなレイアウトと明示的な構造マーカーに置き換え、レイアウトによって引き起こされるトークンを削除する。
Adaptive Compression Configurationは、強化学習で訓練された軽量エージェントを使用して、トークン効率と可読性のバランスをとる入力単位の設定を予測する。
支配的トークン選択は、推論中にタスク非関連な視覚トークンをプーンするために、命令とコードイメージを共同で解析する。
コード質問応答、クローン検出、コード補完に関するCodeShrinkを評価した。
CodeShrinkは、圧縮されていないテキストのみの入力をマッチングまたは超過しながら、ビジュアルトークンの使用を最大71.2\%削減し、3つのタスクでテキストベースおよびビジュアル圧縮ベースラインを一貫して上回る。
これらの結果は、レイアウトのコンパクト化、適応構成、命令対応プルーニングを組み合わせることで、マルチモーダルコードの理解をより効率的にできることを示している。
私たちのコードはhttps://github.com/vinsontang1/CodeShrink.orgから入手可能です。
関連論文リスト
- LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR [10.208363125551555]
我々は,OCRを効率的に文書化するための軽量なプラグイン・アンド・プレイモジュールであるLayoutLiteを提案する。
視覚エンコーダから多層視覚表現を集約し、軽量スコアリングネットワークで各視覚トークンの重要スコアを予測する。
OmniDocBenchの実験では、LayoutLiteは認識品質の劣化を無視して、視覚トークンの長さと推論コストを大幅に削減できることを示した。
論文 参考訳(メタデータ) (2026-07-24T11:13:44Z) - EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling [7.872065731262025]
EvoCompは、タスクの精度を維持しながらトークン数を著しく削減するビジュアルトークン圧縮フレームワークである。
3倍のトークン圧縮で元の精度の99.3%を保持し、モバイルデバイスで最大1.6倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-04-18T17:52:02Z) - CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding [24.71096142371054]
大規模な言語モデル(LLM)は、ソースコード理解において大きな成功を収めています。
ソフトウェアシステムが大規模に成長するにつれ、計算効率は重要なボトルネックとなっている。
論文 参考訳(メタデータ) (2026-02-02T08:10:21Z) - Global Context Compression with Interleaved Vision-Text Transformation [12.971394377165767]
本稿では,前処理と推論の両方の段階でトークンを節約するグローバルコンテキスト圧縮について検討する。
入力テキストチャンクと視覚的エンコーディングとをインターリーブする新しいトランスフォーマーであるVIST2を提案する。
4$times$圧縮比で、結果として得られたモデルは長文タスクのベースラインよりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2026-01-15T13:29:16Z) - Switchable Token-Specific Codebook Quantization For Face Image Compression [72.44596412563503]
顔画像圧縮のための切り換え可能なToken-Specific Codebook Quantizationを提案する。
トークンが少量のビットを持つコードブックグループを記録することで,コードブックグループのサイズを小さくする場合に発生する損失を低減することができる。
提案手法は顔認識データに対して有効性を示し,0.05bppの再構成画像に対して平均93.51%の精度を実現した。
論文 参考訳(メタデータ) (2025-10-27T02:56:17Z) - VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs [82.72388893596555]
MLLM(Multimodal Large Language Models)は、計算とメモリのボトルネックに遭遇する。
従来のトークン圧縮技術は、重要な情報を破棄するリスクを負うルールによって制約されることが多い。
我々は,トークン圧縮をエンドツーエンドの学習可能な決定プロセスに再構成する軽量なプラグアンドプレイフレームワークとして,トークン圧縮を再構成する。
論文 参考訳(メタデータ) (2025-10-18T17:54:18Z) - CODA: Repurposing Continuous VAEs for Discrete Tokenization [31.932323809073477]
textbfCODA(textbfCOntinuous-to-textbfDiscrete textbfAdaptation)は、圧縮と離散化を分離するフレームワークである。
提案手法は,ImageNet 256$times$256ベンチマークにおいて,$mathbf0.43$と$mathbf1.34$を8倍,$16倍の圧縮で,100%のコードブック利用と注目すべき再構成FID(rFID)を実現している。
論文 参考訳(メタデータ) (2025-03-22T12:59:00Z) - Scalable Image Tokenization with Index Backpropagation Quantization [74.15447383432262]
インデックスバックプロパゲーション量子化(IBQ)は、すべてのコードブック埋め込みとビジュアルエンコーダの共同最適化のための新しいVQ手法である。
IBQは、ビジュアルトークンのスケーラブルなトレーニングを可能にし、初めて、高次元(256ドル)で高利用率の大規模コードブックを実現する。
論文 参考訳(メタデータ) (2024-12-03T18:59:10Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。