論文の概要: Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs
- arxiv url: http://arxiv.org/abs/2608.01473v1
- Date: Sun, 02 Aug 2026 20:09:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.252234
- Title: Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs
- Title(参考訳): Slot2Text:高能率かつ空間的追跡可能な手術MLLMのためのオブジェクト中心視覚トークン化
- Authors: Guiqiu Liao, Matjaz Jogan, Daniel A. Hashimoto,
- Abstract要約: 手術シーン理解のための多モード大言語モデル(MLLM)は、典型的には数百の密集した視覚トークンを言語モデルに注入する。
視覚入力の高密度表現をスロットラテントとして符号化したコンパクトな領域に置き換える2モード手術MLLMであるSlot2Textを提案する。
- 参考スコア(独自算出の注目度): 0.609006146869448
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal large language models (MLLM) for surgical scene understanding typically inject hundreds of dense visual tokens into a language model, leading to costly inference and limited spatial traceability for generated answers. We present Slot2Text, a dual-mode surgical MLLM that replaces dense representations of visual input with a compact set of regions encoded as slot latents. Instead of relying on contrastive alignment of the visual encoder with language, Slot2Text groups self-supervised vision features into a few regions--slots that are consumed by the language model as area-labeled visual tokens. Slot2Text-Fast uses the slot prefix to answer surgical questions. Slot2Text-Reason also identifies and locates areas relevant for reasoning, linking language outputs to corresponding slot tokens, masks or regions. Experiments on multiple visual question answering and visual grounding benchmarks show that Slot2Text-Fast is competitive with state-of-the-art baseline at a much lower cost, reducing the average total token consumption by a 91.8\% and the visual prefix from 1,295 to 47 tokens (a 96.4\% reduction). Slot2Text-Reason trades additional tokens and latency for explicit area identities, locations, and traceable spatial evidence. These results establish compact slot latents as an efficient default visual interface for surgical MLLMs, with grounded reasoning invoked when greater spatial traceability is required.
- Abstract(参考訳): 手術シーン理解のための多モード大言語モデル(MLLM)は、通常、数百の密集した視覚トークンを言語モデルに注入する。
視覚入力の高密度表現をスロットラテントとして符号化したコンパクトな領域に置き換える2モード手術MLLMであるSlot2Textを提案する。
Slot2Textは、ビジュアルエンコーダと言語との対比的なアライメントに頼る代わりに、自己教師型視覚機能をいくつかのリージョンにグループ化する。
Slot2Text-Fastはスロットプレフィックスを使用して外科的質問に答える。
Slot2Text-Reasonはまた、推論、言語出力と対応するスロットトークン、マスク、リージョンをリンクする領域を特定し、特定する。
複数の視覚的質問応答と視覚的接地ベンチマークの実験により、Slot2Text-Fastは最先端のベースラインと競争し、平均的なトークン消費を91.8\%削減し、視覚的接頭辞を1,295から47トークン(96.4\%削減)とした。
Slot2Text-Reasonは、明示的な領域のアイデンティティ、場所、トレース可能な空間的エビデンスに対して、追加のトークンとレイテンシを交換する。
これらの結果は,より空間的トレーサビリティが要求される場合に,接地的推論を伴って,手術用MLLMの効率的なデフォルト視覚インタフェースとしてコンパクトスロット潜伏剤が確立される。
関連論文リスト
- Learning to See What You Need: Gaze Attention for Multimodal Large Language Models [96.20985292033465]
本稿では,世代別タスク関連視覚領域へのMLLMの選択的参加を可能にする新しいメカニズムであるGaze Attentionを紹介する。
注意計算では、視線KVエントリが最大90%少ないのに対して、視線アテンションは高密度アテンションベースラインと一致または超過していることが示される。
論文 参考訳(メタデータ) (2026-05-13T06:54:09Z) - What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models [9.530137749236617]
マルチモーダル大言語モデル(MLLM)は、言語モデルの埋め込み空間に視覚トークンを投影する。
本稿では,新しい探索ツールである $textLenEmbeds$ を特徴とする2次元解析フレームワークについて紹介する。
視覚トークンは一貫してシンク、デッド、生きたカテゴリに分けられる。
論文 参考訳(メタデータ) (2026-02-28T07:13:36Z) - Rethinking Visual Token Reduction in LVLMs under Cross-modal Misalignment [38.04426918886084]
視覚言語モデル(LVLM)は、視覚入力をパッチレベルのトークンの密度の高いシーケンスとしてエンコードし、微細なセマンティクスをキャプチャする。
これまでは、大型言語モデル(LLM)の前か中のいずれかで、視覚トークンの削減を検討してきた。
トレーニングフリーで視覚のみのプルーニングフレームワークであるVisionDropを導入し、モーダル内(視覚から視覚への)注目に基づいて情報的視覚トークンを選択する。
論文 参考訳(メタデータ) (2025-06-27T14:55:40Z) - VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models [57.2662376527586]
VScanは2段階のビジュアルトークン削減フレームワークである。
1)グローバルスキャンとローカルスキャンを視覚的エンコーディング中にマージすることで,(2)言語モデルの中間層にプルーニングを導入する。
VScanはプリフィルの2.91$times$スピードアップとFLOPの10$times$ダウンを実現し、オリジナルのパフォーマンスの95.4%を維持した。
論文 参考訳(メタデータ) (2025-05-28T17:59:08Z) - D-Attn: Decomposed Attention for Large Vision-and-Language Models [29.611769371733672]
大規模視覚・言語モデル(LVLM)のためのより柔軟な注意アーキテクチャである分解注意アーキテクチャ(D-Attn)を提案する。
D-AttnはLVLMの1次元因果自認を視覚的・視覚的・視覚的・テキスト的・テキスト的に分解する。
実験と解析によりD-Attnの有効性が検証され、複数の画像ベンチマークで大幅な改善が示された。
論文 参考訳(メタデータ) (2025-02-04T00:46:11Z) - Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference [59.91176945361035]
高速推論のためにMLLMを高速化するプラグイン・アンド・プレイモジュールであるVisual Tokens Withdrawal (VTW)を紹介した。
VTWは、あるレイヤで視覚トークンを戦略的に取り除き、テキストトークンだけがその後のレイヤに関与できるようにする。
提案手法は,マルチモーダルタスクにおいて,性能を維持しながら計算オーバーヘッドを40%以上削減できる。
論文 参考訳(メタデータ) (2024-05-09T14:38:53Z) - LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models [35.88374542519597]
大規模マルチモーダルモデル(LMM)は、視覚エンコーダと大きな言語モデルとを接続することで、視覚的推論能力を示す。
近年のLMMには、高解像度の画像やビデオなど、より複雑な視覚入力が組み込まれており、視覚トークンの数が大幅に増加する。
我々は,LMMの性能を損なうことなく,視覚トークンの数を著しく削減する適応型視覚トークン削減戦略であるPruMergeを提案する。
論文 参考訳(メタデータ) (2024-03-22T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。