論文の概要: SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference
- arxiv url: http://arxiv.org/abs/2607.00780v1
- Date: Wed, 01 Jul 2026 11:09:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.865967
- Title: SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference
- Title(参考訳): SpiralFovea: リソース適応推論の第3のレバーとしての入力適応型トークン化
- Abstract要約: パラメータフリーで入力適応型トークンサーであるSpralFoveaを提案する。
コンテンツ駆動型ホットスポットアンカーの周辺では、マルチスケールのスパイラルリングが78個のパッチを生成し、入力段階で標準の196パッチのViTグリッドを置き換える。
標準的な4つのベンチマークで、SpiralFoveaは1.7-2.1ppの精度で入力トークンの60%の削減、トランスフォーマー層毎の自己アテンションFLOPの84%の削減、マッチした静的トークン化ベースラインの18-29%のスループット向上を実現している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most adaptive-inference techniques for foundation models change what the model does - early exit, MoE routing, KV-cache compression, dynamic attention sparsity. The input that hits the backbone, however, remains a fixed-grid tokenisation indifferent to image content. We argue that this is a missed lever. We present SpiralFovea, a parameter-free, input-adaptive tokeniser in which token identity, location, scale, and count are all functions of local visual entropy and selection completes before any backbone parameter is queried. Around content-driven hotspot anchors, multi-scale spiral rings produce <= 78 patches that replace the standard 196-patch ViT grid at the input stage. Across four canonical fine-grained benchmarks, SpiralFovea yields +1.7-2.1 pp accuracy with a 60% reduction in input tokens, an 84% reduction in self-attention FLOPs at every transformer layer, and 18-29% throughput gains over the matched static tokenisation baseline. A controlled ablation on CUB-200-2011 Genus across four backbones reveals a clean diagnostic: the gain magnitude tracks inversely with the strength of the backbone's whole-image positional prior, isolating self-supervised foundation models as the regime where input-adaptive tokenisation is most valuable.
- Abstract(参考訳): ファンデーションモデルのほとんどの適応推論技術は、モデルの動作を変える – アーリーエグジット、MoEルーティング、KVキャッシュ圧縮、ダイナミックアテンション空間。
しかし、バックボーンにヒットした入力は、画像の内容に無関心な固定グリッドトークン化のままである。
これは欠落したレバーだと主張する。
パラメータフリーで入力適応型トークンサイザであるSpralFoveaは,任意のバックボーンパラメータがクエリされる前に,トークンの同一性,位置,スケール,カウントが局所的な視覚エントロピーの関数であり,選択が完了する。
コンテンツ駆動型ホットスポットアンカーの周辺では、マルチスケールのスパイラルリングが、入力段階で標準の196パッチのViTグリッドを置き換える、=78のパッチを生成する。
標準的な4つのベンチマークで、SpiralFoveaは1.7-2.1ppの精度で入力トークンの60%の削減、トランスフォーマー層毎の自己アテンションFLOPの84%の削減、マッチした静的トークン化ベースラインの18-29%のスループット向上を実現している。
4つのバックボーンにまたがるCUB-200-2011 Genusの制御的アブレーションはクリーンな診断である: ゲイングレードは、バックボーン全体の位置の強さと逆向きにトラックし、入力適応的トークン化が最も価値のあるレギュレーションとして自己監督的基礎モデルを分離する。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - PathSelect: Sequential Token Selection for Whole Slide Pathology [0.6362628914555645]
WSI(Whole-Slide Images)は、視覚言語モデル(VLM)の基本的計算ボトルネックを示す。
我々は、WSIトークンプルーニングを逐次選択プロセスとして再構成し、モデルが最適なルーティング戦略を自律的に学習できるようにする。
論文 参考訳(メタデータ) (2026-07-26T12:36:16Z) - Structural Kolmogorov-Arnold Convolutions: Learnable Function on the Values or the Filter Shape as Parameter-Efficient Alternative to Per-Edge Convolutional KANs [76.06235645266621]
Convolutional Kolmogorov--Arnold Networks (KAN) は、畳み込みカーネルの固定重みを学習可能な単変数関数に置き換える。
学習可能な関数は、各エッジよりも畳み込みのエンファン構造に置かれる方がよいと我々は主張する。
論文 参考訳(メタデータ) (2026-06-23T10:00:26Z) - HiRo: A Compact Four-Directional Hierarchical Reservoir Token-Mixer for Efficient Image Classification [0.19116784879310025]
HiRoは、シフトウインドウ分割と階層型貯水池計算を統合したパラメータ効率の高い画像分類モデルである。
画像は、重複しないパッチ(トークンとして扱われる)に分割され、線形に投影され、正規化され、2次元正弦波位置エンコーディングが強化され、その後、ローカルウィンドウ内で処理される。
1M以下のトレーニング可能なパラメータを使用するにもかかわらず、HiRoはMNIST、CIFAR-10、CIFAR-100でそれぞれ99.46%、85.57%、59.10%の精度を達成した。
論文 参考訳(メタデータ) (2026-06-13T06:44:06Z) - Point-Wise Geometry-Aware Transformer for Partial-to-Full Point Cloud Registration in Computer-Assisted Surgery [5.569433775548014]
本稿では,畳み込みと変圧器モジュールを組み合わせた粗いアーキテクチャを用いた学習ベースのポイントクラウド登録フレームワークを提案する。
ティビア、大腿骨、骨盤、胸骨軟骨を含む4つの幾何学的に異なる骨で実験が行われた。
提案手法は,部分観察による高精度な3次元点雲の登録を可能にする。
論文 参考訳(メタデータ) (2026-06-11T15:37:53Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers [5.739405014622565]
AdaMergeは2つの補完メカニズムに基づいたトークンマージフレームワークである。
ToMe、PiToMe、DSMよりずっと優れています。
論文 参考訳(メタデータ) (2026-05-26T05:35:39Z) - Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning [27.4981354426677]
ビジュアルプレース認識(VPR)は、大規模データベース内の同じ場所の参照画像とクエリイメージをマッチングすることを目的としている。
自己蒸留による特徴抽出コストを削減するVPR指向のトークンプルーニングフレームワークであるWeiToPを紹介する。
WeiToPは、推論時にプラグアンドプレイトークンのプルーニングを可能にし、追加のトレーニングなしで正確性と効率のトレードオフを柔軟かつオンデマンドに制御できる。
論文 参考訳(メタデータ) (2026-05-19T23:01:57Z) - SEER: Spectral Entropy Encoding of Roles for Context-Aware Attention-Based Design Pattern Detection [0.0]
本稿では,ソースコードからGang of Four(GoF)デザインパターンを検出するために,従来のContext Is All You Needのアップグレード版を提案する。
SEERはこれらの制限に、(i)各クラスの相互作用グラフのラプラシアンスペクトルからメンバーごとのロール埋め込みを導出するスペクトルエントロピーロールエンコーダ、(ii)メソッドカテゴリに経験的校正期間を割り当てる時間重呼出コンテキストの2つの原則で対処する。
PyDesignNet上のSEER(1,832ファイル、35,000のシーケンス、23のGoFパターン)を評価し、以前のシステムよりも一貫した利得を観察する。
論文 参考訳(メタデータ) (2026-01-19T19:13:40Z) - DoPE: Denoising Rotary Position Embedding [60.779039511252584]
トランスフォーマーモデルにおける回転位置埋め込み(RoPE)は、長さを弱める固有の限界を持つ。
ノイズのある特徴写像として位置符号化を用いたアテンションマップを再解釈し、位置補間ページ(DoPE)を提案する。
DoPEは、トランカテッド行列エントロピーに基づくトレーニング不要な手法であり、特徴写像における外乱周波数帯域を検出する。
論文 参考訳(メタデータ) (2025-11-12T09:32:35Z) - Sparse is Enough in Fine-tuning Pre-trained Large Language Models [98.46493578509039]
我々はSparse Increment Fine-Tuning (SIFT) という勾配に基づくスパース微調整アルゴリズムを提案する。
GLUE Benchmark や Instruction-tuning などのタスクで有効性を検証する。
論文 参考訳(メタデータ) (2023-12-19T06:06:30Z) - Centroid-centered Modeling for Efficient Vision Transformer Pre-training [44.24223088955106]
Masked Image Modeling (MIM)は、視覚変換器(ViT)を用いた新しい自己教師型ビジョン事前学習パラダイムである。
提案するCentroid-based approach, CCViT は k-means clustering を利用して画像モデリングのためのCentroid を得る。
提案手法は, 外部監督や蒸留訓練を伴わずに, 最近のベースラインと競合する結果が得られる。
論文 参考訳(メタデータ) (2023-03-08T15:34:57Z) - Transformers meet Stochastic Block Models: Attention with Data-Adaptive
Sparsity and Cost [53.746169882193456]
最近の研究は、自己注意の二次的コストを克服するために、様々なスパークアテンションモジュールを提案している。
本稿では,それぞれの注意を混合メンバーシップブロックモデルで表現することで,両方の問題を解決するモデルを提案する。
我々のモデルは、以前の効率的な変種とオリジナルのトランスフォーマーより優れており、十分に注目されています。
論文 参考訳(メタデータ) (2022-10-27T15:30:52Z) - Adaptive Fourier Neural Operators: Efficient Token Mixers for
Transformers [55.90468016961356]
本稿では,Fourierドメインのミキシングを学習する効率的なトークンミキサーを提案する。
AFNOは、演算子学習の原則的基礎に基づいている。
65kのシーケンスサイズを処理でき、他の効率的な自己認識機構より優れている。
論文 参考訳(メタデータ) (2021-11-24T05:44:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。