論文の概要: Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding
- arxiv url: http://arxiv.org/abs/2608.03471v1
- Date: Tue, 04 Aug 2026 11:07:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.151697
- Title: Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding
- Title(参考訳): Hi-Token: 生成的視覚グラウンドのための階層的コーディネート・トークン化
- Authors: Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue,
- Abstract要約: Generative Vision-Language Models (VLM) はバウンディングボックス座標を独立出力シンボルとして扱う。
Hi-Tokenは、数百、十、一桁の軸固有のトークンを各座標にエンコードする。
Hi-GARはこの表現を、グループ相対政策最適化のための幾何学に基づく報酬で補完する。
- 参考スコア(独自算出の注目度): 22.205716720462647
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative Vision-Language Models (VLMs) commonly treat bounding-box coordinates as independent output symbols, leaving numerical order and axis semantics implicit. We identify this representation as an important source of error in visual grounding. Hi-Token encodes each coordinate with axis-specific tokens for the hundreds, tens, and ones digits, which adds coarse-to-fine structure and increases token reuse while retaining the existing VLM architecture. Hi-GAR complements this representation with a geometry-based reward for Group Relative Policy Optimization (GRPO), using box overlap and coordinate accuracy at multiple scales. Controlled comparisons under matched training conditions show that Hi-Token improves localization throughout the evaluated IoU range. Hi-GAR further reduces low-overlap predictions and is used only during training. Experiments on three VLM backbones and the RefCOCO family show consistent gains across models and benchmarks. Hi-R1 achieves higher values than strong specialist baselines on most reported metrics. Analyses of token frequency, digit boundaries, object scale, and IoU distributions explain the effects of coordinate representation and reward training. The results show that structured coordinate generation provides an effective approach to generative visual grounding.
- Abstract(参考訳): Generative Vision-Language Models (VLM) は一般に、境界ボックス座標を独立した出力シンボルとして扱い、数値的な順序と軸のセマンティクスを暗黙的に残す。
我々はこの表現を視覚的接地における重要な誤り源とみなす。
Hi-Tokenは、数百、十、一桁の軸固有のトークンを各座標にエンコードし、粗い構造を付加し、既存のVLMアーキテクチャを維持しながらトークンの再利用を増加させる。
Hi-GARはこの表現を、複数スケールでのボックスオーバーラップと座標精度を用いて、グループ相対ポリシー最適化(GRPO)のための幾何学に基づく報酬で補完する。
一致したトレーニング条件下での制御された比較結果から,Hi-Tokenは評価されたIoU範囲全体のローカライゼーションを改善することが示された。
Hi-GARはさらに低オーバーラップ予測を削減し、トレーニング時にのみ使用される。
3つのVLMバックボーンとRefCOCOファミリの実験では、モデルとベンチマーク間で一貫した利得を示している。
Hi-R1は、報告されているほとんどのメトリクスにおいて、強力なスペシャリストベースラインよりも高い値を達成する。
トークン周波数、桁境界、オブジェクトスケール、IoU分布の分析は、座標表現と報酬訓練の効果を説明する。
その結果、構造的座標生成は、生成的視覚的接地に対する効果的なアプローチを提供することが示された。
関連論文リスト
- Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning [13.385292682258147]
共同管理下で離散トークンを学習する表現誘導型および幾何学強化型トークン化器を提案する。
NAVSIMの実験では、再構成の忠実度と表現整合性、固定デコーダによる競合計画性能、一致した設定での生成品質が向上した。
論文 参考訳(メタデータ) (2026-06-01T09:02:32Z) - LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding [80.49137401046201]
並列ボックスデコーディング(PBD)に基づく統合生成基盤・検出フレームワークを提案する。
PBDはデコードスループットとローカライズ精度の両方を改善する。
さらに、スケーラブルなデータエンジンを開発し、1億1800万以上のトレーニングサンプルを持つ大規模データセットであるLocateAnything-Dataをキュレートします。
論文 参考訳(メタデータ) (2026-05-26T17:59:12Z) - What matters for Representation Alignment: Global Information or Spatial Structure? [64.67092609921816]
表現アライメント(REPA)は、強い事前訓練された視覚エンコーダから中間拡散特徴への表現を蒸留することにより、生成訓練を導く。
本稿では,対象表現のどの側面が生成に重要であるか,そのテクスト・グロバル・リビジョン・セマンティック・情報について検討する。
我々はREPAの標準射影層を単純な畳み込み層に置き換え、外部表現のための空間正規化層を導入する。
論文 参考訳(メタデータ) (2025-12-11T16:39:53Z) - Detect Anything via Next Point Prediction [51.55967987350882]
Rex-Omniは最先端の物体認識性能を実現する3BスケールのMLLMである。
COCOやLVISのようなベンチマークでは、Rex-Omniは回帰ベースのモデルに匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2025-10-14T17:59:54Z) - Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception [17.654858416126093]
協調的知覚により、エージェントは中間的特徴を交換することで知覚能力を高めることができる。
既存の手法は通常、これらの中間機能を2D Bird's-eye-view (BEV)表現として整理する。
ポイントレベル最適化トークンを利用した新しい協調認識フレームワークであるCoPLOTを提案する。
論文 参考訳(メタデータ) (2025-08-27T07:27:42Z) - Personalized Subgraph Federated Learning with Differentiable Auxiliary Projections [15.488985833084408]
補助投影を用いたフェデレーション学習(FedAux)を紹介する。
FedAuxはパーソナライズされたサブグラフFLフレームワークで、生のデータやノードの埋め込みを共有することなく、均一に分散されたローカルモデルを調整、比較、集約することを学ぶ。
多様なグラフベンチマークによる実証的な評価は、FedAuxが精度とパーソナライズ性能の両方で既存のベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2025-05-29T09:17:49Z) - Compile Scene Graphs with Reinforcement Learning [69.36723767339001]
次世代予測は大規模言語モデル(LLM)の訓練の基本原理である
本稿では,マルチモーダルLLM(M-LLM)であるR1-SGGを紹介する。
私たちは、Hard Recall、Hard Recall+Relax、Soft Recallの3つのリコールベースのバリエーションを含む、グラフ中心の報酬セットを設計します。
論文 参考訳(メタデータ) (2025-04-18T10:46:22Z) - Spatial-spectral Hyperspectral Image Classification via Multiple Random
Anchor Graphs Ensemble Learning [88.60285937702304]
本稿では,複数のランダムアンカーグラフアンサンブル学習(RAGE)を用いた空間スペクトルHSI分類手法を提案する。
まず、各選択されたバンドのより記述的な特徴を抽出し、局所的な構造と領域の微妙な変化を保存するローカルバイナリパターンを採用する。
次に,アンカーグラフの構成に適応隣接代入を導入し,計算複雑性を低減した。
論文 参考訳(メタデータ) (2021-03-25T09:31:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。