論文の概要: Learning the RoPEs: Better 2D and 3D Position Encodings with STRING
- arxiv url: http://arxiv.org/abs/2502.02562v1
- Date: Tue, 04 Feb 2025 18:37:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-02-05 15:21:56.417167
- Title: Learning the RoPEs: Better 2D and 3D Position Encodings with STRING
- Title(参考訳): RoPEを学習する - STRINGによる2Dおよび3D位置エンコーディングの改善
- Abstract要約: STRING: 分離可能なトランスレーショナル不変位置 s。
STRING: Separable Translationally Invariant Position s。
- 参考スコア(独自算出の注目度): 34.997879460336826
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce STRING: Separable Translationally Invariant Position Encodings. STRING extends Rotary Position Encodings, a recently proposed and widely used algorithm in large language models, via a unifying theoretical framework. Importantly, STRING still provides exact translation invariance, including token coordinates of arbitrary dimensionality, whilst maintaining a low computational footprint. These properties are especially important in robotics, where efficient 3D token representation is key. We integrate STRING into Vision Transformers with RGB(-D) inputs (color plus optional depth), showing substantial gains, e.g. in open-vocabulary object detection and for robotics controllers. We complement our experiments with a rigorous mathematical analysis, proving the universality of our methods.
- Abstract(参考訳): STRING: Separable Translationally Invariant Position Encodingsを紹介する。
STRINGはロータリー位置エンコーディング(Rotary Position Encodings)を拡張している。
重要なことは、STRINGは計算フットプリントを低く保ちながら、任意の次元のトークン座標を含む正確な変換不変性を提供する。
これらの特性は、効率的な3Dトークン表現が鍵となるロボット工学において特に重要である。
STRINGを視覚変換器にRGB(-D)入力(色+オプション深度)と統合し、オープン語彙オブジェクト検出やロボットコントローラなど、かなりの利得を示す。
我々は厳密な数学的解析で実験を補完し、手法の普遍性を証明した。
関連論文リスト
- Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening [46.94213480279033]
パンシャーピングのための多言語対応セマンティックプロトタイプスキャンパラダイムを提案する。
我々は、高階RWKVアーキテクチャとセマンティッククラスタリングから派生したトリトケンプロンプト機構を用いる。
実験により,本手法の優位性を実証した。
論文 参考訳(メタデータ) (2026-04-16T05:10:03Z) - Point Cloud as a Foreign Language for Multi-modal Large Language Model [22.63554774942836]
SAGEは、トレーニング済みの3Dエンコーダに頼ることなく、生の点雲を直接処理する最初のエンドツーエンドの3D MLLMである。
提案手法では, 幾何サンプリングと近傍凝集とベクトル量子化を組み合わせた軽量な3次元トークン化器を導入し, 点雲を離散トークンに変換する。
論文 参考訳(メタデータ) (2026-03-10T04:22:40Z) - PaTH Attention: Position Encoding via Accumulating Householder Transformations [56.32365080761523]
PaTHは、ハウステリア変換の累積積に基づいて、フレキシブルなデータ依存位置符号化方式である。
家庭用行列の積をコンパクトに表現することで,効率的な並列学習アルゴリズムを導出する。
論文 参考訳(メタデータ) (2025-05-22T08:36:09Z) - Modality and Task Adaptation for Enhanced Zero-shot Composed Image Retrieval [20.612534837883892]
Zero-Shot Composed Image Retrieval (ZS-CIR) はバイモーダル (image+text) クエリを用いてターゲット画像を取得するように設計されている。
本稿では,2つのコンポーネントからなる軽量なポストホックフレームワークを提案する。
実験により,提案するコンポーネントを組み込むことで,インバージョンに基づく手法が大幅な改善を実現することが示された。
論文 参考訳(メタデータ) (2024-10-31T08:49:05Z) - LieRE: Generalizing Rotary Position Encodings [4.07373334379699]
Rotary Position (RoPE) は言語モデルにおいて一般的な選択肢となっている。
RoPEは1次元のシーケンスデータに制約される。
LieREは、RoPEのブロック2D回転行列を、可変空間の学習された高次元回転行列に置き換える。
論文 参考訳(メタデータ) (2024-06-14T17:41:55Z) - Sparse Autoencoders Enable Scalable and Reliable Circuit Identification in Language Models [0.0]
本稿では,大規模言語モデルにおける解釈可能な回路を発見するための,効率的かつ堅牢な手法を提案する。
本稿では, 慎重に設計した正負の例に対して, スパースオートエンコーダを訓練する。
本研究は,スケーラブルかつ効率的な機械的解釈性を実現するための離散スパースオートエンコーダの実現を示唆するものである。
論文 参考訳(メタデータ) (2024-05-21T06:26:10Z) - GTA: A Geometry-Aware Attention Mechanism for Multi-View Transformers [63.41460219156508]
既存の位置符号化方式は3次元視覚タスクに最適であると主張する。
トークンの幾何学的構造を相対変換として符号化する幾何学的注意機構を提案する。
我々は、Geometric Transform Attention (GTA) と呼ばれる、最先端のトランスフォーマーベースNVSモデルの学習効率と性能を向上させることに留意している。
論文 参考訳(メタデータ) (2023-10-16T13:16:09Z) - Spatial-information Guided Adaptive Context-aware Network for Efficient
RGB-D Semantic Segmentation [9.198120596225968]
計算パラメータを削減し,アルゴリズムの堅牢性を保証する,効率的な軽量エンコーダデコーダネットワークを提案する。
また,NYUv2,SUN RGB-D,Cityscapesのデータセットを用いた実験結果から,本手法は最先端手法よりもセグメンテーション精度,推定時間,パラメータのトレードオフが良好であることが示された。
論文 参考訳(メタデータ) (2023-08-11T09:02:03Z) - SPE-Net: Boosting Point Cloud Analysis via Rotation Robustness
Enhancement [118.20816888815658]
SPE-Netという名前の3Dポイントクラウドアプリケーションに適した新しいディープアーキテクチャを提案する。
埋め込みSelective Position variant' の手順は、入力の根底にある回転条件に効果的に対応できる注意機構に依存している。
SPE-Netと関連する仮説の利点を4つのベンチマークで示し、SOTA法よりも回転試験データと回転試験データの両方に明らかな改善点を示した。
論文 参考訳(メタデータ) (2022-11-15T15:59:09Z) - Object Scene Representation Transformer [56.40544849442227]
オブジェクトシーン表現変換(OSRT: Object Scene Representation Transformer)は、新しいビュー合成を通じて、個々のオブジェクト表現が自然に現れる3D中心のモデルである。
OSRTは、既存のメソッドよりもオブジェクトとバックグラウンドの多様性が大きい、はるかに複雑なシーンにスケールする。
光電場パラメトリゼーションと新しいSlot Mixerデコーダのおかげで、合成レンダリングでは桁違いに高速である。
論文 参考訳(メタデータ) (2022-06-14T15:40:47Z) - CodedVTR: Codebook-based Sparse Voxel Transformer with Geometric
Guidance [22.39628991021092]
本稿では,3次元スパースボクセルトランスのためのCodedVTR(Codebook-based Voxel TRansformer)を提案する。
一方、学習可能なコードブックにおける「プロトタイプ」の組み合わせで表されるサブ空間に注意空間を投影するコードブックベースの注意を提案する。
一方,幾何学的情報(幾何学的パターン,密度)を用いて注意学習を誘導する幾何学的自己注意を提案する。
論文 参考訳(メタデータ) (2022-03-18T11:50:25Z) - Progressive Coordinate Transforms for Monocular 3D Object Detection [52.00071336733109]
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
論文 参考訳(メタデータ) (2021-08-12T15:22:33Z) - Contextual Transformer Networks for Visual Recognition [103.79062359677452]
視覚認識のための新しいTransformerスタイルのモジュールであるContextual Transformer(CoT)ブロックを設計する。
このような設計は、動的注意行列の学習を導くために入力キー間のコンテキスト情報を完全に活用する。
私たちのCoTブロックは、ResNetアーキテクチャにおける3ドル3ドルの畳み込みを簡単に置き換えられるという視点で魅力的です。
論文 参考訳(メタデータ) (2021-07-26T16:00:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。