論文の概要: DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction
- arxiv url: http://arxiv.org/abs/2607.02083v1
- Date: Thu, 02 Jul 2026 12:25:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.823738
- Title: DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction
- Title(参考訳): DeepGaze3.5-VL:自己回帰トケ予測による走査パスのモデル化
- Authors: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer,
- Abstract要約: DeepGaze3.5-VLは、複数のデータセットにまたがる新たな最先端技術を確立し、MIT1003上で2.18ビットの情報ゲイン(IG)を実現し、DeepGaze IIIよりも46%改善した。
我々の生成フレームワークは、直接的行動介入のための強力な計算ツールとして機能し、生体内での動作が実験的に困難または不可能な、制御されたシリカ内シミュレーションを可能にします。
- 参考スコア(独自算出の注目度): 21.818459524136376
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding human visual attention on a scene over time has applications in domains such as interface design and inferring cognitive states. Modeling visual scanpaths has historically relied on specialized architectures with hand-crafted priors. While these architectures can model fixation sequences, their rigid structural biases restrict easy extendability and flexible conditioning. For instance, integrating task-specific instructions or adapting to distinct viewer identities requires custom, disjoint architectural additions. We frame scanpath prediction purely as a discrete sequence modeling task. By mapping coordinates into a text vocabulary, we leverage the pretrained representations of Vision-Language Models. This framing absorbs diverse factors of variation: simple prompting allows for global conditioning, such as providing viewer identities to capture personalized biases, or task-specific objectives like visual search. The framework can also integrate per-fixation attributes, such as individual fixation durations, alongside spatial locations. The autoregressive alignment enables the scalable, exact computation of per-fixation log-likelihoods, directly equivalent to the commonly used Information Gain (IG) metric. Our model, DeepGaze3.5-VL, establishes a new state-of-the-art across multiple datasets, achieving 2.18 bits of IG on MIT1003, a 46% improvement over DeepGaze III. This advantage persists even when baselines use identical high-capacity vision encoders. Beyond predictive performance, our generative framework serves as a powerful computational tool for direct behavioral interventions, allowing for controlled in-silico simulations that would be experimentally difficult or impossible to conduct in vivo. We demonstrate this ability by performing controlled interventions on the durations of pre-saccadic fixations, recovering known oculomotor phenomena purely from data.
- Abstract(参考訳): 人間の視覚的注意を時間とともに理解することは、インターフェース設計や認知状態の推測といった分野に応用できる。
ビジュアル・スキャンパスのモデリングは、歴史的に手作りの先行技術を持つ特殊なアーキテクチャに依存してきた。
これらのアーキテクチャは固定配列をモデル化できるが、その剛性構造バイアスは容易に拡張可能で柔軟な条件付けを制限する。
例えば、タスク固有の命令の統合や、異なるビューアのIDへの適応には、カスタムで相容れないアーキテクチャの追加が必要です。
我々は、離散シーケンスモデリングタスクとして、スキャンパス予測を純粋にフレーム化する。
座標をテキスト語彙にマッピングすることで、視覚言語モデルの事前学習表現を活用する。
単純なプロンプトによって、パーソナライズされたバイアスをキャプチャするためのビューアIDや、ビジュアル検索のようなタスク固有の目的など、グローバルな条件付けが可能になる。
このフレームワークは、空間的な位置とともに、個々の固定期間などの固定単位の属性を統合することもできる。
自己回帰アライメントは、一般的に使用される情報ゲイン(IG)メトリックと直接等価な、固定単位のログライクなスケーラブルで正確な計算を可能にする。
私たちのモデルであるDeepGaze3.5-VLは、複数のデータセットにまたがる新たな最先端技術を確立し、MIT1003上で2.18ビットのIGを実現し、DeepGaze IIIよりも46%改善した。
この利点は、ベースラインが同一の高容量ビジョンエンコーダを使用する場合でも持続する。
予測性能の他に、我々の生成フレームワークは、直接の行動介入のための強力な計算ツールとして機能し、試験的に難しい、あるいは生体内での実行が不可能な、シリコン内シミュレーションの制御を可能にします。
データから既知の眼球運動現象を復元し, 治療前固定期間の制御的介入を行うことにより, この能力を実証した。
関連論文リスト
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding [55.535374902204296]
AffordanceVLAは、タスク指向の中間表現として構造化された価格予測を導入する統一フレームワークである。
AffordanceVLAは様々な操作シナリオで高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-04T13:28:51Z) - From Scene to Object: Text-Guided Dual-Gaze Prediction [17.32439183328327]
解釈可能なドライバーの注意予測は、人間のような自動運転にとって不可欠である。
既存のデータセットは、微粒なオブジェクトレベルのアノテーションではなく、シーンレベルのグローバルな視線のみを提供する。
本稿では,データ構築からモデルアーキテクチャへの完全なパラダイムを確立するための,新しいデュアルブランチの視線予測フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-22T05:11:59Z) - BEVPredFormer: Spatio-temporal Attention for BEV Instance Prediction in Autonomous Driving [1.5327485092552822]
本稿では,BEV予測のためのカメラ専用アーキテクチャであるBEVPredFormerを紹介する。
注意に基づく時間的処理を使用して、シーンの時間的および空間的理解を改善する。
nuScenesデータセットで評価され、State-Of-The-Artメソッドと同程度か超えた。
論文 参考訳(メタデータ) (2026-04-03T09:58:42Z) - A Scene Graph Backed Approach to Open Set Semantic Mapping [1.8266902367595235]
オープンセットセマンティックマッピングと3次元シーングラフ(DSSG)はロボット知覚のパラダイムとして確立されている。
本稿では,3DSSGが基本的なバックエンドとして機能し,主要な知識表現として機能するマッピングアーキテクチャを提案する。
これにより、大規模な設定で拡張された操作であっても、地図が位相的に一貫性を持ち、計算的に効率的であることを保証する。
論文 参考訳(メタデータ) (2026-02-03T17:41:51Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - Conditioned Human Trajectory Prediction using Iterative Attention Blocks [70.36888514074022]
本研究では,都市環境における歩行者位置予測を目的とした,簡易かつ効果的な歩行者軌道予測モデルを提案する。
我々のモデルは、複数のアテンションブロックとトランスフォーマーを反復的に実行できるニューラルネットワークアーキテクチャである。
ソーシャルマスク, 動的モデル, ソーシャルプーリング層, 複雑なグラフのような構造を明示的に導入することなく, SoTAモデルと同等の結果が得られることを示す。
論文 参考訳(メタデータ) (2022-06-29T07:49:48Z) - Deep Neural Dynamic Bayesian Networks applied to EEG sleep spindles
modeling [0.0]
本稿では,視覚的スコアリングにおいて専門家が積極的に実施する制約を組み込んだ単一チャネル脳波生成モデルを提案する。
我々は、一般化期待最大化の特別な場合として、正確に、抽出可能な推論のためのアルゴリズムを導出する。
我々は、このモデルを3つの公開データセット上で検証し、より複雑なモデルが最先端の検出器を越えられるように支援する。
論文 参考訳(メタデータ) (2020-10-16T21:48:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。