論文の概要: Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention
- arxiv url: http://arxiv.org/abs/2607.23917v1
- Date: Mon, 27 Jul 2026 01:13:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.267774
- Title: Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention
- Title(参考訳): Gaze-to-text 生成:人間の注意のカテゴリー的デコードを超えて
- Abstract要約: Gazetteは最初のGear-to-textデコーディングフレームワークである。
大きな言語モデル(MLLM)に基づいて、Gazette氏は、視線スキャンパスを分類ラベルを超えて拡張可能な目標のために自然言語にデコードすることを学ぶ。
本研究では,大規模言語モデルの百科事典的知識と推論能力を活用して,目標指向の注意行動の自然言語説明を合成する手法を提案する。
- 参考スコア(独自算出の注目度): 49.004784590429075
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce a novel learning problem: decoding gaze into natural language descriptions of human goals across diverse visual tasks. Unlike prior work, which frames gaze decoding as a discriminative task over predefined categories, we formulate it as a generative learning problem: training a model to produce free-form descriptions that capture the rich nuances and open-ended nature of human intentions beyond fixed labels. To this end, we introduce Gazette, the first gaze-to-text decoding framework. Based on multimodal large language models (MLLMs), Gazette learns to decode gaze scanpaths into natural language for goals that may extend beyond categorical labels and require articulation in natural language. To help Gazette filter out individual differences in gaze behavior and learn the goal-specific spatiotemporal dynamics crucial for generating accurate natural language goal descriptions, we propose a novel strategy that leverages the encyclopedic knowledge and reasoning abilities of a large language model to synthesize natural language explanations of goal-directed attentional behavior called think-aloud transcripts. Instruction tuning on these synthetic narratives allows Gazette to achieve state-of-the-art performance in gaze decoding across multiple tasks, demonstrating its generalizability and versatility, thereby enabling gaze to serve as a powerful, non-intrusive cue for inferring human goals and intentions in diverse scenarios.
- Abstract(参考訳): 視覚的タスクの多様さにまたがって、人間の目標の自然言語記述に視線をデコードする、新しい学習問題を導入する。
事前定義されたカテゴリに対する差別的なタスクとしてデコードを見つめる以前の作業とは異なり、私たちはこれを生成学習問題として定式化し、モデルに、固定ラベルを超えた人間の意図の豊かなニュアンスとオープンな性質を捉えた自由形式の記述を生成するように訓練する。
この目的のために,ガゼット (Gazette) は最初のGear-to-textデコーディングフレームワークである。
マルチモーダルな大言語モデル(MLLM)に基づいて、ガゼットは視線スキャンパスを自然言語にデコードすることを学び、それは分類ラベルを超えて、自然言語で調音を必要とする可能性がある。
ガゼットは、視線行動の個人差を抽出し、正確な自然言語の目標記述を生成するのに不可欠な目標固有時空間力学を学習するために、大言語モデルの百科事典知識と推論能力を活用して、シンク・アラウド・トランスクリプトと呼ばれる目標指向の注意行動の自然言語説明を合成する新しい戦略を提案する。
これらの合成物語の指導的チューニングにより、ガゼットは複数のタスクをまたいだ視線復号における最先端のパフォーマンスを達成し、その一般化性と汎用性を実証し、様々なシナリオにおいて人間の目標や意図を推測するための強力な非侵襲的なキューとして機能することを可能にした。
関連論文リスト
- OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following [59.53720386342017]
拡張性のある多対人視線推論に基礎的な視覚言語モデルを適用する統合視覚言語フレームワークを提案する。
すべての個人をモデル化することにより、OmniGFは正確な空間的視線目標推定、意味的視線予測、複雑な社会的視線推定をシームレスに統合する。
論文 参考訳(メタデータ) (2026-05-26T00:08:06Z) - Vega: Learning to Drive with Natural Language Instructions [93.49357278917223]
本稿では,命令ベースの生成と計画のための統合型ビジョン・ランゲージ・ワールド・アクションモデルであるVegaを提案する。
視覚入力(ビジョン)と言語指示(言語)の処理には自己回帰パラダイムを使用し、将来の予測を生成するには拡散パラダイムを用いる。
提案手法は優れた計画性能を達成し,強い指示追従能力を示す。
論文 参考訳(メタデータ) (2026-03-26T17:59:56Z) - Language-Guided Grasp Detection with Coarse-to-Fine Learning for Robotic Manipulation [31.386822229629455]
本稿では,ロボット操作のための粗粒度学習パラダイムを用いた言語誘導グラフ検出(LGGD)を提案する。
この設計により、きめ細かいビジュアル・セマンティックなアライメントが可能となり、タスク命令に対する予測された把握の実現性が改善される。
OCID-VLGとGrasp-Anything++データセットの実験は、LGGDが既存の言語誘導の把握方法を上回ることを示している。
論文 参考訳(メタデータ) (2025-12-24T09:16:42Z) - See the Text: From Tokenization to Visual Reading [63.10220471118435]
SeeTokはテキストを画像(ビジュアルテキスト)としてレンダリングし、事前訓練されたマルチモーダル計算を利用して解釈する。
3つの異なる言語タスクの中で、SeeeTokはサブワードトークンをマッチまたはオーバーし、トークンを4.43倍少なくし、FLOPを70.5%削減する。
SeeTokは、象徴的なトークン化から人間のような視覚的な読み方へとシフトし、より自然で認知的にインスパイアされた言語モデルへと一歩前進する。
論文 参考訳(メタデータ) (2025-10-21T17:34:48Z) - CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity [23.77040677368575]
我々は,潜在的にあいまいな自然言語によって指定されたタスクを達成できる,新しいロボット操作フレームワークを導入する。
このフレームワークはVLM(Vision-Language Model)を使用して、自然言語命令の抽象概念を解釈する。
本稿では,言語あいまいさ,コンタクトリッチな操作,多目的インタラクションといった課題に対して,アプローチが優れていることを示す。
論文 参考訳(メタデータ) (2025-06-19T23:42:03Z) - CodeGRAG: Bridging the Gap between Natural Language and Programming Language via Graphical Retrieval Augmented Generation [58.84212778960507]
CodeGRAGは、制御フローとそれらのデータフローに基づいて、コードブロックのグラフィカルなビューを構築し、プログラミングドメインの知識をよりよく解釈する。
CodeGRAGはLLMのコード生成能力を大幅に改善し、言語間コード生成のパフォーマンス向上も実現している。
論文 参考訳(メタデータ) (2024-05-03T02:48:55Z) - Analyzing the Limits of Self-Supervision in Handling Bias in Language [52.26068057260399]
我々は、言語モデルが、認識、識別、抽出、言い換えの4つのタスクのセマンティクスをいかにうまく捉えているかを評価する。
分析の結果,言語モデルでは,ジェンダーや政治的アフィリエイトなど,様々なバイアス次元にまたがって,これらのタスクを広範囲にわたって実行することが可能であることが示唆された。
論文 参考訳(メタデータ) (2021-12-16T05:36:08Z) - Towards Zero-shot Language Modeling [90.80124496312274]
人間の言語学習に誘導的に偏りを持つニューラルモデルを構築した。
類型的に多様な訓練言語のサンプルからこの分布を推測する。
我々は、保留言語に対する遠隔監視として、追加の言語固有の側情報を利用する。
論文 参考訳(メタデータ) (2021-08-06T23:49:18Z) - Inverse Reinforcement Learning with Natural Language Goals [8.972202854038382]
言語条件付きポリシーと報酬関数を学習するための新しい逆強化学習アルゴリズムを提案する。
提案アルゴリズムは,視覚に基づく自然言語によるデータセットの学習において,複数のベースラインをはるかに上回る性能を示した。
論文 参考訳(メタデータ) (2020-08-16T14:43:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。