Fugu-MT 論文翻訳(概要): Compositional Semantics for Open Vocabulary Spatio-semantic Representations

論文の概要: Compositional Semantics for Open Vocabulary Spatio-semantic Representations

arxiv url: http://arxiv.org/abs/2310.04981v1
Date: Sun, 8 Oct 2023 03:07:14 GMT
ステータス: 翻訳完了
システム内更新日: 2023-10-12 13:56:09.922316
Title: Compositional Semantics for Open Vocabulary Spatio-semantic Representations
Title（参考訳）: 開語彙空間空間表現のための構成意味論
Authors: Robin Karlsson, Francisco Lepe-Salazar, Kazuya Takeda
Abstract要約: 汎用移動ロボットは、人間の指示なしにタスクを完了する必要がある。本稿では,クエリー・セマンティック記憶のための学習に基づく知識表現として,潜時意味埋め込み z* を提案する。我々は、COCO-Stuffデータセットで訓練された単純な高密度VLMが、42.23 mIoUで181の重なり合うセマンティクスについてz*を学習できることを実証した。
参考スコア（独自算出の注目度）: 4.045603788443984
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: General-purpose mobile robots need to complete tasks without exact human instructions. Large language models (LLMs) is a promising direction for realizing commonsense world knowledge and reasoning-based planning. Vision-language models (VLMs) transform environment percepts into vision-language semantics interpretable by LLMs. However, completing complex tasks often requires reasoning about information beyond what is currently perceived. We propose latent compositional semantic embeddings z* as a principled learning-based knowledge representation for queryable spatio-semantic memories. We mathematically prove that z* can always be found, and the optimal z* is the centroid for any set Z. We derive a probabilistic bound for estimating separability of related and unrelated semantics. We prove that z* is discoverable by iterative optimization by gradient descent from visual appearance and singular descriptions. We experimentally verify our findings on four embedding spaces incl. CLIP and SBERT. Our results show that z* can represent up to 10 semantics encoded by SBERT, and up to 100 semantics for ideal uniformly distributed high-dimensional embeddings. We demonstrate that a simple dense VLM trained on the COCO-Stuff dataset can learn z* for 181 overlapping semantics by 42.23 mIoU, while improving conventional non-overlapping open-vocabulary segmentation performance by +3.48 mIoU compared with a popular SOTA model.
Abstract（参考訳）: 汎用移動ロボットは、人間の指示なしにタスクを完了する必要がある。大言語モデル(LLM)は、常識の世界知識と推論に基づく計画を実現するための有望な方向である。視覚言語モデル(VLM)は環境をLLMで解釈可能な視覚言語意味論に変換する。しかし、複雑なタスクの完了には、現在認識されていること以上の情報に関する推論が必要となることが多い。本稿では,質問可能な時空間記憶のための学習に基づく知識表現として,潜在合成意味埋め込み z* を提案する。数学的には、常に z* が見つかることを証明し、最適な z* は任意の集合 Z に対する中心関数である。視覚的外観や特異な記述からの勾配降下による反復最適化により、z*が発見可能であることを示す。 4つの埋め込み空間inclについて実験的に検証した。 CLIPとSBERT。以上の結果から,z*はSBERTで符号化された最大10のセマンティクスを表現でき,100のセマンティクスを理想的な一様分布高次元埋め込みに適用できることがわかった。我々は、COCO-Stuffデータセットで訓練された単純な高密度VLMは、一般的なSOTAモデルと比較して、従来の非重複な開語彙セグメンテーション性能を+3.48 mIoUで改善しながら、42.23 mIoUで181の重なり合う意味を学習できることを示した。

関連論文リスト

OTFusion: Bridging Vision-only and Vision-Language Models via Optimal Transport for Transductive Zero-Shot Learning [5.818420448447699]
OTFusionは、視覚情報と意味情報を整合した共有確率表現を学ぶことを目的としている。 OTFusionはオリジナルのCLIPモデルよりも一貫して優れており、平均精度は10%近く向上している。
論文参考訳（メタデータ） (2025-06-16T17:27:47Z)
Latent BKI: Open-Dictionary Continuous Mapping in Visual-Language Latent Spaces with Quantifiable Uncertainty [6.986230616834552]
本稿では,新しい確率的マッピングアルゴリズムであるLatent BKIを導入し,不確かさを定量化するオープン語彙マッピングを実現する。ラテントBKIは、人気のMatterPort-3DとSemantic KITTIデータセット上で、同様の明示的なセマンティックマッピングとVLマッピングフレームワークに対して評価される。実世界の実験は、挑戦的な屋内環境に適用可能であることを示す。
論文参考訳（メタデータ） (2024-10-15T17:02:32Z)
Epsilon: Exploring Comprehensive Visual-Semantic Projection for Multi-Label Zero-Shot Learning [23.96220607033524]
マルチラベルシナリオ(MLZSL)におけるゼロショット学習の課題について検討する。観察されたクラスと補助的な知識に基づいて、サンプル内の複数の見えないクラスを認識するように訓練されている。本稿では,エプシロンと呼ばれるMLZSLのための新しいビジュアル・セマンティック・フレームワークを提案する。
論文参考訳（メタデータ） (2024-08-22T09:45:24Z)
Disentangling Dense Embeddings with Sparse Autoencoders [0.0]
スパースオートエンコーダ(SAE)は、複雑なニューラルネットワークから解釈可能な特徴を抽出する可能性を示している。大規模言語モデルからの高密度テキスト埋め込みに対するSAEの最初の応用の1つを提示する。その結果,解釈可能性を提供しながら意味的忠実さを保っていることが明らかとなった。
論文参考訳（メタデータ） (2024-08-01T15:46:22Z)
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations [13.608653575298183]
SuGARCREPE++データセットを導入し、視覚・言語モデルのセマンティックな変化に対する感度を解析する。 SuGARCREPE++では,構成性データセットの性能向上に寄与するすべてのモデルが同等に動作しないことを示す。
論文参考訳（メタデータ） (2024-06-17T03:22:20Z)
Quantifying Semantic Emergence in Language Models [31.608080868988825]
大規模言語モデル (LLM) は意味論的意味を捉える特別な能力として広く認識されている。本研究では,入力トークンから意味を抽出するLLMの能力を測定するために,量的指標である情報創発(IE)を導入する。
論文参考訳（メタデータ） (2024-05-21T09:12:20Z)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning [56.65891462413187]
ゼロショット学習のためのプログレッシブセマンティック誘導型視覚変換器(ZSLViT)を提案する。 ZSLViTは、まずセマンティック・エンベッドド・トークン・ラーニングを導入し、セマンティック・エンハンスメントを通じて視覚・セマンティック対応を改善する。そして,視覚的強調のために,意味的無関係な視覚情報を捨てるために,低意味的・視覚的対応型視覚トークンを融合する。
論文参考訳（メタデータ） (2024-04-11T12:59:38Z)
SemGrasp: Semantic Grasp Generation via Language Aligned Discretization [53.43801984965309]
本稿では,SemGraspと呼ばれるセマンティックなグリップ生成手法を提案する。そこで本研究では,握り空間を意味空間に整合させる離散表現を導入し,握り姿勢の生成を可能にする。その後、MLLM(Multimodal Large Language Model)が微調整され、オブジェクト、把握、言語を統一意味空間内で統合する。
論文参考訳（メタデータ） (2024-04-04T16:58:26Z)
Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical Semantics [50.982315553104975]
本稿では,Llama2という人気言語モデルに対する語彙意味論のボトムアップ進化について検討する。実験の結果,下位層の表現は語彙的意味論を符号化しているが,上位層はより弱い意味帰納的帰納的帰納的帰納的帰納的帰納的帰納的帰属的帰属的帰属的帰属的存在であることがわかった。これは、高層層がより良い語彙意味論を得るマスク言語モデリングのような差別的な目的を持つモデルとは対照的である。
論文参考訳（メタデータ） (2024-03-03T13:14:47Z)
SEER-ZSL: Semantic Encoder-Enhanced Representations for Generalized Zero-Shot Learning [0.6792605600335813]
Zero-Shot Learning (ZSL)は、トレーニング中に見えないカテゴリを特定するという課題を示す。ゼロショット学習のためのセマンティック強化表現(SEER-ZSL)を提案する。まず,確率的エンコーダを用いて意味のある意味情報を抽出し,意味的一貫性とロバスト性を高めることを目的とする。第2に、学習したデータ分布を逆向きに訓練した発電機で利用することにより、視覚空間を蒸留し、第3に、未確認なカテゴリを真のデータ多様体にマッピングできるようにする。
論文参考訳（メタデータ） (2023-12-20T15:18:51Z)
Towards Realistic Zero-Shot Classification via Self Structural Semantic Alignment [53.2701026843921]
大規模事前訓練型視覚言語モデル(VLM)はゼロショット分類に有効であることが証明されている。本稿では,アノテーションではなく,より広い語彙を前提とした,より難易度の高いゼロショット分類(Realistic Zero-Shot Classification)を提案する。本稿では,ラベルのないデータから構造意味情報を抽出し,同時に自己学習を行う自己構造意味アライメント(S3A)フレームワークを提案する。
論文参考訳（メタデータ） (2023-08-24T17:56:46Z)
Semantic-aware Contrastive Learning for More Accurate Semantic Parsing [32.74456368167872]
そこで本研究では,意味表現の微粒化を学習できる意味認識型コントラスト学習アルゴリズムを提案する。 2つの標準データセットの実験により、我々の手法はMLEベースラインよりも大幅に改善されていることが示された。
論文参考訳（メタデータ） (2023-01-19T07:04:32Z)
Cross-modal Representation Learning for Zero-shot Action Recognition [67.57406812235767]
我々は、ゼロショット動作認識(ZSAR)のためのビデオデータとテキストラベルを共同で符号化するクロスモーダルトランスフォーマーベースのフレームワークを提案する。我々のモデルは概念的に新しいパイプラインを使用し、視覚的表現と視覚的意味的関連をエンドツーエンドで学習する。実験結果から,本モデルはZSARの芸術的状況に大きく改善され,UCF101,HMDB51,ActivityNetベンチマークデータセット上でトップ1の精度が向上した。
論文参考訳（メタデータ） (2022-05-03T17:39:27Z)
Integrating Language Guidance into Vision-based Deep Metric Learning [78.18860829585182]
埋め込み空間として意味的類似性を符号化した距離空間を学習することを提案する。これらの空間は、トレーニング中に見られるもの以外のクラスに転送可能であるべきである。これにより、学習された埋め込み空間は不完全な意味的コンテキストを符号化し、クラス間の意味的関係を誤って表現する。
論文参考訳（メタデータ） (2022-03-16T11:06:50Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。