論文の概要: LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives
- arxiv url: http://arxiv.org/abs/2607.00784v1
- Date: Wed, 01 Jul 2026 11:15:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.866736
- Title: LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives
- Title(参考訳): LeVLJEPA: 否定のないエンドツーエンドのビジョンランゲージトレーニング
- Abstract要約: LeVLJEPA(LeVLJEPA)は、世界初の非コントラストなエンドツーエンドの視覚言語事前学習法である。
LeVLJEPAは、停止段階の目標とモードごとの分布正規化によるクロスモーダル予測を通じて学習する。
結果として得られたエンコーダは、下流での使用に対して、非常に強力な密なセマンティック機能を提供します。
- 参考スコア(独自算出の注目度): 26.486296167342672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language pretraining remains dominated by contrastive objectives, whereas vision-only self-supervised learning has largely adopted non-contrastive methods. At the same time, the role of vision-language encoders has shifted: they are increasingly deployed not as zero-shot classifiers but as the frozen visual backbone of vision-language models and dense prediction systems, which consume the full grid of patch tokens rather than a single pooled embedding. We introduce LeVLJEPA, the first fully non-contrastive end-to-end vision-language pretraining method. LeVLJEPA learns through cross-modal prediction with stop-gradient targets and per-modality distributional regularization, without negatives, temperature, momentum encoder, or teacher-student schedule, and trains stably at large scale. We find that the resulting encoder provides markedly stronger dense semantic features for downstream use: as a frozen vision-language-model backbone, LeVLJEPA is the strongest of the evaluated encoders across GQA, VQAv2, and POPE under two distinct language models, and outperforms contrastive baselines on semantic segmentation, while remaining on par on global readouts such as linear probing. These results establish non-contrastive pretraining as an effective means of producing dense semantic vision features.
- Abstract(参考訳): 視覚言語による事前学習はコントラスト的な目的によって支配されているが、視覚のみによる自己教師型学習は、主に非コントラスト的な手法を採用している。
同時に、視覚言語エンコーダの役割は、ゼロショット分類器としてではなく、単一のプールド埋め込みではなくパッチトークンの完全なグリッドを消費する、視覚言語モデルと高密度予測システムの凍結した視覚バックボーンとして、ますます多く展開されている。
LeVLJEPA(LeVLJEPA)は、世界初の非コントラストなエンドツーエンドの視覚言語事前学習法である。
LeVLJEPAは、非負、温度、運動量エンコーダ、または教師-学生スケジュールなしで、停止段階の目標とモードごとの分布正規化によるクロスモーダル予測を通じて学習し、大規模に安定して訓練を行う。
凍結視覚言語モデルバックボーンとして、LVLJEPAはGQA、VQAv2、POPEの2つの異なる言語モデルで評価されたエンコーダの中では最強であり、線形探索のようなグローバルな読み出しにおいて、セマンティックセグメンテーションのコントラストベースラインを上回っている。
これらの結果は、高密度なセマンティック・ビジョン特徴を生み出す効果的な方法として、非コントラスト事前学習を確立した。
関連論文リスト
- QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation [61.18260993245354]
Chain-of-Thought(CoT)推論は、VLAベースの自律運転において、軌道予測の強力なドライバである。
本稿では,2つの補助デコーダによって制御されるコンパクトな潜在トークンを通じて推論をルーティングする,統一VLAおよびワールドモデルフレームワークであるOneVLを提案する。
OneVLは、明示的なCoTを超える最初の遅延CoTメソッドとなり、応答のみのレイテンシで最先端の精度を提供する。
論文 参考訳(メタデータ) (2026-04-20T16:37:22Z) - Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models [38.47027398567909]
Perception-Grounded Policy Optimization (PGPO)は、トークンレベルでのメリットを動的に再評価する、新しいきめ細かなクレジット割り当てフレームワークである。
PGPOは,言語的先行音からの勾配雑音を抑えつつ,視覚的に依存するトークンの学習信号を積極的に増幅することを示す。
理論的および実証的な分析は、PGPOが勾配の分散を効果的に減少させ、訓練の崩壊を防ぎ、頑健で知覚的なマルチモーダル推論のための強力な正則化剤として機能することを確認する。
論文 参考訳(メタデータ) (2026-04-02T09:53:20Z) - Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization [20.179748846776995]
本稿では、TALにおけるモダリティバイアスを軽減する視覚言語集約フレームワークであるActionVLMを提案する。
私たちの重要な洞察は、視覚を主流の信号として保存し、有利な場合にのみ適応的に言語を利用することです。
THUMOS14の実験では、我々のモデルは最先端の3.2%mAPよりも優れていた。
論文 参考訳(メタデータ) (2026-01-28T22:03:46Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - LatentVLA: Efficient Vision-Language Models for Autonomous Driving via Latent Action Prediction [19.57998167905048]
大規模データセットでトレーニングされたエンドツーエンドの自律運転モデルは、一般的なシナリオではうまく機能するが、稀で長い尾の状況では苦労する。
近年のVision-Language-Action(VLA)モデルは、事前訓練されたビジョンモデルから幅広い知識を活用して、この制限に対処している。
言語アノテーションを使わずにVLAモデルをトレーニングするために,自己教師付き潜在動作予測を用いた新しいフレームワークであるLatentVLAを提案する。
論文 参考訳(メタデータ) (2026-01-09T08:06:44Z) - Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents [39.95793203302782]
本研究では,厳密な目標ベース制約を伴わずに,順序付きかつ連続的な視覚言語表現を学習するための行動時間的コヒーレンス学習(AcTOL)を提案する。
AcTOLは動画を連続的な軌跡として扱い、(1)フレーム間の意味的差異を対比して自然な順序を反映し、(2)中間フレーム間のスムーズな遷移を保証するために局所的なブラウン橋の制約を課す。
論文 参考訳(メタデータ) (2025-02-03T10:16:49Z) - VladVA: Discriminative Fine-tuning of LVLMs [67.14293827774827]
CLIPのような対照的に訓練された視覚言語モデル(VLM)は、識別的視覚言語表現学習の事実上のアプローチとなっている。
我々は,LVLMの識別的微調整のための新たな訓練手法である「両世界のベスト」を組み合わせることを提案する。
論文 参考訳(メタデータ) (2024-12-05T17:54:27Z) - Expedited Training of Visual Conditioned Language Generation via
Redundancy Reduction [61.16125290912494]
$textEVL_textGen$は、視覚条件付き言語生成モデルの事前トレーニング用に設計されたフレームワークである。
提案手法は,視覚言語モデルの学習を5倍に加速させるが,全体的な性能に顕著な影響を与えないことを示す。
論文 参考訳(メタデータ) (2023-10-05T03:40:06Z) - Sentence Representation Learning with Generative Objective rather than
Contrastive Objective [86.01683892956144]
句再構成に基づく新たな自己教師型学習目標を提案する。
我々の生成学習は、十分な性能向上を達成し、現在の最先端のコントラスト法よりも優れています。
論文 参考訳(メタデータ) (2022-10-16T07:47:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。