論文の概要: From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability
- arxiv url: http://arxiv.org/abs/2608.08904v2
- Date: Fri, 14 Aug 2026 00:56:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.201389
- Title: From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability
- Title(参考訳): 回復から脱落へ:アクションポストトレーニングがVLMの遅延深さ減少をいかに低減させるか
- Abstract要約: 視覚言語モデル(VLM)の理解は、視覚言語アクションモデル(VLA)を構築するための行動訓練プロセスの後に残っている。
VLMは各層において深度を低下させ,空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間的空間
モジュールレベルの分解では、次のように説明されている。 ベースVLMは、蓄積された書き込みにおいて最も深いアクセスを担います。
- 参考スコア(独自算出の注目度): 41.99844472131922
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: How much of a vision-language model's (VLM) spatial understanding remains after the action post-training process of building a vision-language-action model (VLA)? We probe depth perception, a primitive of spatiogeometric understanding, from every decoder layer of a weight-matched open-source base VLM/VLA pair: Molmo2-ER and MolmoAct2-LIBERO. First, the VLA decodes depth worse at every layer, a persistent gap we call the floor. Second, the degradation is not uniform: while the base VLM's depth decodability improves through its final layers, the VLA's collapses, an additional late-layer drop we call the cliff. We causally localize the cliff to late-layer MLP interference: ablating the late-layer MLP writes recovers the majority of the terminal decodability cliff, while matched attention ablations and the same intervention in the weight-matched base VLM produce no comparable recovery. A module-level decomposition explains this dissociation: the base VLM carries depth most accessibly in accumulated MLP writes, whereas action post-training collapses depth decodability in the late accumulated writes.
- Abstract(参考訳): 視覚言語モデル(VLM)の空間的理解は、視覚言語アクションモデル(VLA)を構築するための訓練後のプロセスの後、どの程度残っているのか?
重み付けされたオープンソースのVLM/VLAペアであるM Molmo2-ER と MolmoAct2-LIBERO のデコーダ層から,空間的理解のプリミティブである深度知覚を探索する。
まず、VLAはすべての層で深度をデコードします。
第2に、劣化は均一ではなく、ベースVLMの深さは最終層を通して改善されるが、VLAの崩壊、追加の後期層滴は崖と呼ばれる。
遅延層MLPリフレッシュは終端の耐食性崖の大多数を回復させるが、注目度は低下し、重み付けされたベースVLMへの同様の介入は、同等の回復をもたらす。
モジュールレベルの分解では、この解離が説明される: 基本のVLMは、蓄積されたMLP書き込みにおいて最もアクセシブルに深度を搬送するが、アクション後トレーニングは、遅延された書き込みにおいて深度デオーダビリティを崩壊させる。
関連論文リスト
- Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis [9.63471910507313]
事前訓練されたLLMを視覚言語モデル(VLM)に微調整することで、バックボーンのテキスト能力を損なうことができる。
我々は、VLトレーニングなしでVL後の劣化を予測する1つのGPU上で、ベースLLM上で数秒で計算された1つのスカラーであるSink Strengthを紹介した。
プレトレーニング後のQK-RMSNorm注入はネイティブQK-RMSNormの保護を再現するのに失敗するのに対し,市販の重み付け設定では失われる能力の回復に失敗する。
論文 参考訳(メタデータ) (2026-09-01T05:24:37Z) - Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding [92.1521161575198]
我々は、最も信頼性の高いニアファイナル層を動的に選択する、トレーニング不要なデコーディング戦略であるConfident Decodingを紹介する。
密集型および混合型LLMの実験は、挑戦的推論ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-06-20T07:03:26Z) - Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models [42.38903028184938]
本稿では, VLM の知識ベンチマークを VLA 評価に適用するプロトコルである Act2Answer を紹介する。
各質問は、エージェントが候補回答の中から選択するための1つのオブジェクト配置アクションを実行する短いテーブルトップエピソードとなり、制御ミスの少ないアクショングラウンドの成功率が得られる。
7つのVLAモデルと9つのVLMベースラインの大規模研究において、VLAがよりリッチなセマンティックカテゴリに対してより大きなギャップを示しながら、単純な概念に対して確固たる性能を示すことを発見した。
論文 参考訳(メタデータ) (2026-06-17T17:20:46Z) - Unlocking Dense Metric Depth Estimation in VLMs [36.431792667223796]
VLM(Vision-Language Models)は、接地やキャプションなどの2Dタスクに優れるが、3D理解には制限がある。
本稿では,単一のVLMをネイティブな密度密度幾何学予測器に変換する,シンプルで効果的なフレームワークであるDepthVLMを提案する。
LLMバックボーンに軽量な深度ヘッドをアタッチすることで、DepthVLMは1つの前方パスで言語出力と並行してフル解像度の深度マップを生成する。
論文 参考訳(メタデータ) (2026-05-15T11:54:17Z) - Layer Collapse in Diffusion Language Models [54.880703002010144]
拡散言語モデル (DLM) は自己回帰言語モデル (AR) の代替として登場した。
DLMの層崩壊は, 過度なトレーニングによるものではなく, 過度なトレーニングによるものであることを示す。
私たちの発見は、非常に実践的な意味を持っている。
論文 参考訳(メタデータ) (2026-05-07T14:39:40Z) - From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning [95.44766931218896]
MLLM(Multi-modal large language model)は、テキストベースの推論に遅れを取っている。
本稿では,MLLMの推論コンポーネントをモジュール化し,容易に置き換え可能なパーセプション推論デカップリングを提案する。
本稿では,視覚知覚最適化(VPO)と呼ばれる新しい強化学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-05T02:28:07Z) - Training-Free Reasoning and Reflection in MLLMs [45.134271969594614]
本稿では,FRANKモデルについて紹介する。FRANKモデルとは,既製のMLLMに推論とリフレクションを付与したトレーニングフレームANd r1-liKe MLLMである。
私たちの重要な洞察は、MLLMデコーダ層間の認識と推論を分離することです。
そこで本研究では, 深いデコーダ層に推論能力を統合する, テイラー型閉形式融合機構を提案する。
論文 参考訳(メタデータ) (2025-05-22T02:51:12Z) - Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models [24.669936197548427]
一定の層をスキップして早期に退避することで,VLMが有害な応答を発生させる可能性が高まることを示す。
層ワイドマルチモーダルRLHFを実現するために,Clipped-Proximal Policy Optimization (Clip-PPO) アルゴリズムの簡易かつ効果的な修正を提案する。
我々は3つのマルチモーダルデータセットにまたがるL-PPOアルゴリズムを評価し,早期出口による有害性を連続的に低減することを示した。
論文 参考訳(メタデータ) (2024-11-06T22:19:32Z) - DoLa: Decoding by Contrasting Layers Improves Factuality in Large
Language Models [79.01926242857613]
大型言語モデル(LLM)は幻覚を起こす傾向があり、事前訓練中に見られる事実から逸脱した内容を生成する。
事前学習したLLMによる幻覚を低減するための簡単な復号法を提案する。
コントラスティング・レイヤ(DoLa)アプローチによるこのデコーディングは,事実知識をよりよく提示し,誤った事実の生成を減らすことができる。
論文 参考訳(メタデータ) (2023-09-07T17:45:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。