論文の概要: When Do Frozen VLMs Respond to Image-Free Object-Token Edits? An Answer-Key-Free Protocol and What It Reveals
- arxiv url: http://arxiv.org/abs/2609.03429v1
- Date: Thu, 03 Sep 2026 06:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.948021
- Title: When Do Frozen VLMs Respond to Image-Free Object-Token Edits? An Answer-Key-Free Protocol and What It Reveals
- Title(参考訳): イメージフリーなオブジェクトトークン編集に応答するフリーズVLM : Answer-Key-Free Protocolとそれでわかること
- Authors: Wonbin Son, Gyumun Choi, Junil Seo, Seungmin Rho, Mi Young Lee, Hyungjoon Kim,
- Abstract要約: 編集後VLM応答に対する応答キーフリープロトコルを提案する。
論理的に答えが決定される編集をスコアし、各スコア可能な選択を逆転して監査する。
トークンの清潔さと密度によって制御され、デプロイ可能な検出器+セグメンタトークンはオラクルと競合する。
イメージフリートークン経路は、マッチしたパッチトークンベースラインのフリーテキストVQAの92-96%を保存している。
- 参考スコア(独自算出の注目度): 0.5562169147885739
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Answering what-if queries about a scene with a VLM usually means injecting the assumption as text or repainting the scene with a generative model. We instead move the edit to the representation level, before the model input. The image is abstracted into a set of object-level tokens, and the original image never enters the VLM. This design rests on an open question: when do frozen VLMs actually respond to such token edits? We introduce an answer-key-free protocol: no post-edit answer is annotated. It scores edits whose answers are logically determined, and audits itself by reversing each scoreable choice. The protocol reveals three structures. The response is not free: explicit edit teaching, not ordinary VQA training, produces it in dense scenes and multiplies it in sparse ones, on all three operations. Once on, it is governed by token cleanliness and density, with deployable detector+segmenter tokens competitive with the oracle and outperforming it on VRSBench. And reading is a separable axis: the image-free token route preserves 92-96% of a matched patch-token baseline's free-text VQA, and the answers measurably depend on the tokens. The response, cleanliness, and reading structures are sign-preserved across two remote-sensing datasets (iSAID, VRSBench) and three frozen LM backbones. We release the probe generator, records, judge logs, and code.
- Abstract(参考訳): VLMでシーンに関するe-ifクエリを答えることは通常、仮定をテキストとして注入するか、生成モデルでシーンを再描画することを意味する。
代わりに、モデル入力の前に、編集を表現レベルに移動します。
イメージはオブジェクトレベルのトークンセットに抽象化され、元のイメージはVLMに入らない。
フリーズされたVLMは実際にこのようなトークン編集に応答するのでしょうか?
応答キーのないプロトコルを導入します。
論理的に答えが決定される編集をスコアし、各スコア可能な選択を逆転して監査する。
プロトコルには3つの構造がある。
通常のVQAトレーニングではなく、明示的な編集教育は、密集したシーンでそれを生成し、3つの操作すべてで、まばらなシーンでそれを掛け合わせる。
一度、トークンの清潔さと密度によって管理され、デプロイ可能な検出器+セグメンタトークンが託宣と競合し、VRSBenchでそれを上回る性能を発揮する。
イメージフリートークン経路は、マッチしたパッチトークンベースラインのフリーテキストVQAの92-96%を保存し、回答はトークンに依存する。
応答、クリーンライン、読み出し構造は、2つのリモートセンシングデータセット(iSAID、VRSBench)と3つの凍結LMバックボーンに署名保存される。
プローブジェネレータ、レコード、判定ログ、コードをリリースします。
関連論文リスト
- EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment [16.296464057419517]
軽量のアダプタは、視覚言語モデル(VLM)イメージエンコーダと凍ったFR空間をアライメントし、顔画像だけで訓練され、テキスト上は決して訓練されない。
ラベルなし検出可能性尺度は、FR空間における各概念の分離可能性とVLM空間を比較し、最も検出可能な100個のモデルの意味シグネチャを比較する。
我々は、4つのFRバックボーンと2つのVLMエンコーダをカバーし、EXPL-FRはアーキテクチャアクセスを必要としない。
論文 参考訳(メタデータ) (2026-08-21T12:16:35Z) - What Context Does a Coding Agent Actually Need to Act? [0.0]
現代的なコーディングエージェントは、リポジトリ全体をコンテキストウィンドウに保持することができる。
エージェントがいつコードをエンフェディットしなければならないかを調査する。
SWE-bench Verified上で、実際の課題解決に対してコンテキストをスコアする。
論文 参考訳(メタデータ) (2026-06-19T04:22:17Z) - Direct Visual Grounding by Directing Attention of Visual Tokens [8.586228101739259]
視覚言語モデル(VLM)は、視覚トークンとテキストトークンを混合する。
NTP損失は視覚トークンに注意を向けるには不十分な信号であると考えられる。
視覚トークンの注意を直接監視する新しい損失関数を提案する。
論文 参考訳(メタデータ) (2025-11-16T19:09:21Z) - Promote, Suppress, Iterate: How Language Models Answer One-to-Many Factual Queries [24.906758097101143]
1対多の事実クエリに答えるためには、言語モデル(LM)が同時に知識をリコールし、以前の回答を繰り返すことを避ける必要がある。
複数のデータセット、モデル、プロンプトテンプレートにまたがって、プロモート・then-suppressメカニズムを同定する。
我々は、LMの内部コンポーネントが、複雑な事実リコールをサポートするために異なる入力トークンとどのように相互作用するかについて、新たな洞察を提供する。
論文 参考訳(メタデータ) (2025-02-27T19:23:15Z) - Trust but Verify: Programmatic VLM Evaluation in the Wild [62.14071929143684]
プログラム型VLM評価(Programmatic VLM Evaluation、PROVE)は、オープンなクエリに対するVLM応答を評価するための新しいベンチマークパラダイムである。
我々は,PROVE上でのVLMの有効性-実効性トレードオフをベンチマークした結果,両者のバランスが良好であることは極めて少ないことがわかった。
論文 参考訳(メタデータ) (2024-10-17T01:19:18Z) - Leveraging VLM-Based Pipelines to Annotate 3D Objects [68.51034848207355]
本稿では,VLMの応答に影響を与える視点などの要因を疎外する代替アルゴリズムを提案する。
テキストのみの応答をマージする代わりに、VLMの合同画像テキストの可能性を利用する。
VLMベースのパイプラインを使って764Kデータセットから764Kオブジェクトの信頼性の高いアノテーションを生成する方法を示す。
論文 参考訳(メタデータ) (2023-11-29T17:54:22Z) - Forward-Backward Reasoning in Large Language Models for Mathematical Verification [65.9495774606273]
自己整合性(Self-Consistency)は、さまざまな推論チェーンの回答をサンプリングし、多数決によって最終回答を選択する。
候補解の検証に後方推論を導入する。
検証のための FOrward と BAckward Reasoning は最先端の性能を達成する。
論文 参考訳(メタデータ) (2023-08-15T13:19:59Z) - Towards Robust Referring Image Segmentation [80.53860642199412]
Referring Image (RIS)は、テキスト記述に基づいてオブジェクトマスクを出力する基本的な視覚言語タスクである。
我々はロバスト参照画像(R-RIS)というRISの新しい定式化を提案する。
既存のRISデータセットを負の文で拡張することで、3つのR-RISデータセットを作成します。
本稿では,トークンベースのビジョンと言語融合モジュールを備えた,RefSegformerと呼ばれるトランスフォーマーベースのモデルを提案する。
論文 参考訳(メタデータ) (2022-09-20T08:48:26Z) - VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive
Learning [82.09856883441044]
ビデオ理解は、内部接続をモデル化するグローバルコンテンツを認識することに依存している。
空間領域と時間領域の両方で隣接するビデオトークンをマスクするブロックワイズ戦略を提案する。
また、グローバルコンテンツをさらにキャプチャするために、拡張不要なコントラスト学習手法も追加する。
論文 参考訳(メタデータ) (2021-06-21T16:48:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。