論文の概要: Have I Seen Enough? Frozen Video-Language Models Encode Evidence Readiness
- arxiv url: http://arxiv.org/abs/2610.08560v1
- Date: Tue, 06 Oct 2026 15:43:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.090388
- Title: Have I Seen Enough? Frozen Video-Language Models Encode Evidence Readiness
- Title(参考訳): 冷凍ビデオランゲージモデルでエビデンスの準備が整う
- Abstract要約: 凍結したビデオLLMは、タイムスタンプ付きエビデンスからラベル付けされた線形可読なエビデンス可読性信号を持つことを示す。
我々は、読み出しを、一致したビデオ時間で最大9.75ppの精度を向上する回答最適化ポリシーであるレディティーゲーティングに変換する。
- 参考スコア(独自算出の注目度): 14.606133970882352
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming video-language models must decide not only what to answer, but whether the evidence needed for the current question has arrived. Existing systems learn that decision as a separate trigger; we ask whether an unmodified model already computes it. We show that frozen VideoLLMs carry a linearly readable evidence-readiness signal, labelled from timestamped evidence rather than from model output. It decodes in all seven models of a shared byte-identical evaluation (AUROC 0.733-0.905 under the strictest not-ready sampling, where a fitted clock is near chance), and a probe fitted without any of a benchmark family's footage still reads that family. It is question-conditioned: on byte-identical windows, changing only the question reverses the readout on 66.1% of pairs, while every question-blind control is at chance by construction. The model can answer incorrectly and still encode readiness: AUROC remains 0.722 among wrong answers. Readiness also beats uncertainty estimators and their supervised combination on latency-matched answer selection, and tracks independent human judgments more closely than confidence. Released streaming triggers are also linear readouts, yet a trained trigger read on its own base model's activations is approximately orthogonal to readiness and decodes it far less accurately than a probe. We turn the readout into Readiness Gating, an answer-timing policy that improves accuracy by up to +9.75 pp at matched video duration with negligible computational overhead. How much it gains varies with the accuracy headroom the task makes available: across 26 configurations the gain tracks that headroom, and an intervention that moves it over identical pixels moves the gain with it.
- Abstract(参考訳): ビデオ言語モデルのストリーミングは、何に答えるべきかだけでなく、現在の質問に必要な証拠が届いたかどうかを判断する必要がある。
既存のシステムは、その決定を別の引き金として学び、修正されていないモデルがすでにそれを計算しているかどうかを問う。
凍結したビデオLLMは、モデル出力ではなく、タイムスタンプ付きエビデンスからラベル付けされた線形可読なエビデンス可読性信号を持つことを示す。
共有バイト単位評価(AUROC 0.733-0.905)の7つのモデルすべてにデコードされ、ベンチマークファミリーの映像のないプローブがまだその家族を読み取る。
バイト単位ウィンドウでは、質問のみを変更すると66.1%のペアの読み出しが逆転し、全ての質問盲制御は建設によって偶然に行われる。
AUROCは間違った回答の中で0.722のままである。
Readinessはまた、レイテンシにマッチした回答の選択に関する不確実性推定と教師付き組み合わせを破り、信頼以上の独立した人間の判断を追跡する。
リリースされたストリーミングトリガも線形読み出しであるが、独自のベースモデルのアクティベーションでトレーニングされたトリガー読み込みは、可読性にほぼ直交し、プローブよりもはるかに少ない精度で復号する。
読み出しを可読性ゲーティング(Readiness Gating)に変換する。これは、計算オーバーヘッドが無視できるビデオ長で、最大9.75ppの精度を向上する解答最適化ポリシーである。
26のコンフィグレーションでヘッドルームをゲイントラックし、同じピクセルを移動させる介入によってゲインを移動させる。
関連論文リスト
- JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated Decisions Models [25.5874772119945]
JevAdvBench は RLCD モデルの最初の敵対的ベンチマークである。
ラベルではなく、モデル自身のクリーンな決定に対して攻撃された各決定をスコア付けし、同じ再実行による変更に対して読み取る。
Jev-1.13.0では、リワードは再実行ベースラインの1.2パーセント以内に留まり、スキーマ外のフィールドはモデルに到達しない。
論文 参考訳(メタデータ) (2026-09-25T11:32:19Z) - Do LiDAR Language Models Really Understand Spatio-temporal Relationships? [62.56505727364142]
ベンチマークと診断プロトコルであるLiDAR-Halluを150 nusのシーンで紹介する。
提案プロトコルは,固定回答と候補コンテンツ制御,クロスシーンペアを同一のプロンプトで組み合わせるが,参照応答は逆で,リレーショナルなリコールを行う。
記録された10万の応答の分析は、集合的空間精度によって隠された失敗を明らかにする。
論文 参考訳(メタデータ) (2026-09-21T11:59:07Z) - Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning [0.0]
我々は,モデルが出力に割り当てる対向的エビデンスギャップ,対数的対数的比を形式化する。
単一ビューでラベルなしの基準を用いて、バウンディングボックス、トレーニング、ラベルのない応答を持つ領域を見つける。
目標の4.4から5.1倍の精度でローカライズし、精度を70%から85%に引き上げる。
論文 参考訳(メタデータ) (2026-09-21T08:09:18Z) - Legible Failures: Detecting and Repairing In-Context Binding Errors [0.0]
間違った答えは、モデルが必要な情報を欠いているか、保持していたかを示していない。
16の公的なチェックポイントで、それぞれが3つのシードで評価される頻度を測定します。
インコンテキストバインディングは、プローブが動作可能な設定であることに気付きました。
論文 参考訳(メタデータ) (2026-09-10T08:20:15Z) - Evidence-Backed Video Question Answering [90.93225758130426]
既存の説明可能性の取り組みは、テキストの合理性やまばらなバウンディングボックスに依存している。
E-VQA(Evidence-Backed Video Question Answering)を提案する。
これをサポートするために,識別的および生成的画素レベルのグラウンド化のための最初の人為的検証ベンチマークST-Evidenceを導入する。
論文 参考訳(メタデータ) (2026-07-13T17:49:10Z) - Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs [9.465306048183798]
本稿では,解答安定性を評価するための制御プロトコルを提案する。
モデルが複数の選択問題に正しく答えた後、不正確な選択肢に対する一貫性のある議論でモデルに挑戦する。
自己貢献は相変わらずフリップ率を上昇させる。
論文 参考訳(メタデータ) (2026-06-14T20:45:30Z) - VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning? [79.44137632338062]
マルチモーダルな大規模言語モデルが視覚的推論問題に正しく答える場合、その予測はタスククリティカルな視覚的証拠によって実際に支持されているか?
VisualFLIPは1,374枚の画像が基数,属性,空間,論理的タスクにまたがって同一の問合せペアとして配置されたベンチマークである。
ペアの両面を解く必要がある24個のMLLMと、少なくとも一方の面を解くモデルが両方の画像に対して同じ空でない答えを繰り返す頻度を測定するCR(Collapse Rate)を評価した。
論文 参考訳(メタデータ) (2026-06-05T22:06:07Z) - Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge [15.724849094439987]
本稿では,適応型テスト時間計算を中心に構築された推論のみのシステムを提案する。
システムはまず、各質問に直接ビデオ言語モデルパスで答え、続いて複数の軽量ビューを使用して不安定な質問を見つける。
テストスプリットでは、最終システムは90.07平均精度と87.81マクロ平均精度を得る。
論文 参考訳(メタデータ) (2026-05-31T08:45:06Z) - Realistic Conversational Question Answering with Answer Selection based
on Calibrated Confidence and Uncertainty Measurement [54.55643652781891]
対話型質問回答モデル(ConvQA)は,会話中に複数回発生した質問文と過去の質問文のペアを用いて質問に回答することを目的としている。
本稿では,会話履歴における不正確な回答を,ConvQAモデルから推定された信頼度と不確実性に基づいてフィルタリングすることを提案する。
我々は2つの標準ConvQAデータセット上で、回答選択に基づくリアルな会話質問回答モデルの有効性を検証する。
論文 参考訳(メタデータ) (2023-02-10T09:42:07Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z) - Selective Question Answering under Domain Shift [90.021577320085]
モデルがドメイン外の入力に対して過度に信頼されているため、モデルのソフトマックス確率のみに基づくアテンションポリシーは不適切である。
キャリブレータをトレーニングして、QAモデルがアースする入力を識別し、エラーを予測した場合に停止する。
提案手法は,80%の精度を維持しながら56%の質問に回答するが,それに対してモデルの確率を直接使用する場合,80%の精度で48%しか回答しない。
論文 参考訳(メタデータ) (2020-06-16T19:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。