論文の概要: TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.26536v1
- Date: Wed, 29 Jul 2026 07:04:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.563773
- Title: TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models
- Title(参考訳): TPCD:視覚言語モデルにおけるトーン・プレッシャ・コントラストデコーディングとラベルフリーゲーティング・ボトルネック
- Abstract要約: 高圧プロンプトは、視覚言語モデルをサポート対象のコミットメントに押し込むことができる。
本稿では, 圧力誘起分布自体が負の負の分岐として機能するかどうかを問う。
- 参考スコア(独自算出の注目度): 5.8343339944466885
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-pressure prompts can push vision-language models (VLMs) into unsupported commitments, such as reading illegible text, reporting indeterminate times, or affirming absent objects. This paper asks whether the pressure-induced distribution itself can serve as a contrastive-decoding negative branch. Tone-pressure contrastive decoding (TPCD) subtracts logits produced under a high-pressure instruction from logits produced under a safe neutral instruction. On the 800-example tone-matters benchmark, LLaVA-1.5-7B under pressure reaches 66.75% attack success rate (ASR); safe neutralization reduces ASR to 9.88%; full TPCD reaches 0.50% but collapses positives to 15.56%. A benchmark-specific task-prior/disagreement gate preserves measured positive accuracy (54.44%) while lowering ASR to 1.63% on LLaVA. Treating this LLaVA analysis as the design split, full $n=800$ negative and $n=780$ matched-positive held-out runs on GLM-4.6V and Llama-3.2-Vision show that simple gates can improve over safe neutralization, with sensitivity analyses bounding the weak time-positive subtask. A category-prior-free answer-disagreement router reduces held-out aggregate ASR to 6.93%, improving over both safe neutralization (10.98%) and branch disagreement (9.67%) while matching branch disagreement's 79.94% positive accuracy, although it remains post-hoc and surface-form based. We conclude that pressure is a useful probe of commitment bias and a viable mitigation signal, but the current gates are not yet independently validated grounding-aware detectors.
- Abstract(参考訳): 高圧プロンプトは視覚言語モデル(VLM)を、不可解なテキストの読み上げ、不定の時刻の報告、欠落したオブジェクトの確認など、サポート対象にプッシュすることができる。
本稿では, 圧力誘起分布自体が負の負の分岐として機能するかどうかを問う。
Tone-pressure contrastive decoding (TPCD) は、安全な中立命令の下で生成されたロジットから高圧命令で生成されたロジットを減算する。
800-example tone-mattersベンチマークでは、LLaVA-1.5-7Bが66.75%の攻撃成功率(ASR)に達し、安全中和によりASRは9.88%まで減少し、完全なTPCDは0.50%に達するが15.56%に崩壊する。
ベンチマーク固有のタスク優先/診断ゲートは、測定された正の精度(54.44%)を維持し、ASRをLLaVAで1.63%まで下げる。
このLLaVA分析を設計分割として扱うと、GLM-4.6VおよびLlama-3.2-Vision上でのフル$n=800$負の値と$n=780$の値が一致した値のホールドアウト動作は、単純ゲートが安全な中和よりも改善できることを示し、感度解析は弱い時間正のサブタスクを制限している。
カテゴリー優先の解答判定ルータはASRを6.93%に減らし、安全中和(10.98%)と分岐不一致(9.67%)の両方よりも改善し、また分岐不一致の79.94%の正の精度は保温後および表面形状に基づいている。
我々は、圧力はコミットメントバイアスの有用なプローブであり、生存可能な緩和信号であるが、現在のゲートは、まだ独立してグラウンド・アウェア・ディテクターとして検証されていないと結論づける。
関連論文リスト
- AgentDV: Closed-Loop Agentic AI for Hardware Design Verification [1.5477055061671623]
AgentDVは、自動RTL検証環境生成のためのクローズドループエージェントAIフレームワークである。
単発LLMテストベンチ生成をツール地上検証パイプラインに変換する。
AgentDVは4つのDUTで100%パスレートを達成し、Claude Sonnet 4.6を使用してすべてのDUTで平均80.9%パスレートを達成している。
論文 参考訳(メタデータ) (2026-08-27T14:00:16Z) - Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference [22.335515110971475]
ビジュアルトーケンプルーニングは、一定保持予算における応答品質によって判断される。
私たちはこの盲点を、幾何学的トークン・オリジンの証明によってカップルが行動に答えるエビデンスリスク監査にします。
目的検証ポイントがタスク汎用圧縮を含まないことを示す。
論文 参考訳(メタデータ) (2026-07-29T13:45:31Z) - Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.0]
DASEは、ベンチマークをまたいで一般化するコミット型ルーティングパーティションを生成する。
インジェクション帯域ではなく、適応的な停止が正確さを駆動する。
インジェクションベースの手法は、逆Uの精度-vs-推論軌道を示す。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z) - Mitigating False Positives in Static Memory Safety Analysis of Rust Programs via Reinforcement Learning [9.7161418437872]
Rustプログラムのメモリ安全性を確保するには静的解析ツールが不可欠だ。
RudraやMirCheckerといった既存のツールは、偽陽性率が高い。
本稿では,突発的な警告を自動的に分類・抑制するための新しい強化学習(RL)アプローチを提案する。
論文 参考訳(メタデータ) (2026-05-05T17:21:40Z) - ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning [60.411097231348975]
RLVRによる強化学習は大規模言語モデル(LLM)の推論を強化する
本稿では,正と負の応答間で類似した意味分布を分離する,正のサンプル投影Residual Reinforcement Learning (ResRL)を提案する。
論文 参考訳(メタデータ) (2026-05-01T03:57:44Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away [97.11976870616273]
本稿では,安全回復を目的ではなく満足度の高い制約として扱う軽量な推論時防衛法を提案する。
6つのオープンソースMLRMと4つのjailbreakベンチマークで評価した結果、SafeThinkは攻撃成功率を30~60%削減しました。
論文 参考訳(メタデータ) (2026-02-11T18:09:17Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - VAULT: Vigilant Adversarial Updates via LLM-Driven Retrieval-Augmented Generation for NLI [15.320553375828045]
VAULTは、NLIモデルの弱点を発見し、改善する完全に自動化された対向的なRAGパイプラインである。
VAULTはデータセット間で、従来よりも最大で2.0%パフォーマンスが向上している。
論文 参考訳(メタデータ) (2025-08-01T14:22:54Z) - Patch-Level Contrasting without Patch Correspondence for Accurate and
Dense Contrastive Representation Learning [79.43940012723539]
ADCLRは、正確で高密度な視覚表現を学習するための自己教師型学習フレームワークである。
提案手法は, コントラッシブな手法のための新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2023-06-23T07:38:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。