論文の概要: CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.04509v1
- Date: Wed, 05 Aug 2026 06:47:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.761725
- Title: CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models
- Title(参考訳): CARGO-VL:視覚言語モデルに対するリスク制約付きグループ最適化による実測
- Authors: De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma,
- Abstract要約: 視覚言語システムは、画像と検索されたテキストを組み合わせるが、これらの情報源は意見の相違や、共同で回答をサポートしない可能性がある。
CARGO-VL(CARGO-VL)は、一致、画像補正、テキスト訂正、および両筆(A/V/T/N)エビデンス状態をカバーする、一致した変種を最適化するグループ相対フレームワークである。
また,4条件のコンフリクトトレーニングリソースであるXMC(eXtended Modal Conflict)をコントリビュートし,CMC-BenchとModality-Biasの移行を評価する。
- 参考スコア(独自算出の注目度): 2.038560872025072
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language systems combine images with retrieved text, but these sources can disagree or jointly fail to support an answer. Reliable models must identify the trustworthy source and abstain when neither is adequate. Existing post-training objectives score instances independently and therefore do not enforce coherent behavior under counterfactual evidence changes. We introduce CARGO-VL, a group-relative framework that optimizes matched variants covering aligned, image-correct, text-correct, and both-wrong (A/V/T/N) evidence states as one bundle. Its objective couples condition-wise correctness with transition rewards for answer invariance, source equivariance, and answer-to-abstention switching, while a primal-dual controller balances unsafe answers against excessive deferral. We also contribute XMC (eXtended Modal Conflict), a four-condition conflict training resource, and evaluate transfer on CMC-Bench and Modality-Bias. Across multiple seeds, CARGO-VL improves conflict handling, unsupported-answer avoidance, and modality balance over pointwise baselines. Ablations identify complementary benefits from relational transition signals and adaptive risk control, supporting counterfactual consistency as a practical objective for reliable multimodal evidence arbitration.
- Abstract(参考訳): 視覚言語システムは、画像と検索されたテキストを組み合わせるが、これらの情報源は意見の相違や、共同で回答をサポートしない可能性がある。
信頼性のあるモデルは、信頼できるソースを特定し、どちらも適切でない場合に控える必要があります。
既存の訓練後の目的は個別にインスタンスをスコアし、従って反実的な証拠の変化の下で一貫性のある振る舞いを強制しない。
CARGO-VLは,整列,画像補正,テキスト訂正,両筆(A/V/T/N)エビデンス状態をひとつのバンドルとして扱う,一致した変種を最適化する,グループ相対的フレームワークである。
その目的は、応答不変性、ソース同値性、応答対アテンションスイッチングのための遷移報酬と条件ワイズ正当性を結合し、一方、原始双対制御器は過度な遅延に対して安全でない解のバランスをとる。
また,4条件のコンフリクトトレーニングリソースであるXMC(eXtended Modal Conflict)をコントリビュートし,CMC-BenchとModality-Biasの移行を評価する。
複数の種にまたがって、CARGO-VLはコンフリクトハンドリング、サポート対象回避、ポイントワイドベースラインに対するモダリティバランスを改善している。
アブレーションはリレーショナル・トランジション・シグナルとアダプティブ・リスク・コントロールの相補的な利点を識別し、信頼性のあるマルチモーダル・エビデンス・仲裁の実践的目的として対実的一貫性を支持する。
関連論文リスト
- COSMO: Consensus-Driven Shift Modulation for Source-Free Domain Adaptation [79.43842208099619]
ソースフリードメイン適応(SFDA)は、ソースデータなしでラベルなしのターゲットドメインにソーストレーニングされたモデルを適用する。
VLM誘導型SFDAを標本単位の信頼性割当問題として定式化する。
本稿では,専門家から専門家への指導を協調適応に置き換えるために,COSMO(Consensus-Driven Shift Modulation)を提案する。
論文 参考訳(メタデータ) (2026-08-05T09:10:30Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - TwistedMerge: Certified Higher-Order Diagnostics and Abstention for Model Merging [0.48086260459837454]
我々は、チェックポイントが局所対象、アライメントマップが遷移、サイクル積が残留する有限降下問題としてマージを定式化する。
提案手法は, 定数エッジのNo-go結果, フリーズ・コンプレックスの3方向およびプレファミリーの誤差制御定理, 比較・複雑感度の精査試験である。
訓練された低ランク適応型監査では, 平均化係数は選択したGLr代表に依存するが, 大域的因子同期と高密度デルタSVDは安定である。
論文 参考訳(メタデータ) (2026-07-23T03:24:50Z) - Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction [4.273094752480624]
本稿では,対話的証明理論に基づく推論時間プロトコルであるPVDを導入する。
PVDは回答と構造化された信頼判定の両方を生成し、システムは不確実なケースを棄却しながら高信頼の回答を報告できる。
論文 参考訳(メタデータ) (2026-05-24T15:23:27Z) - To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition [87.22988227382329]
マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
我々は,いつフューズするか,いつモダリティを落とすのかを学習する統合フレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
論文 参考訳(メタデータ) (2026-05-06T13:11:33Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal [31.458406135473805]
異種不確実性証拠を正当性の校正確率に変換する統一フレームワークUniCRを提案する。
UniCRは、温度スケーリングと適切なスコアリングを備えた軽量なキャリブレーションヘッドを学習する。
ショートフォームQA、実行テスト付きコード生成、検索強化ロングフォームQAの実験は、キャリブレーションメトリクスの一貫性のある改善を示している。
論文 参考訳(メタデータ) (2025-09-01T13:14:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。