論文の概要: Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.02575v1
- Date: Tue, 30 Jun 2026 17:22:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.331705
- Title: Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models
- Title(参考訳): ルール・コンディショナル・インコンテキスト・ラーニング:視覚言語モデルにおける基準・シフト適応の評価
- Abstract要約: ビジョン言語モデルは、テキスト内学習(ICL)を通じてパラメータ更新なしで新しいタスクを実行できる
現実世界のアプリケーションでは、多くのタスクは安定したハイレベルな意図を示し、その決定基準は特定の要求に応じて変化する。
提案手法では,モデルが文脈から潜在的基準を推論しなくてはならない,CC-ICL(Criterion-Conditional In-Context Learning)と呼ばれる新しい設定を導入する。
- 参考スコア(独自算出の注目度): 2.2633326936241196
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models can perform new tasks without parameter updates through in-context learning (ICL), whose core mechanism is utilizing the support set for task induction. In the standard ICL setting, once the task is induced, its decision criterion remains fixed. However, in real-world applications, many tasks exhibit a stable high-level intent, while their decision criteria shift according to specific requirements. Thus, we introduce a new setting, denoted as Criterion-Conditional In-Context Learning (CC-ICL), where models must infer the latent criterion from context and adjust predictions accordingly under fixed task semantics. To evaluate this capability, we propose two complementary metrics, Criterion Invariance and Criterion Sensitivity, capturing the model's robustness and adaptability under criterion shifts. We further construct CC-Bench, a multi-domain benchmark that supports evaluation under the CC-ICL setting. By employing a dual-level data hierarchy, CC-Bench enables legitimate ground-truth variation conditioned on the active criterion even when the task remains fixed. Experiments on CC-Bench reveal that most models exhibit a rigid boundary bias, struggling to align their decisions with the latent criterion. We also find that even a simple multi-criterion training strategy can significantly reduce this bias, improving Criterion Sensitivity and enabling 7B-scale models to surpass proprietary models without degrading general multimodal performance.
- Abstract(参考訳): ビジョン言語モデルは、タスク誘導のためのサポートセットを利用する中核的なメカニズムであるICL(In-context Learning)を通じて、パラメータを更新することなく、新しいタスクを実行することができる。
標準のICL設定では、タスクが誘導されると、その決定基準が固定される。
しかし、現実世界のアプリケーションでは、多くのタスクは安定したハイレベルな意図を示し、その決定基準は特定の要求に応じて変化する。
そこで我々は,Criterion-Conditional In-Context Learning (CC-ICL) と呼ばれる新しい設定を導入する。
この能力を評価するために, 基準不変度と基準感度の2つの相補的指標を提案し, 基準シフトの下でモデルの頑健性と適応性を捉える。
さらに,CC-ICL設定下での評価をサポートするマルチドメインベンチマークであるCC-Benchを構築した。
二重レベルデータ階層を利用することで、CC-Benchは、タスクが固定されたままでも、アクティブな基準で条件付けられた正統な接地構造変化を可能にする。
CC-Benchの実験では、ほとんどのモデルが厳密な境界バイアスを示し、決定を潜伏する基準に合わせるのに苦労していることが明らかになった。
また、単純なマルチ基準トレーニング戦略であっても、このバイアスを著しく低減し、クレーター感度を改善し、一般的なマルチモーダル性能を低下させることなく7Bスケールモデルがプロプライエタリモデルを上回ることができることがわかった。
関連論文リスト
- Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation [1.3629559589878444]
本研究では,大規模言語モデル (LLM) が条件付き行動を示すか否かを検討する。
強いベンチマークパフォーマンスは、基準レベルではかなりの失敗を隠す可能性がある。
これらの知見は、基準条件付き行動を明示的に測定する評価方法の開発を促すものである。
論文 参考訳(メタデータ) (2026-09-03T13:17:38Z) - CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes [8.494161214945963]
高い効率を保ちながら推論を改善する新しい推論時間フレームワークであるCritICLを紹介する。
我々は、より弱いモデルから派生した障害モードを利用して、批判に基づくインコンテキストの例を通して、それらを推論に取り入れる。
CRITICLは、標準のコンテキスト内学習を一貫して上回り、テスト時間スケーリング手法と競合する、あるいは優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-08-27T17:59:30Z) - Capturing LLM Capabilities via Evidence-Calibrated Query Clustering [12.71199389824453]
本稿では,表面レベルのセマンティクスと潜在能力要件のギャップを埋めるために,事前セマンティクス埋め込みを校正するアルゴリズムECCを提案する。
ECCはBradley-Terryモデルによってパラメータ化された機能プロファイルを通じて各クラスタを特徴付け、トレーニング可能な混合重み付けを使用して、混合機能要求のクエリに適合する。
論文 参考訳(メタデータ) (2026-05-16T18:30:37Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - A Sanity Check on Composed Image Retrieval [91.95275287747499]
Composed Image Retrieval (CIR) は、参照画像からなるクエリと、所望の修正を指定する相対的なキャプションに基づいて、ターゲット画像を取得することを目的としている。
FISD(Fully-Informed Semantically-Diverse benchmark)は、参照ターゲット画像対の変数を正確に制御するために生成モデルを利用する。
本稿では,対話型シナリオにおける既存モデルの可能性を探るためのマルチラウンドエージェント評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-14T15:52:22Z) - CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation [9.80652710081054]
CLSGenはバイナリ分類タスクのための新しい微調整フレームワークである。
モデル固有の説明生成能力を犠牲にすることなく、頑健な確率推定を可能にする。
CLSGenで微調整されたモデルは、分類基準において既存のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-04-13T17:58:43Z) - CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling [61.75914342638658]
CDRRM(Contrast-Driven Reward Model)は、高品質なルーリック生成と優先判断のためのフレームワークである。
この作業は、報酬モデリングのためのスケーラブルで解釈可能で、データ効率のよいパスを提供する。
論文 参考訳(メタデータ) (2026-03-09T07:15:23Z) - CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria [48.70940362676624]
専用の2段階ロールアウト法を用いて学習したポイントワイズ生成報酬モデルCE-RM-4Bを提案する。
オープンソースの選好データセットから算出した約5.7Kの高品質データを用いて、CE-RM-4Bは様々な報奨モデルベンチマークにおいて優れた性能を実現する。
論文 参考訳(メタデータ) (2026-01-28T07:46:13Z) - Cost-Sensitive Evaluation for Binary Classifiers [0.013048920509133805]
重み付き精度(英: Weighted Accuracy, WA)は、よく知られた精度の計量の重み付きバージョンとして、直接解釈されたバイナリ分類器の評価指標である。
コスト依存シナリオにおけるクラス不均衡を扱うための概念的枠組みを明らかにする。
論文 参考訳(メタデータ) (2025-10-24T20:34:18Z) - LLM4Rerank: LLM-based Auto-Reranking Framework for Recommendations [51.76373105981212]
リグレードはレコメンデーションシステムにおいて重要な要素であり、レコメンデーションアルゴリズムの出力を精査する上で重要な役割を果たす。
そこで我々は,様々な格付け基準をシームレスに統合する包括的格付けフレームワークを提案する。
カスタマイズ可能な入力機構も統合されており、言語モデルのフォーカスを特定の再配置のニーズに合わせることができる。
論文 参考訳(メタデータ) (2024-06-18T09:29:18Z) - Mitigating Catastrophic Forgetting in Task-Incremental Continual
Learning with Adaptive Classification Criterion [50.03041373044267]
本稿では,継続的学習のための適応型分類基準を用いた教師付きコントラスト学習フレームワークを提案する。
実験により, CFLは最先端の性能を達成し, 分類基準に比べて克服する能力が強いことが示された。
論文 参考訳(メタデータ) (2023-05-20T19:22:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。