論文の概要: Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
- arxiv url: http://arxiv.org/abs/2608.04698v1
- Date: Wed, 05 Aug 2026 11:07:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.834396
- Title: Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
- Title(参考訳): No: Referring Expression Comprehension by Refusal Calibated GRPO
- Authors: Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang,
- Abstract要約: Generalized Referring Expression (GREC) は、テキスト式(正のサンプル)が存在するときに記述されたオブジェクトをローカライズし、(負のサンプル)存在しないときに出力を拒否するモデルを必要とする。
教師付き微調整(SFT)や強化学習(RL)のような既存の訓練後のアプローチは、拒絶行動を高めるが、通常正のサンプル上での局所化精度を低下させ、モデルのコアコンピテンスを損なう。
本稿では,ローカライゼーション性能を維持しながらMLLMのリファリング能力を向上するRL戦略であるRefusal-Calibrated Group Relative Policy Optimization (RC-GRPO)を提案する。
- 参考スコア(独自算出の注目度): 8.477600107706547
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We tackle the challenging yet underexplored task of Generalized Referring Expression Comprehension (GREC), which requires a model to localize the object described by a textual expression when it exists (positive sample) and to refuse output when it does not (negative sample). Although Multimodal Large Language Models (MLLMs) excel at localizing existing objects, they often fail to reject nonexistent ones due to the absence of negative samples during training, producing hallucinated bounding boxes. Existing post-training approaches such as supervised fine-tuning (SFT) and reinforcement learning (RL) enhance refusal behavior but usually degrade localization accuracy on positive samples, undermining the model's core competence. To address this, we propose Refusal-Calibrated Group Relative Policy Optimization (RC-GRPO), a calibrated RL strategy that strengthens the refusal ability of MLLMs while preserving localization performance. It enforces "None" outputs in rollouts for valid advantage estimation on negative samples and applies a penalty to prevent over-refusal on positives, achieving a balanced trade-off between accuracy and reliability. A second-stage reasoning reinforcement further consolidates causal understanding and interpretability. Experiments on three GREC benchmarks demonstrate that RC-GRPO attains superior localization accuracy while maintaining strong refusal capability.
- Abstract(参考訳): 我々は,汎用参照表現理解(GREC)の課題に取り組み,テキスト表現で記述されたオブジェクトを(正のサンプル)存在時にローカライズし,(負のサンプル)存在時に出力を拒否するモデルを必要とする。
MLLM(Multimodal Large Language Models)は、既存のオブジェクトのローカライズに優れていますが、トレーニング中に負のサンプルがないため、既存のオブジェクトを拒否できず、幻覚的境界ボックスを生成します。
教師付き微調整(SFT)や強化学習(RL)のような既存の訓練後のアプローチは、拒絶行動を高めるが、通常正のサンプル上での局所化精度を低下させ、モデルのコアコンピテンスを損なう。
そこで本稿では,ローカライゼーション性能を維持しながらMLLMのリファリング能力を向上するRL戦略であるRefusal-Calibrated Group Relative Policy Optimization (RC-GRPO)を提案する。
負のサンプルに対して有効に有利な推定を行うために、"None"出力をロールアウトで実施し、正の値に対する過剰な拒絶を防ぐためにペナルティを適用し、精度と信頼性のバランスの取れたトレードオフを達成する。
第2段階の推論強化は、因果理解と解釈可能性をさらに強化する。
3つのGRECベンチマーク実験により、RC-GRPOは強い拒絶能力を維持しつつ、より優れたローカライゼーション精度が得られることが示された。
関連論文リスト
- Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - Estimating Rare Events in Language Models with Proper Evaluation [16.1901795614153]
GA-AMLS(Gradient Activation Adaptive Multi-Level Splitting)を導入する。
GA-AMLSは、言語モデルの連続活性化空間に希少なモンテカルロ法を適用する。
また、ゼロ推定に対して有限な適切なスコアリング規則であるシフトパワー・ブレグマン(SPB)ロス(英語版)を提案する。
論文 参考訳(メタデータ) (2026-07-20T19:07:43Z) - Enhancing Rubric-based RL via Self-Distillation [23.111278687216544]
本稿では, ルブリックをベースとしたRLをオンライン自己蒸留により強化するCriPO(Criterion-Distilled Policy Optimization)を提案する。
CriPOはルーブリックベースのRLを一貫して上回り、最適化手順を減らした約2ドルで、より強力な最終性能を実現している。
論文 参考訳(メタデータ) (2026-07-20T15:50:02Z) - Interactive Critique-Revision Training for Reliable Structured LLM Generation [18.00222080273147]
DPA-GRPOは,構成された検証器の介入による2人プレイヤジェネレータゲームのためのペアアクショントレーニング手法である。
我々は,非正規化ゲームを分析し,厳格に低いリワード介入やリビジョン行動に対する肯定的な確率が,一側偏差を生み出すことを示す。
TaxCalc TY24の実験では、DPA-GRPOはゼロショット生成とジェネレータのみのRLベースラインよりも構造化された決定精度を向上させる。
論文 参考訳(メタデータ) (2026-05-08T17:00:38Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes [55.2480439325792]
強化学習(Reinforcement Learning, RL)は、数学のような検証可能な決定論的領域において、言語モデルの精度を向上させるために著しく有効であることが証明されている。
本稿では,現在のRL法が,科学的実験のような検証可能な領域における言語モデルの最適化にも有効かどうかを検討する。
論文 参考訳(メタデータ) (2025-08-15T20:50:53Z) - Flipping Against All Odds: Reducing LLM Coin Flip Bias via Verbalized Rejection Sampling [59.133428586090226]
大規模言語モデル(LLM)は、しばしば自然言語を用いて確率分布を正確に記述することができる。
このミスマッチはモンテカルロ法、エージェントベースのシミュレーション、ランダム化された意思決定などの信頼性を必要とするタスクでの使用を制限する。
本稿では,古典的リジェクションサンプリングの自然言語適応であるVerbalized Rejection Smpling (VRS)を紹介する。
論文 参考訳(メタデータ) (2025-06-11T17:59:58Z) - A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce [68.99924691391048]
我々はGRPOを強化的なアルゴリズムの観点から再検討し、そのコアコンポーネントを分析する。
単純な拒絶サンプリングベースラインであるRAFTは,GRPOやPPOよりも競争性能が高いことがわかった。
この知見に触発されて、完全に正しくないサンプルと完全に正しいサンプルの両方をフィルタリングするポリシー勾配の最小限の拡張であるReinforce-Rejを提案する。
論文 参考訳(メタデータ) (2025-04-15T16:15:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。