論文の概要: Correcting What You Cannot See: Credit Assignment for Perception Distillation in Multimodal Reasoners
- arxiv url: http://arxiv.org/abs/2607.28336v2
- Date: Sat, 01 Aug 2026 07:38:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.17981
- Title: Correcting What You Cannot See: Credit Assignment for Perception Distillation in Multimodal Reasoners
- Title(参考訳): 理解できないことの訂正:マルチモーダル共振器における知覚蒸留のためのクレジットアサインメント
- Abstract要約: 認識障害を識別するラベルフリー手法であるtextbfPerception-Correction Distillation (PCD) を導入する。
我々はベイズ証拠の組み合わせを通じてこのルールを動機付け、乗法がどちらの証人もいないときに消える唯一の正規化された双線型ゲートであることを示す。
- 参考スコア(独自算出の注目度): 34.39191083253229
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: On-policy distillation provides dense supervision for multimodal reasoners, but its trajectory-level reward cannot determine whether a failed answer arose from perception or subsequent reasoning. Perception Success Rate (PSR), estimated from multiple reasonings sharing one perception, remains ambiguous because low success conflates perceptual insufficiency with reasoning difficulty. We introduce \textbf{Perception-Correction Distillation (PCD)}, a label-free method that identifies correctable perception failures using downstream failure and teacher--student disagreement as complementary witnesses. Their product, , forms a soft AND gate that strengthens distillation only when both witnesses are present. We motivate this rule through Bayesian evidence combination and show that multiplication is the unique normalized bilinear gate that vanishes when either witness is absent. PCD uses separated perception--reasoning rollouts and mean-preserving weights, leaving the reasoning objective unchanged. Across eight benchmarks, PCD improves the 8B 2B macro average from 44.50 with OPD to 47.28 and the 32B 8B result from 56.94 to 61.22. In matched 2B ablations, removing PCD and separated rollout reduces held-out average by 2.22 and 0.88 points, respectively. Effective multimodal distillation therefore depends not only on what the teacher predicts, but also on identifying when perception is the appropriate target of correction.
- Abstract(参考訳): オンライン蒸留はマルチモーダルな推論者に対して厳密な監督を提供するが、その軌道レベルの報酬は、失敗する答えが知覚やその後の推論から生じるかどうかを判断することはできない。
パーセプション成功率 (PSR) は, 一つの認識を共有できる複数の推論から推定されるが, 成功率の低さは, 推論困難を伴うパーセプション不足を生じさせるため, あいまいなままである。
両証人が存在する場合にのみ蒸留を強化するソフト・アンド・ゲートをつくりだすラベルフリー手法である「textbf{Perception-Correction Distillation (PCD)」を導入し、このルールをベイズ的証拠の組み合わせを通じて動機付けし、乗算がいずれの証人がいないときに消滅するユニークな正規化バイリニアゲートであることを示す。PCDでは、識別調整ロールアウトと平均保存重量を分離して、推論の目的を変更せずに使用する。
8つのベンチマークで、PCDは8B 2Bのマクロ平均を44.50に改善し、OPDは47.28に、32B 8Bは56.94から61.22に改善した。
一致した2Bアブレーションでは、PCDを除去し、分離したロールアウトは、それぞれホールドアウト平均を2.22ポイント、0.88ポイント削減する。
したがって、効果的なマルチモーダル蒸留は、教師が予測するものだけでなく、認識が適切な修正対象であるかどうかの同定にも依存する。
関連論文リスト
- Reliable Benchmarking of Artifact Detection in Computational Pathology: A Reproducibility and Uncertainty Analysis [1.8864137667201766]
メソッド: このプロトコルは、テストセットサンプリング、トレーニング性、パーティション構成、文書化前処理の4つの変数ソースを定量化する。
拡散型人工物検出装置を独立に再構築し, 元の24スライディング分割と教師付きベースラインに対して評価した。
結果: 本手法の中枢機構は、補助的コントラスト項は、プールされたF1を0.673から0.688に改善し、第2シードで複製する。
論文 参考訳(メタデータ) (2026-08-31T14:07:15Z) - The Distributional View of Knowledge Distillation [13.841028090842869]
トークンレベルの知識蒸留は、位置ごとに2つの条件分布に一致する。
我々は,教師が単一軟化アウトプットではなく,多温度ビューのファミリで表される分布ビューを開発する。
論文 参考訳(メタデータ) (2026-08-15T13:03:31Z) - When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine Collectives [0.0]
我々は,集団知能研究における分散リビジョン結合を運用する。
条件付き不服従は虚偽の前提回復を+17.7ポイント改善することを示す。
介入スタンスシフトと前提保存率を正確さとともに報告することを推奨する。
論文 参考訳(メタデータ) (2026-08-04T14:19:59Z) - Outcome-Confounded Local Supervision in On-Policy Distillation [0.5937989874256571]
オンライン蒸留は生徒を自身の軌道で訓練し、教師は生徒が訪問する接頭辞に密集したトークンレベルを供給している。
いずれの読解も、完成した軌跡の結果によって構築されていることを示す。
最終回答の正しさを両立させた結果解決診断法を提案する。
論文 参考訳(メタデータ) (2026-07-26T16:03:33Z) - Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning [73.40085256022111]
P2R(Perceive-to-Reason)は、2段階のプロセスとして微細な視覚的推論を定式化する統合フレームワークである。
P2RはPerceiverとして質問関連エビデンスをローカライズし、アノテートされた画像と収穫された領域に基づいて質問をReasonerとして答える。
PRA-GRPOは、認識重視と推論重視の更新を交互に行うロールアウェア強化学習戦略である。
論文 参考訳(メタデータ) (2026-07-01T17:24:26Z) - CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning [4.663685189987781]
自己蒸留剤強化学習は、トークンレベルの蒸留損失で軌跡レベルの報酬を増大させる。
一般的なレシピでは、この損失を1つのスカラー、すなわち教師と学生の対数確率のギャップで埋める。
CRAFTは2つの制限に対処する3ピラー・クレジット・アサインメント方式である。
論文 参考訳(メタデータ) (2026-06-28T16:11:47Z) - CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation [50.353919095724315]
実世界のシナリオにおける効率的な展開の急激な需要により,ビデオ拡散モデルの蒸留が注目されている。
我々は,凍結教師とオンライン偽モデルによって既に生成されているスコア推定を再利用し,対関係行列を構成する軽量リレーショナルレギュレータであるCopula-Aware DMD(CoDMD)を提案する。
1.3Bと14BスケールのWan-2.1-T2Vモデルシリーズで、CoDMDは50ステップの教師を4ステップの学生に蒸留し、VBenchスコア84.46と84.87を達成しながら、およそ25$times$ Speed-upを達成した。
論文 参考訳(メタデータ) (2026-06-20T10:33:14Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation [51.32912774464992]
大規模な言語モデルは、しばしば完全に指定されたプロンプトからタスクを解くが、同じ要求が複数のターンに広がると分解する。
本研究は, モデル自体の方針から, 履歴をクリアした基準を用いて汚染を低減させる, オンライン自己蒸留法であるMAIGOを提案する。
ミドルターンの場合、MAIGOは、ユーザ可視のシャードプレフィックスを保持しながら、事前のアシスタント応答を削除します。
論文 参考訳(メタデータ) (2026-05-26T15:38:46Z) - Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy [0.7212939068975618]
事前訓練されたベースモデルは、インストラクトの変種と同じ置換パターンを示し、インストラクトよりも高い収率を平均化する。
このウィンドウの上のパッチは、クリーンにプレッシャーされたP(正しい)ギャップの96%を復元する。
2つの凝縮活性化空間介入は、新しいサイコファンシー回路を活性化するのではなく、圧力がクリーンな推論特性を抑制することを示している。
論文 参考訳(メタデータ) (2026-05-13T04:45:08Z) - Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning [11.179446105672461]
教師付き微調整と強化学習を組み合わせた多段階効率的な推論手法を提案する。
提案手法は,8Bモデルでは平均28%,32Bモデルでは40%の応答長を減少させる。
より複雑な最先端の効率的な推論手法に比べて、優れたトレードオフを実現する。
論文 参考訳(メタデータ) (2026-01-06T12:31:51Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。