論文の概要: Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search
- arxiv url: http://arxiv.org/abs/2607.27422v1
- Date: Wed, 29 Jul 2026 19:43:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.317703
- Title: Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search
- Title(参考訳): 良質なランクと悪質な目的: 表現的政策探索による双線形コントラスト批判
- Abstract要約: これらの批評家は、K$選択、計画、そして批評家が指導する世代にとって、価値のような目的として振る舞う。
それにもかかわらず、コサインとハイブリッドの批評家は、ほとんどのプールからサポートなしのアクションを選択し、同じくらい後悔している。
ベルマンが訓練したTD-Qは、パラメータマッチング関数クラス制御を含む成功している。
- 参考スコア(独自算出の注目度): 0.05475997486212839
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Good action rankings do not make a contrastive critic safe to maximize. These critics increasingly act as value-like objectives for best-of-$K$ selection, planning, and critic-guided generation. Unbounded bilinear scores can let large embedding norms inflate off-support values, but cosine bounding does not remove the failure. A controlled support decomposition attributes most raw bilinear regret to norm drift. Cosine and hybrid critics nevertheless select off-support actions from most pools and incur comparable regret. Contrastive scores are weakly calibrated or inverted in the top score decile across four OGBench navigation tasks, and they fail to order fixed-query actions by value. Bellman-trained TD-Q succeeds, including in a parameter-matched function-class control. Realized costs depend on the task: simulator rollouts reveal single-step selection costs on PointMaze and the exact-$Q^*$ toy but well-powered nulls on AntMaze and HumanoidMaze, where the controller can self-correct. A training/readout decomposition traces the lost ordering to the cosine training objective; raw-trained embeddings retain weak ordering after inference-time normalization. Candidate maximization can therefore exploit false positives caused by norm drift, score saturation, or in-support misranking. Contrastive critics remain useful compatibility rankers on navigation and manipulation tasks, but action selection requires a value-calibrated scalar.
- Abstract(参考訳): 優れた行動ランキングは、コントラスト的な批評家が最大化することを安全にするものではない。
これらの批評家は、金の最良の選択、計画、そして批評家が指導する世代のための価値ライクな目標として振る舞うようになった。
非有界双線型スコアは、大きな埋め込みノルムによってサポート外値が増大するが、コサインバウンディングは失敗を除去しない。
制御された支持分解は、ほとんどの生の双線形後悔がノルムドリフトに起因している。
それにもかかわらず、コサインとハイブリッドの批評家は、ほとんどのプールからサポートなしのアクションを選択し、同じくらい後悔している。
コントラストスコアは、4つのOGBenchナビゲーションタスクでトップスコアの格付けが弱いか逆転し、固定クエリアクションを値によって順序付けできない。
ベルマンが訓練したTD-Qは、パラメータマッチング関数クラス制御を含む成功している。
シミュレータのロールアウトは、PointMazeと正確に$Q^*$のおもちゃのシングルステップ選択コストと、コントローラが自己修正できるAntMazeとHumanoidMazeでよく機能するnullを露呈する。
トレーニング・リードアウト分解は、損失順序をcosineトレーニング目標に追従する。
したがって、候補の最大化は、ノルムドリフト、スコア飽和、サポートなしの誤判定によって引き起こされる偽陽性を悪用することができる。
対照的な批評家は、ナビゲーションや操作タスクにおいて便利な互換性ランク付けを保っているが、アクションの選択には値校正スカラーが必要である。
関連論文リスト
- Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning [54.0056619145783]
プロセス・リワード・モデル (Process Reward Models, PRM) は、段階的なフィードバックを提供することで、推論のためのクレジット割り当てを改善する。
ステップレベルのトレーニングデータにおいて,重度の不均衡に起因するPRMの隠れバイアスを同定する。
対照的な段階比較から学習するポリシ対応のPRMトレーニングフレームワークであるPRISMを提案する。
論文 参考訳(メタデータ) (2026-06-08T06:22:33Z) - Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement [27.695600755960736]
自己誘導型フローマッチングポリシであるForesightFlowを紹介した。
それぞれの生成されたアクションチャンクを、学習された成功可能性軌道で拡張する。
候補アクションをスコア付けし、外部の批評家なしで$K$の推論を可能にする。
論文 参考訳(メタデータ) (2026-06-03T14:49:35Z) - \mathsf{VISTA}: Decentralized Machine Learning in Adversary Dominated Environments [21.69919643934826]
分散機械学習は、評価などのアウトソーシング計算を信頼できないワーカノードに頼っていることが多い。
本稿では, 相互に整合性がある場合にのみ, 報告を受理し, 報奨するインセンティブ指向の枠組みを通じて, 敵に支配される設定について検討する。
本稿では,最適化履歴を用いた適応アルゴリズムであるmathsfVISTAを提案する。
論文 参考訳(メタデータ) (2026-05-08T15:07:15Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Making Large Language Models Better Reasoners with Alignment [57.82176656663245]
推論(Reasoning)とは、証拠を使って結論に達する認知過程である。
近年の研究では、思考の連鎖(COT)推論プロセスによるデータ上の微調整LDMは、その推論能力を著しく向上させることができることが示されている。
テキストアライメントファインチューニング(AFT)パラダイムを3ステップで導入する。
論文 参考訳(メタデータ) (2023-09-05T11:32:48Z) - Optimizing Partial Area Under the Top-k Curve: Theory and Practice [151.5072746015253]
トップk曲線下部分領域(AUTKC)と呼ばれる新しい計量法を開発した。
AUTKCはより優れた識別能力を持ち、ベイズ最適スコア関数は条件付き確率に対して正しいトップKランクを与えることができる。
提案手法を最適化するために,実証的なサロゲートリスク最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2022-09-03T11:09:13Z) - Parameter-Free Deterministic Reduction of the Estimation Bias in
Continuous Control [0.0]
パラメータフリーで新しいQ-ラーニングバリアントを導入し、この過小評価バイアスを連続制御に還元する。
我々は、MuJoCoとBox2Dの連続制御タスクのセットで改善性能をテストする。
論文 参考訳(メタデータ) (2021-09-24T07:41:07Z) - Offline Contextual Bandits with Overparameterized Models [52.788628474552276]
オフラインの文脈的盗賊にも同じ現象が起こるかどうかを問う。
この相違は, 目的の強調安定性によるものであることを示す。
大規模なニューラルネットワークを用いた実験では、アクション安定な値ベース目標と不安定なポリシベース目標とのギャップは、大きなパフォーマンス差をもたらす。
論文 参考訳(メタデータ) (2020-06-27T13:52:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。