論文の概要: RubricArmor: Adversarial Evolution Improves LLM-Based Rubric Generation
- arxiv url: http://arxiv.org/abs/2610.05308v1
- Date: Sun, 04 Oct 2026 15:30:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 21:45:31.421308
- Title: RubricArmor: Adversarial Evolution Improves LLM-Based Rubric Generation
- Title(参考訳): RubricArmor: LLMベースのRubric生成を改善する逆展開
- Abstract要約: 本稿では,その発生前に発生段階における潜在的報酬ハッキングを緩和する対戦型フレームワークを提案する。
武器ベースの強化学習は、大きな言語モデルを調整するための解釈可能な報酬を提供する。
- 参考スコア(独自算出の注目度): 14.880961044561005
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Rubric-based reinforcement learning (RL) provides interpretable rewards for aligning large language models (LLMs) by evaluating responses against query-specific evaluation criteria. To construct rubrics at scale, a straightforward approach to LLM-based rubric generation is to prompt an LLM to generate a rubric directly from the query. However, rubrics directly generated by LLMs are vulnerable to reward hacking, since omitted or underspecified criteria allow the policy to obtain high rubric rewards with low-quality responses. Existing LLM-based rubric generation methods improve the granularity and coverage of the generated criteria but do not proactively guard against reward hacking. To address this limitation, we propose RubricArmor, an adversarial framework that exposes and mitigates potential reward hacking at the rubric generation stage before it occurs in subsequent RL. Specifically, RubricArmor performs adversarial evolution, in which an attack step and a repair step alternate over multiple rounds. The attack step simulates the reward hacking of the policy by constructing adversarial responses that satisfy the current rubric but fail to properly complete the task. The repair step then revises the rubric to detect the response defects exposed by the attack step while preserving other valid criteria. Extensive experiments demonstrate that RubricArmor outperforms competitive rubric generation baselines and translates into more effective downstream rubric-based RL.
- Abstract(参考訳): Rubric-based reinforcement learning (RL) は、クエリ固有の評価基準に対する応答を評価することにより、大きな言語モデル(LLM)を調整するための解釈可能な報酬を提供する。
大規模なルーリックを構築するために、LLMベースのルーリック生成への直接的なアプローチは、クエリから直接ルーリックを生成するように、LCMに促すことである。
しかし、LLMが直接生成するルーリックは、省略または不特定基準により、低品質の応答で高いルーリック報酬を得ることができるため、ハッキングに対して脆弱である。
既存のLCMベースのルーブリック生成手法は、生成された基準の粒度とカバレッジを改善するが、報酬ハッキングを積極的に防ぐことはできない。
この制限に対処するため、後続のRLで発生する前に、ルブリック生成段階で潜在的報酬のハッキングを暴露し軽減する、敵対的フレームワークであるRubricArmorを提案する。
特に、RubricArmorは、攻撃ステップと修理ステップが複数のラウンドで交互に交互に行われる敵の進化を行う。
攻撃ステップは、現在のルーリックを満たすが、タスクを適切に完了させることができない敵応答を構築することにより、ポリシーの報酬ハッキングをシミュレートする。
そして、修復工程が更新され、他の有効な基準を保ちながら、攻撃工程によって露呈された応答欠陥を検出する。
広範囲にわたる実験により、RubricArmorは競争力のあるルーリック生成ベースラインより優れ、より効果的な下流ルーリックベースRLに変換されることが示された。
関連論文リスト
- MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning [25.293359481992013]
そこで,MetaRubricを導入し,エビデンスを意識したポリシー最適化と応答誘導適応を交互に行う。
複数のバックボーン全体で、MetaRubricは、静的ジャッジGRPOよりもPubMedQAの精度を6.00-20.40ポイント向上させる。
論文 参考訳(メタデータ) (2026-10-02T05:16:42Z) - LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL [64.4276583943816]
検証不能な指導のための強化学習は、報酬信号としてプロンプト固有のルーリックを持つ裁判官に依存している。
最近の手法は、トレーニング中にこれらのルーリックを進化するポリシーに適応させるが、トレーニングのプロンプト自体は静的のままである。
この静的なアプローチは、しばしば急激な困難と政策能力の間に重大なミスアライメントをもたらし、裁判官は差別的な報酬信号を取り戻すことができない。
論文 参考訳(メタデータ) (2026-07-05T17:05:13Z) - RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks [75.52891348667491]
オープンエンド生成タスクは、多様でしばしば暗黙的なタスク固有の評価ルーブリックを満たすために出力を必要とする。
関連するルーリックの数が多ければ多いほど、極めて高い検証コストと応答の不完全な評価につながる。
RLAC(Reinforcement Learning with Adrial Critic, Reinforcement Learning with Adrial Critic)を提案する。
論文 参考訳(メタデータ) (2025-11-03T17:15:05Z) - Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning [14.419943772894754]
Retrieval-Augmented Generation (RAG)は,大規模言語モデル(LLM)の信頼性向上のための標準アプローチとなっている。
本稿では,現代のLSMの強力なテクスト自己補正能力(SCA)によって,このような攻撃を軽減できることを明らかにする。
我々は,新しい中毒パラダイムであるtextscDisarmRAG を導入し,レトリバー自体を妥協してSCAを抑止し,アタッカー・チョーゼン出力を強制する。
論文 参考訳(メタデータ) (2025-08-27T17:49:28Z) - The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systems [101.68501850486179]
本稿では,RAGシステムに対する敵攻撃について検討し,その脆弱性を同定する。
このタスクは、ターゲット文書を検索する非知覚的な摂動を見つけることを目的としており、もともとはトップ$k$の候補セットから除外されていた。
本稿では、攻撃者とターゲットRAG間の相互作用を追跡する強化学習ベースのフレームワークであるReGENTを提案する。
論文 参考訳(メタデータ) (2025-05-24T08:19:25Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Look Before You Leap: Enhancing Attention and Vigilance Regarding Harmful Content with GuidelineLLM [53.79753074854936]
大規模言語モデル(LLM)は、出現するジェイルブレイク攻撃に対してますます脆弱である。
この脆弱性は現実世界のアプリケーションに重大なリスクをもたらす。
本稿では,ガイドラインLLMという新しい防御パラダイムを提案する。
論文 参考訳(メタデータ) (2024-12-10T12:42:33Z) - Towards Universal and Black-Box Query-Response Only Attack on LLMs with QROA [2.4578723416255754]
悪意ある命令に付加された相手の接尾辞を識別するブラックボックスジェイルブレイク手法であるQROAを紹介する。
既存のサフィックスベースのjailbreakアプローチとは異なり、QROAはモデルのロジットや他の内部情報へのアクセスを必要としない。
また,QROA-UNVは,個々のモデルに対する普遍的対角接尾辞を識別する拡張である。
論文 参考訳(メタデータ) (2024-06-04T07:27:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。