論文の概要: Leveraging RAG for Training-Free Alignment of LLMs
- arxiv url: http://arxiv.org/abs/2605.11217v1
- Date: Mon, 11 May 2026 20:29:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.413067
- Title: Leveraging RAG for Training-Free Alignment of LLMs
- Title(参考訳): LLMのトレーニングフリーアライメントのためのRAGの活用
- Authors: John T. Halloran,
- Abstract要約: 現状のアライメントアルゴリズムは,近年のエージェント攻撃に対するガードレールの無効化をはるかに低減しつつ,計算資源の大幅な削減を必要としていることを示す。
本稿では,RAGに基づく単純なアライメントアルゴリズムであるRetrieval Augmented Generation for Pref erence alignment (RAG-Pref)を紹介する。
RAG-Prefはオンライン(トレーニング不要)で、市販パッケージと互換性があり、オフライン(トレーニングベース)アライメントアルゴリズムと組み合わせることで、エージェント攻撃の拒絶を平均3.7倍改善することができる。
- 参考スコア(独自算出の注目度): 0.5076419064097732
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) alignment algorithms typically consist of post-training over preference pairs. While such algorithms are widely used to enable safety guardrails and align LLMs with general human preferences, we show that state-of-the-art alignment algorithms require significant computational resources while being far less capable of enabling refusal guardrails for recent agentic attacks. Thus, to improve refusal guardrails against such attacks without drastically increasing computational overhead, we introduce Retrieval Augmented Generation for Pref erence alignment (RAG-Pref), a simple RAG-based alignment algorithm which conditions on preferred and dispreferred samples to leverage contrastive information during inference. RAG-Pref is online (training-free), compatible with off-the-shelf packages, and, when combined with offline (training-based) alignment algorithms, enables more than an average 3.7 factor improvement in agentic attack refusals across five widely used LLMs, compared to 2.9 for other online alignment algorithms and 1.5 for offline alignment alone. We conclude by showing that, in stark contrast to other online alignment methods, RAG-Pref similarly increases performance on general human-preference alignment tasks and does not drastically increase overall computational requirements.
- Abstract(参考訳): 大規模言語モデル (LLM) のアライメントアルゴリズムは、通常、好みのペアよりも後トレーニングによって構成される。
このようなアルゴリズムは、安全ガードレールを有効にし、LLMを一般の人間の嗜好に合わせるために広く用いられているが、現状のアライメントアルゴリズムは重要な計算資源を必要とする一方で、最近のエージェント攻撃に対する拒絶ガードレールを有効にする能力ははるかに低い。
そこで,計算オーバーヘッドを大幅に増加させることなく,そのような攻撃に対する防御レールの拒絶を改善するために,提案手法はRAG-Pref(Retrieval Augmented Generation for Pref erence alignment)を導入している。
RAG-Prefはオンライン(トレーニングなし)で、市販のパッケージと互換性があり、オフライン(トレーニングベース)アライメントアルゴリズムと組み合わせると、5つの広く使用されているLCMで平均3.7倍のエージェント攻撃拒否が可能であり、他のオンラインアライメントアルゴリズムでは2.9、オフラインアライメントでは1.5となっている。
我々は、他のオンラインアライメント手法とは対照的に、RAG-Prefも同様に、一般的な人為的なアライメントタスクの性能を高め、全体的な計算要求を劇的に増加させていないことを示す。
関連論文リスト
- Token-Efficient RL for LLM Reasoning [0.02488650627593658]
本稿では,大規模言語モデル (LLM) において,厳密なメモリと計算限界下での推論に適した強化学習戦略を提案する。
ベースラインサブトラクションを用いた早期ポリシー勾配法に基づいて,出力トークンの小さな情報サブセット上で動作する批判のない手法を設計する。
提案手法は,SVAMPベンチマークの精度を46%から70%以上に向上し,マルチ桁乗算において高い性能を示した。
論文 参考訳(メタデータ) (2025-04-29T14:58:43Z) - SAIL: Self-Improving Efficient Online Alignment of Large Language Models [56.59644677997827]
人間のフィードバックからの強化学習は、大きな言語モデルを人間の好みに合わせるための重要な方法である。
近年の文献では、オンラインRLHF法の設計に焦点が当てられているが、統一された概念的定式化はいまだに欠けている。
提案手法は,計算オーバーヘッドを最小限に抑えたオープンソースデータセットのアライメント性能を著しく向上させる。
論文 参考訳(メタデータ) (2024-06-21T18:05:35Z) - PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback [106.63518036538163]
我々は、強化学習におけるポリシーアライメントの最近強調された重要な問題に対処するために、新しい統合された二段階最適化ベースのフレームワーク、textsfPARLを提案する。
本フレームワークは, 上向きの目標(逆設計)の分布を, 下向きの最適変数で明示的にパラメータ化することにより, これらの問題に対処する。
その結果,提案したtextsfPARL が RL のアライメントの懸念に対処できる可能性が示唆された。
論文 参考訳(メタデータ) (2023-08-03T18:03:44Z) - Iteratively Refined Behavior Regularization for Offline Reinforcement
Learning [57.10922880400715]
本稿では,保守的政策反復に基づく行動規則化を大幅に強化する新しいアルゴリズムを提案する。
行動規則化に使用される基準ポリシーを反復的に洗練することにより、保守的な政策更新は徐々に改善される。
D4RLベンチマークの実験結果から,本手法は従来のタスクのベースラインよりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2023-06-09T07:46:24Z) - Offline Policy Optimization in RL with Variance Regularizaton [142.87345258222942]
定常分布補正を用いたオフラインRLアルゴリズムの分散正則化を提案する。
Fenchel双対性を用いることで、分散正規化器の勾配を計算するための二重サンプリング問題を回避することができることを示す。
オフライン分散正規化アルゴリズム(OVAR)は,既存のオフラインポリシー最適化アルゴリズムを拡張できる。
論文 参考訳(メタデータ) (2022-12-29T18:25:01Z) - OptiDICE: Offline Policy Optimization via Stationary Distribution
Correction Estimation [59.469401906712555]
より原理的な方法で過大評価を防止するオフライン強化学習アルゴリズムを提案する。
提案アルゴリズムであるOptiDICEは,最適ポリシーの定常分布補正を直接推定する。
OptiDICEは最先端の手法と競合して動作することを示す。
論文 参考訳(メタデータ) (2021-06-21T00:43:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。