論文の概要: Towards a theory of inference-time alignment with unknown rewards
- arxiv url: http://arxiv.org/abs/2608.15402v2
- Date: Sat, 22 Aug 2026 01:39:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.868407
- Title: Towards a theory of inference-time alignment with unknown rewards
- Title(参考訳): 未知の報酬を伴う推論時間アライメントの理論に向けて
- Abstract要約: 推論時間アライメントを弱い学習問題として定式化する。
報酬クラスがそのアライメント次元が有限である場合に限り、アライメントが学習可能であることを示す。
我々の結果は、アライメントに向けた完全な理論的理解を確立することに光を当てるかもしれない。
- 参考スコア(独自算出の注目度): 31.74405851825694
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative model alignment has received broad interest, and significant progress has been made in supervised fine-tuning and inference-time computation. Yet, alignment has remained poorly understood from a statistical learning perspective. We formulate inference-time alignment as a weak-to-strong learning problem, where a reference policy (weak learner) is assumed to be fairly good and the goal is to produce a strong learner that predicts a good response at test time with arbitrarily high probability. Our problem is formulated as learning from scratch --- everything is learned from data rather than assuming access to a good reward estimate, and thus differs from the existing inference-time alignment theory. Our model shares similarity to the recent work of arXiv:2510.15464, where for each prompt, there could be multiple good responses. Our definition of the alignment learnability follows the PAC learning principle. We introduce a novel combinatorial dimension of the reward class which we call the alignment dimension, and show that it completely characterizes the alignment learnability --- a reward class is alignment learnable if and only if its alignment dimension is finite. The core of our learning procedure works by invoking the ordinary one-inclusion graph algorithm to run a tournament over all pairs of label sets satisfying that neither is a subset of the other. We believe our results might shed light on establishing a complete theoretical understanding towards alignment.
- Abstract(参考訳): 生成的モデルアライメントは広く関心を集めており、微調整や推論時間計算の監督において大きな進歩を遂げている。
しかし、アライメントは統計的学習の観点からはあまり理解されていない。
推論時間アライメントを弱強学習問題として定式化し、参照ポリシー(弱学習者)はかなり良いと仮定し、その目標は、任意に高い確率でテスト時に良い応答を予測する強力な学習者を作ることである。
私たちの問題は、スクラッチからの学習として定式化されます -- すべてが良い報酬推定へのアクセスを前提とせず、データから学習されるので、既存の推論時間アライメント理論と異なります。
我々のモデルは最近のarXiv:2510.15464と似ている。
我々のアライメント学習性の定義はPAC学習の原則に従っている。
我々は、アライメント次元と呼ぶ報酬クラスの新しい組合せ次元を導入し、アライメント学習性を完全に特徴付けることを示す。
学習手順の中核は、通常の1つの包摂グラフアルゴリズムを呼び出し、どちらも他方のサブセットではないことを満たさないラベルセットのすべてのペア上でトーナメントを実行することで機能する。
私たちの結果は、アライメントに向けた完全な理論的理解を確立することに光を当てるかもしれないと信じています。
関連論文リスト
- Online Set Learning from Precision and Recall Feedback [60.00180898830079]
オンライン設定でドメインの未知のサブセットである$N_texttarget$を学習する問題を考察する。
この単純なオンラインセット学習問題は、精度とリコール型のフィードバックで様々な学習シナリオを抽象化する。
この設定で仮説クラスが学習可能であることを示し、それが有限のヴァプニク・チェルヴォネンキス次元を持つ場合に限る。
論文 参考訳(メタデータ) (2026-05-10T14:28:05Z) - Robust Online Learning [0.0]
本研究では,分類器が摂動入力を受けるような頑健な分類器を学習する問題について検討する。
仮説クラスの実現可能性と学習性について考察する。
実現可能な設定における誤り境界と、不可知的な設定における後悔境界を制御していることを示す。
論文 参考訳(メタデータ) (2026-02-06T15:30:52Z) - Partial Feedback Online Learning [88.27143767009376]
我々は、偏見フィードバックオンライン学習と呼ばれる新しい学習プロトコルについて研究する。
各インスタンスは許容できるラベルのセットを許可するが、学習者は1ラウンドごとに許容できるラベルを1つだけ観察する。
論文 参考訳(メタデータ) (2026-01-29T09:39:11Z) - Probably Approximately Precision and Recall Learning [60.00180898830079]
機械学習における重要な課題は、一方的なフィードバックの頻度である。
本稿では,確率的近似(PAC)フレームワークを導入し,各入力をラベルの集合にマッピングする仮説を定めている。
我々は、正のデータのみから学習する新しいアルゴリズムを開発し、実現可能な場合において最適なサンプル複雑性を実現する。
論文 参考訳(メタデータ) (2024-11-20T04:21:07Z) - Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment [105.34140537748546]
我々はFIGAという改良されたアライメント手法を提案し、従来の手法とは異なり、良質な応答と悪質な応答の対比から導出されるきめ細かい品質信号を取り込む。
まず、初期応答とそれに対応する修正データセットをペアリングする精巧なアライメントデータセットをキュレートする。
第2に,LLMの微粒な品質信号を利用してアライメントの学習を指導する新たな損失関数を考案する。
論文 参考訳(メタデータ) (2023-11-07T15:36:40Z) - Chaos is a Ladder: A New Theoretical Understanding of Contrastive
Learning via Augmentation Overlap [64.60460828425502]
コントラスト学習の下流性能に関する新たな保証を提案する。
我々の新しい理論は、攻撃的なデータ強化の下で、異なるクラス内サンプルのサポートがより重なり合うという知見に基づいている。
本稿では、下流の精度とよく一致した教師なしモデル選択距離ARCを提案する。
論文 参考訳(メタデータ) (2022-03-25T05:36:26Z) - Universal Online Learning: an Optimistically Universal Learning Rule [0.0]
本研究では,非i.d.プロセスを用いたユニバーサルオンライン学習の課題について検討する。
k-nearest neighbor algorithm (kNN) は楽観的に普遍的ではなく, 1NN の新たな変種を示す。
論文 参考訳(メタデータ) (2022-01-16T02:13:47Z) - Relieving Long-tailed Instance Segmentation via Pairwise Class Balance [85.53585498649252]
長い尾のインスタンスセグメンテーションは、クラス間のトレーニングサンプルの極端な不均衡のために難しいタスクである。
尾のついたものに対して、(大多数のサンプルを含む)ヘッドクラスの深刻なバイアスを引き起こす。
そこで本研究では,学習中の予測嗜好を蓄積するために,学習中に更新される混乱行列上に構築された新しいPairwise Class Balance(PCB)手法を提案する。
論文 参考訳(メタデータ) (2022-01-08T07:48:36Z) - A Theory of Universal Learning [26.51949485387526]
普遍的な学習の確率は3つしかないことを示す。
任意の概念クラスの学習曲線は指数的あるいは任意に遅い速度で減衰することを示す。
論文 参考訳(メタデータ) (2020-11-09T15:10:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。