論文の概要: Optimal Sequential Annotations for Off-Policy Evaluation
- arxiv url: http://arxiv.org/abs/2609.26707v1
- Date: Tue, 22 Sep 2026 17:00:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.761951
- Title: Optimal Sequential Annotations for Off-Policy Evaluation
- Title(参考訳): オフポリティ評価のための最適シーケンスアノテーション
- Abstract要約: そこで本研究では,OPEを2倍に損なうことで,データアノテーションのための限られた予算を利用できることを示す。
逐次フォワードモノトーンアノテーションプロトコルの最適アノテーション確率を特徴付ける。
私たちの仕事は、個人のためのケースノートを書くホームレスサービスNPOとのコラボレーションによって動機付けられています。
- 参考スコア(独自算出の注目度): 6.229769300329017
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Offline reinforcement learning and off-policy evaluation evaluates dynamic treatment rules based on retrospectively collected data prior to deployment. In recent AI applications, state and reward information is recorded as complex text or image, which recent AI advancements such as LLM-as-a-judge can label with unknown bias. Expert annotation may be available but at a higher cost. For example, safety classification via cheap but imperfect classifiers vs. expensive expert review. We show how a limited budget for ground-truth data-annotation can be used via doubly-robust OPE with missing rewards, and we optimize variance-optimal annotation probabilities for sequential off-policy evaluation, where the target policy value is estimated from annotated data. We characterize the optimal annotation probabilities for sequential forward-monotone annotation protocols, and provide a feasible batch-adaptive implementation. Our work is motivated by a collaboration with a homelessness services nonprofit that writes casenotes for individuals over time. Our method can be used to unlock trustworthy inference from casenote data and answer new inferential questions such as: how does expanding outreach effort over time affect progress towards a housing application and improvement in housing placement? In simulations and on two real datasets - casenotes from the nonprofit and human-preference votes from LMArena - we see reductions in RMSE of 34-65% for housing placement and 17-68% for progress towards a housing application at budgets of 40% of full annotation and above, and by 55-62% at every budget on LMArena.
- Abstract(参考訳): オフライン強化学習とオフライン評価は、デプロイ前に遡及的に収集されたデータに基づいて動的処理ルールを評価する。
最近のAIアプリケーションでは、状態と報酬情報は複雑なテキストまたはイメージとして記録され、LLM-as-a-judgeのような最近のAI進歩は、未知のバイアスでラベル付けできる。
専門家のアノテーションは利用できるが、高いコストで利用できる。
例えば、安いが不完全な分類器による安全分類と高価な専門家レビューである。
提案手法では,2倍の確率を持つ OPE を用いて,データアノテーションの予算が制限されることを示し,アノテートされたデータから目標ポリシ値を推定する逐次的オフポリティクス評価のための分散最適アノテーション確率を最適化する。
逐次フォワードモノトーンアノテーションプロトコルの最適アノテーション確率を特徴付け,バッチ適応実装を実現する。
私たちの仕事は、個人のためのケースノートを書くホームレスサービスNPOとのコラボレーションによって動機付けられています。
我々の手法は、ケースノートデータから信頼できる推測を解き放ち、新たな推論問題に答えることができる。例えば、時間とともにアウトリーチを拡大することは、住宅利用の進展や住宅配置の改善にどのように影響するか?
シミュレーションと実際の2つのデータセット - LMArenaの非営利投票と人選投票のケースノート - では、住宅配置の34-65%、全アノテーションの40%、LMArenaの全予算の55-62%で住宅申請の進捗が17-68%と減少している。
関連論文リスト
- Auditing LLMs for Algorithmic Fairness in Casenote-Augmented Tabular Prediction [6.805575417034369]
LLMは、高度なソーシャルサービス設定における予測タスクとして、ますます検討されている。
実住宅配置予測タスクにおいて, LLMに基づく表型分類のアルゴリズム的公正性を評価する。
ケースノートの要約を付加した微調整モデルでは,アルゴリズムの公平さの相違を低減し,精度の向上が期待できる。
論文 参考訳(メタデータ) (2026-04-21T08:09:32Z) - Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning [50.93804891554481]
従来の逆確率スコア推定よりも優れた対数推定演算子(log-sum-exponential (LSE)演算子)に基づく新しい推定器を提案する。
我々のLSE推定器は, 重み付き条件下での分散低減とロバスト性を示す。
政治以外の学習シナリオでは、LSE推定器と最適ポリシーの間のパフォーマンスギャップである後悔の限界を確立します。
論文 参考訳(メタデータ) (2025-06-07T17:37:10Z) - Batch-Adaptive Annotations for Causal Inference with Complex-Embedded Outcomes [8.821030737167343]
結果に対する介入の因果効果を推定することは、政策と意思決定に不可欠である。
例えば、データアノテーションやフォローアップを通じて、地道的な結果情報をコストで明らかにすることができる。
本稿では,専門家のラベルとノイズが混ざり合ったラベルを2重に頑健な因果推定器に効果的に組み合わせる方法について述べる。
論文 参考訳(メタデータ) (2025-02-14T23:25:35Z) - Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning [90.23629291067763]
大規模言語モデルにおける推論を改善するための有望なアプローチは、プロセス報酬モデル(PRM)を使用することである。
PRMは多段階の推論トレースの各ステップでフィードバックを提供し、結果報酬モデル(ORM)よりも信用割当を改善する可能性がある。
PRMに対して探索を行ったり、強化学習(RL)の報酬として使ったりすることで、基本方針を改善するために、「プロセス報酬をどう設計すべきか?」と質問する。
理論的には,良質なプロデューサの集合を特徴付けるとともに,このようなプロデューサからのプロセス報酬の最適化が,テスト時間探索やオンラインRLの探索を改善することを示す。
論文 参考訳(メタデータ) (2024-10-10T17:31:23Z) - Reward-Augmented Data Enhances Direct Preference Alignment of LLMs [63.32585910975191]
報奨条件付き大言語モデル(LLM)を導入し、データセット内の応答品質のスペクトル全体から学習する。
当社のアプローチは,DPOをかなりのマージンで継続的に向上させることを示す。
本手法は,嗜好データの有用性を最大化するだけでなく,未学習の問題も軽減し,データ拡張を超えてその広範な効果を実証する。
論文 参考訳(メタデータ) (2024-10-10T16:01:51Z) - Noise Contrastive Alignment of Language Models with Explicit Rewards [32.90586853892559]
我々は、NCEを利用して、スカラー評価で明示的に注釈付けされた報酬データセットを扱う際のギャップを埋める、LMアライメントのための一般的なフレームワークを提案する。
我々のフレームワークは2つの並列アルゴリズム、NAAとInfoNCAで構成されており、どちらも報酬データと嗜好データからLMポリシーを直接抽出することができる。
NCA と InfoNCA を比較することで,DPO/InfoNCA の減少傾向は,反応の相違による相対可能性の調整に焦点が当てられていることが示される。
論文 参考訳(メタデータ) (2024-02-08T02:58:47Z) - Annotating Data for Fine-Tuning a Neural Ranker? Current Active Learning
Strategies are not Better than Random Selection [27.308095874473082]
限られたトレーニングデータと予算の下で, PLM をベースとした微調整ローダについて検討する。
その結果,アクティブ・ラーニング・ストラテジーはトレーニング・サブセットのランダムな選択よりも有効性に優れていないことがわかった。
論文 参考訳(メタデータ) (2023-09-12T11:17:42Z) - Delving into Probabilistic Uncertainty for Unsupervised Domain Adaptive
Person Re-Identification [54.174146346387204]
ドメイン適応型人物再識別のための確率的不確実性誘導プログレッシブラベル精錬(P$2$LR)という手法を提案する。
擬似ラベルの不確実性を測定し、ネットワークトレーニングを容易にする定量的基準を確立する。
本手法はDuke2Marketタスクではベースラインが6.5%,Market2MSMTタスクでは2.5%,最先端手法では2.5%を上回った。
論文 参考訳(メタデータ) (2021-12-28T07:40:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。