論文の概要: TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
- arxiv url: http://arxiv.org/abs/2603.00025v1
- Date: Tue, 03 Feb 2026 23:48:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-09 01:20:07.96965
- Title: TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
- Title(参考訳): TAB-PO:Token-Level Adaptive Barrierを用いたToken-Critical Structured Generationの優先最適化
- Authors: Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Ashley Hagaman, Sarah R. Lowe, Aimee Kendall Roundtree,
- Abstract要約: 高価値セマンティックトークンを優先するトークン重み付き参照調整アドバンテージが提示される。
医療コミュニケーションアノテーションを用いたTAB-POの評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Direct Preference Optimization is an offline post-SFT method for aligning language models from preference pairs, with strong results in instruction following and summarization. However, DPO's sequence-level implicit reward can be brittle for token-critical structured prediction settings such as medical annotation, which often exhibit (i) low-separation preference pairs, where chosen and rejected completions differ by minimal edit distance (often 1-3 tokens), and (ii) token-importance skew, where sparse semantic tokens (hierarchical labels and evidence Spans) carry disproportionate task importance relative to high-frequency structural tokens (JSON scaffolding). In this regime, standard DPO suffers from margin collapse (insufficient log-probability separation between near-identical preferences), likelihood squeezing (the margin objective shifts the absolute likelihoods of both completions together), and gradient dilution, where uniform sequence-level weighting diffuses learning signal across shared scaffolding while rare, confusable label tokens receive weak, noisy updates. We introduce Token-Adaptive Barrier Preference Optimization (TAB-PO), which augments DPO with token-weighted, reference-adjusted advantages that prioritize high-value semantic tokens, and a conditional token-level barrier that regularizes under-confident tokens balancing SFT-anchored likelihood and preference-driven separation in low-separation, importance-skewed regimes. We evaluate TAB-PO on medical communication annotation, a task requiring joint prediction of hierarchical labels and evidence Spans from patient-provider messages. TAB-PO achieves a ~ 4% relative improvement in micro-F1 over SFT and consistently outperforms recent preference-optimization baselines.
- Abstract(参考訳): 直接選好最適化(Direct Preference Optimization)は、好みのペアから言語モデルを調整するためのオフラインのポストSFT方式であり、命令の追従と要約に強い結果をもたらす。
しかし、DPOのシーケンスレベルの暗黙報酬は、しばしば現れる医療アノテーションのようなトークンクリティカルな構造化予測設定に対して脆弱である。
一 選別選好ペアであって、選別選別選別選別選別が最小編集距離(しばしば1-3トークン)によって異なるもの
(II) スパース意味トークン(階層的ラベルと証拠)が高頻度構造トークン(JSON足場)と比較して不均等なタスク重要性を持つトークン重要スキュー。
この体制では、標準DPOはマージンの崩壊(ほぼ同一の好みの対数確率の分離が不十分)、可能性スクイーズ(マージンの目的が両方の完了の絶対的な可能性を変える)、勾配の希薄化に悩まされ、そこでは、一様列レベルの重み付けが共有足場全体にわたって学習信号を拡散させ、希少で不規則なラベルトークンは弱くノイズの多い更新を受ける。
本稿では,トークン重み付き参照適応型セマンティックトークンを優先するDPOと,SFT-アンコレッド確率と優先駆動分離のバランスをとる信頼度以下のトークンを規則化する条件付きトークンレベルバリアを,低分離・重要スキュードレシシで拡張したTOB-POについて紹介する。
我々は,医療コミュニケーションアノテーションを用いたTAB-POの評価を行い,患者側からのメッセージからヒエラルキーラベルとエビデンスSpansを共同で予測するタスクについて検討した。
TAB-POはSFTに対するマイクロF1の相対的な改善を約4%達成し、最近の嗜好最適化ベースラインを一貫して上回っている。
関連論文リスト
- Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning [71.30276778807068]
サンプルプルーニングとトークンプルーニングを戦略的に協調する統合フレームワークを提案する。
Q-Tuningは、トレーニングデータの12.5%しか使用せず、全データSFTベースラインに対する平均38%の改善を実現している。
論文 参考訳(メタデータ) (2025-09-28T13:27:38Z) - IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation [79.22388408461458]
我々は,トークン決定性をチューニングと復号の両方に統合する情報ゲインに基づく決定性対応トークンハンドリング(IGD)戦略を導入する。
IGDはリコメンデーションの精度を一貫して改善し、強力なベースラインに比べて広く使われているランキングの指標で顕著に向上した。
論文 参考訳(メタデータ) (2025-06-16T08:28:19Z) - Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization [17.801062522027266]
DPO(Direct Preference Optimization)は,大規模言語モデルと人間の嗜好を整合させる,有望なフレームワークとして登場した。
既存の方法は応答における全てのトークンに等しい重要性を割り当て、人間はより意味のある部分に焦点を当てる。
直接textbfPreference textbfOptimization (OTPO) を強化するための textbfOptimal textbfTransport を用いたトークン重み付け方式を提案する。
論文 参考訳(メタデータ) (2025-05-24T14:44:15Z) - In-context Ranking Preference Optimization [65.5489745857577]
In-context Ranking Preference Optimization (IRPO) フレームワークを提案する。
IRPOは標準のDPO手法よりも高い性能を示し、LLMと直接文脈内ランキング設定の整合性を強調した。
論文 参考訳(メタデータ) (2025-04-21T23:06:12Z) - ADePT: Adaptive Decomposed Prompt Tuning for Parameter-Efficient Fine-tuning [23.511954119467735]
Prompt Tuning (PT)は、事前訓練された大規模言語モデル(PLM)の下流タスクへの適応を可能にする。
Decomposed Prompt Tuning (DePT) は優れた適応能力を示した。
ADePTは短いソフトプロンプトと浅いトークン共有フィードフォワードニューラルネットワークで構成されている。
論文 参考訳(メタデータ) (2025-01-06T08:20:04Z) - Geometric-Averaged Preference Optimization for Soft Preference Labels [78.2746007085333]
LLMを人間の嗜好と整合させる多くのアルゴリズムは、人間の嗜好は二進的かつ決定論的であると仮定する。
本研究では,分散ソフトな選好ラベルを導入し,損失関数におけるLLM出力確率の重み付き幾何平均を用いて直接選好最適化(DPO)を改善する。
論文 参考訳(メタデータ) (2024-09-10T17:54:28Z) - Token-level Direct Preference Optimization [8.249403373337024]
微調整された事前訓練された大規模言語モデルは、それらを人間の価値観や意図と整合させるのに不可欠である。
トークンレベルでポリシーを最適化することにより,LLMと人間の嗜好を一致させる新しいアプローチである,トークンレベルの直接選好最適化(TDPO)を導入する。
論文 参考訳(メタデータ) (2024-04-18T08:49:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。