TTPO: Test-Time Policy Optimization
Abstractの概要
本論文では、数学的推論モデルのためのラベル不要なテスト時訓練手法であるTest-Time Policy Optimization(TTPO)を提案する。この手法は、難関な競技問題における多数決擬似ラベリングで見られる非対称性、すなわち擬似ラベル自体は誤っていることが多いものの、擬似ラベルと一致しないロールアウトも通常は依然として誤っているという観察に基づいている。そのためTTPOは、擬似ラベルと一致するロールアウトにはオンポリシー自己蒸留を適用し、一致しないロールアウトにはGroup Relative Policy Optimizationによるペナルティを適用し、両方の分岐でトークンレベルの重み付けとマスキングを行う。5つの競技レベルの数学ベンチマークにおけるQwen3-1.7B、4B、8Bを用いた実験により、ラベルを使用しないベンチマークデータでの訓練と、ラベルのないテストセットに対する純粋なテスト時訓練の両方を評価している。
新規性
本研究の際立った貢献は、すべてのロールアウトに対して単一の蒸留や強化学習信号を用いるのではなく、擬似ラベルへの一致と不一致を異なって扱うラベル不要なテスト時訓練用の非対称な目的関数である。また、擬似ラベルのノイズや付随するトークンレベルのエラーの影響を低減するため、両方の分岐でトークンレベルの選択を導入し、正の蒸留には重み付けを、負の強化学習ペナルティにはマスキングを採用している。
成果
5つの競技レベルのベンチマークにおいて、TTPOは多数決擬似ラベルのみを使用しているにもかかわらず、ラベル教師ありのOPSDと同等以上の性能を達成した。純粋なテスト時訓練の設定では、Qwen3-1.7Bの平均精度を38.0%から45.2%に向上させ、報告されたモデル規模全体でTTRLおよびOPSD-TTTの両方を上回った。さらに、思考なし評価やクロスベンチマーク転移での改善も報告されており、この手法が単一のターゲットタスクを超えて推論挙動を改善することを示唆している。
論文の注目点
- TTPOは、難問において多数決擬似ラベルが頻繁に誤る一方で、一致しないロールアウトも通常は誤っているため、単純な完全蒸留よりも負のペナルティの方が信頼性が高いという経験的観察に基づいている。
- 本手法は、擬似ラベルと一致するロールアウトに対するOPSDと、不一致なロールアウトに対するGRPOペナルティを組み合わせ、さらにトークンレベルの重み付けとマスキングを用いて両者を洗練させている。
- 実証面において、TTPOは従来のベースラインよりも強力なラベル不要のテスト時訓練性能を達成し、報告されたベンチマークにおいてラベル教師ありOPSDと同等以上の競争力を維持している。
参考リンク
- arXiv: https://arxiv.org/abs/2608.27448v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.27448v1
- Hugging Face Papers: https://huggingface.co/papers/2608.27448