論文の概要: STAIF: A Stage-wise Optimization for Complex Instruction Following
- arxiv url: http://arxiv.org/abs/2607.22649v1
- Date: Fri, 26 Jun 2026 06:14:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.006662
- Title: STAIF: A Stage-wise Optimization for Complex Instruction Following
- Title(参考訳): STAIF: 複雑な指導の段階的最適化
- Authors: Jian Hong, Chen Cheng, Quan Liu, Yuhao Chen, Enhong Chen,
- Abstract要約: STAIFは、客観的に検証可能な(ハード)制約の最適化から主観的(ソフト)制約のアライメントを分離する段階的な最適化フレームワークである。
この方法を支援するために,約31,000の複雑なマルチ制約命令からなる高品質なバイリンガル(英語,中国語)データセットであるSTAINSTRUCTを構築した。
- 参考スコア(独自算出の注目度): 50.48101504556211
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Following complex instructions with multiple explicit constraints remains a fundamental challenge for large language models (LLMs). Existing alignment methods, such as DPO, optimize holistic reward signals that often underemphasize strict satisfaction of individual constraints, particularly under out-of-distribution or multi-constraint settings. In this paper, we propose STAIF, a stage-wise optimization framework that decouples the alignment of subjective (soft) constraints from the optimization of objectively verifiable (hard) constraints. Stage 1 applies preference optimization with multiple negative samples to sharpen sensitivity to soft constraints, while Stage 2 applies Reinforcement Learning with Verifiable Rewards (RLVR) to enforce strict compliance with hard constraints. To support this method, we construct STAINSTRUCT, a high-quality bilingual (English, Chinese) dataset of approximately 31,000 complex multi-constraint instructions. Extensive analyses validate the design of STAIF and show state-of-the-art performance on representative benchmarks against strong baselines, as well as genuine generalization.
- Abstract(参考訳): 複数の明示的な制約を持つ複雑な命令に従うことは、大きな言語モデル(LLM)の根本的な課題である。
DPOのような既存のアライメント手法は、特にアウト・オブ・ディストリビューションやマルチ制約設定の下で、個々の制約の厳密な満足度を過小評価する総体的な報酬信号を最適化する。
本稿では、客観的に検証可能な(ハード)制約の最適化から主観的(ソフト)制約のアライメントを分離する段階最適化フレームワークであるSTAIFを提案する。
ステージ1では、複数の負のサンプルで好みの最適化を適用し、ソフトな制約に対する感受性を高め、ステージ2ではRLVR(Reinforcement Learning with Verifiable Rewards)を適用して、厳しい制約を厳格に遵守する。
この方法を支援するために,約31,000の複雑な複数制約命令からなる高品質なバイリンガル(英語,中国語)データセットであるSTAINSTRUCTを構築した。
大規模解析によりSTAIFの設計が検証され、強力なベースラインに対する代表ベンチマークや真の一般化に対する最先端のパフォーマンスが示される。
関連論文リスト
- Feasibility Restoration under Conflicting STL Specifications with Pareto-Optimal Refinement [18.383508411056944]
Signal Temporal Logic (STL) は、ロボット工学における表現的要求を規定する表現的言語である。
STL仕様は、安全規則、交通規制、タスクと目的を一緒に満たせない現実世界のアプリケーションでは矛盾する可能性がある。
本稿では,最小限の緩和による実現可能性の回復を図り,それを価値認識多目的最適化問題として定式化し,実現可能な解を洗練する,統合された2段階フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-06T23:41:01Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation [60.33386541343322]
本稿では,Hardness-Aware とNoNoRec (HaNoRec) を併用したマルチモーダル大規模言語モデルフレームワークを提案する。
具体的には、HaNoRecは、各トレーニングサンプルの予測硬度とポリシーモデルのリアルタイム応答性の両方に基づいて、最適化重量を動的に調整する。
論文 参考訳(メタデータ) (2025-11-24T04:10:46Z) - RECAST: Expanding the Boundaries of LLMs' Complex Instruction Following with Multi-Constraint Data [47.19854998380304]
RECASTは、既存のベンチマークよりもはるかに多くの制約のあるデータセットを合成するための効率的なフレームワークである。
我々は、19の制約型にまたがる30kインスタンスからなる大規模で高品質なデータセットであるRECAST-30Kを構築した。
実験の結果、RECAST-30Kで微調整されたモデルでは、複雑な命令に従うと大幅に改善することが示された。
論文 参考訳(メタデータ) (2025-05-25T08:31:08Z) - RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning [60.84707424369494]
CoT(Chain-of-Thought)推論は、複雑なタスクにおける大規模言語モデル(LLM)の強化に有効であることが証明されている。
CoT 機能の計測可能なバウンダリの評価と最適化を行うフレームワークである Reasoning Boundary Framework++ (RBF++) を紹介する。
論文 参考訳(メタデータ) (2025-05-19T16:25:55Z) - MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training [36.483136685734735]
より強力なモデルに頼ることなく、複雑な命令アライメントを改善するために、MuSC(Multi-granularity Self-Contrastive Training)フレームワークを提案する。
提案手法は,オープンソースモデルを用いて評価し,提案手法が複雑かつ一般的な命令追従ベンチマークにおいて有意な改善をもたらすことを示す実験結果を得た。
論文 参考訳(メタデータ) (2025-02-17T08:12:49Z) - Multi-Attribute Constraint Satisfaction via Language Model Rewriting [67.5778646504987]
マルチ属性制約満足度(英: Multi-Attribute Constraint Satisfaction, MACS)は、言語モデルを微調整して、複数の外部実値属性に対するユーザ指定制約を満たす手法である。
我々の研究は、NLPやバイオインフォマティクスにまたがる多様な応用に影響を及ぼす、一般化および実値多属性制御のための新しい道を開く。
論文 参考訳(メタデータ) (2024-12-26T12:36:39Z) - A Systematic Examination of Preference Learning through the Lens of Instruction-Following [83.71180850955679]
新たな合成データ生成パイプラインを用いて48,000の命令追従プロンプトを生成する。
合成プロンプトでは、リジェクションサンプリング(RS)とモンテカルロ木探索(MCTS)の2つの選好データセットキュレーション手法を用いる。
実験により、MCTSが生成した選好ペアにおける共有プレフィックスは、限界はあるが一貫した改善をもたらすことが明らかになった。
高コントラストの選好ペアは一般的に低コントラストのペアよりも優れているが、両者を組み合わせることで最高のパフォーマンスが得られることが多い。
論文 参考訳(メタデータ) (2024-12-18T15:38:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。