論文の概要: BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries
- arxiv url: http://arxiv.org/abs/2608.08768v1
- Date: Sun, 09 Aug 2026 15:32:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.943057
- Title: BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries
- Title(参考訳): BOUND: 検索-制御境界における短いガイド付き補正選好蒸留
- Abstract要約: BOUNDは、永続的な探索ドリフトのための短いガイド付き修正選好蒸留フレームワークである。
Trajectory SFT は Bamboogle で 5.6 EM 、BrowseComp-Plus で 4.8 の精度で上回っている。
- 参考スコア(独自算出の注目度): 82.41764922522565
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM)-based deep search agents solve tasks through iterative retrieval and reasoning, but locally relevant evidence can cause persistent wrong-anchor drift, constraint drift, or local-topic drift. Existing methods supervise trajectories, outcomes, or steps, but rarely distinguish task-aligned continuations from locally plausible ones that reinforce drift. We propose BOUND, a brief-guided corrective preference distillation framework for persistent search drift. For each student-induced decision-time state, BOUND constructs a teacher-side search-state brief that preserves the original search target and key constraints while summarizing confirmed evidence, missing information, and drift status. Guided by the brief, the teacher determines whether the student's continuation contains a correctable local search-control error likely to affect subsequent decisions. Together with the rollout outcome, this assessment determines whether to construct a corrective contrast between a student-specific correction and the original continuation, or a termination contrast between a supported answer and an unnecessary retrieval continuation. Each validated state-matched preference pair operationalizes a search-control boundary. Direct preference optimization (DPO) distills these preferences into the student, while the brief and teacher-side computation remain confined to training. We evaluate BOUND on four multi-hop QA benchmarks and three deep-search benchmarks. Across the six benchmarks for which we reran baselines, BOUND leads on five datasets and 12 of 14 metrics. Under the same search-control interface and matched settings, BOUND outperforms Trajectory SFT by 5.6 EM points on Bamboogle and 4.8 accuracy points on BrowseComp-Plus. Code is available at https://github.com/RUCAIBox/BOUND.
- Abstract(参考訳): 大規模言語モデル(LLM)に基づくディープサーチエージェントは反復的検索と推論によってタスクを解くが、局所的に関連する証拠は、永続的なアンカードリフト、制約ドリフト、あるいは局所トピードリフトを引き起こす可能性がある。
既存の方法は軌道、結果、ステップを監督するが、ドリフトを補強する局所的にもっともらしいものとタスクに沿った継続を区別することは滅多にない。
提案するBOUNDは,持続的な探索ドリフトのための短時間ガイド付き修正選好蒸留フレームワークである。
各学生による意思決定状況について、BOUNDは、確認された証拠、欠落情報、ドリフトステータスを要約しながら、元の検索対象とキー制約を保存する教師側の検索状態ブリーフを構築する。
簡単な説明により、教師は、生徒の継続が、その後の決定に影響を及ぼす可能性のある、修正可能なローカル検索制御エラーを含むか否かを判断する。
ロールアウト結果と合わせて、学生固有の補正と元の継続との補正コントラストを構築するか、支援された回答と不要な検索コントラストの終了コントラストを構築するかを決定する。
検証された状態マッチングされた好みペアは、検索制御境界を運用する。
直接選好最適化(DPO)は、これらの選好を学生に蒸留するが、短命と教師側の計算は訓練に限られる。
BOUNDを4つのマルチホップQAベンチマークと3つのディープ検索ベンチマークで評価する。
ベースラインを更新する6つのベンチマークの中で、BOUNDは5つのデータセットと14のメトリクスの12をリードしています。
同じサーチコントロールインタフェースとマッチした設定の下で、BOUNDはTrajectory SFTをBamboogleで5.6 EMポイント、BrowseComp-Plusで4.8精度ポイントで上回っている。
コードはhttps://github.com/RUCAIBox/BOUND.comで入手できる。
関連論文リスト
- Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning [19.29382518431932]
GC-OPD (Group-Calibrated On-Policy Distillation) は、強力な教師から高濃度のトークンレベルガイダンスを用いて生徒に独自の反応を訓練する。
GC-OPD(Group-Calibrated On-Policy Distillation)は、各ロールアウトグループ内の検証報酬と軌道レベルのPDスコアを正規化する。
相対アドバンテージベースの信用割当(RACA)は、相対的なOPDの利点に応じてトークン間でこの軌道レベルの残差を分配する。
論文 参考訳(メタデータ) (2026-08-19T17:54:58Z) - BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning [12.482949673236563]
BLADEは、生成したプレフィックスが正しい答えに十分かどうかを推定することで推論を終了する。
BLADEは文、自己疑念、段落の境界から多粒性のチェックポイントを構築する。
BLADEは、Qwen3-8Bでは24.8%、Qwen3-4Bでは15.8%の精度で、ほぼベースラインの精度を保っている。
論文 参考訳(メタデータ) (2026-07-31T02:36:55Z) - Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment [2.8730465903425877]
マルチモーダル文書QAにグループ相対ポリシー最適化を適用するトレーニングフレームワークであるPerception-RFTを紹介する。
推論可能なモデルは,4Bパラメータ尺度で直接知覚に基づくポリシーに収束して,学習中の推論トレースを抑制する。
初期のSFT$rightarrow$RLトランジションは65%のトレーニングデータで同等の精度を実現する。
論文 参考訳(メタデータ) (2026-07-16T07:43:39Z) - A Formula-Driven Survey and Research Agenda for On-Policy Distillation [4.397842507533513]
本調査では,OPDを単一損失ファミリーではなく,フィードバックから更新までの問題として検討した。
我々は, 直接分布損失と政策段階の対数比更新という2つの経路から公式駆動型分類法を開発した。
論文 参考訳(メタデータ) (2026-06-22T03:09:21Z) - FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - Beyond Hungarian: Match-Free Supervision for End-to-End Object Detection [6.786987355161583]
提案手法は,DETRを用いた新しい整合性学習手法である。
我々は、符号化された地下構造情報を用いて、クロスアテンション機構を通じてデコーダクエリを探索する。
実験により,提案手法は従来のマッチング処理をバイパスすることを示した。
論文 参考訳(メタデータ) (2026-03-09T15:44:23Z) - To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention [61.82680155643223]
我々は,不整合決定境界の根本原因を同定し,蓄積した情報が回答するのに十分であるかどうかをしきい値に判定する。
これにより、過剰探索(十分な知識にもかかわらず冗長探索)と過度探索(早期終了)が誤った答えをもたらす。
まず,境界誤差を識別する因果的介入に基づく診断手法を提案する。
第2に,Deep Search Agent(DAS)のための決定境界アライメントを開発する。
我々のDAS法はこれらの境界を効果的に校正し、オーバーサーチとアンダーサーチの両方を緩和し、精度と効率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-02-03T09:29:06Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Semi-DETR: Semi-Supervised Object Detection with Detection Transformers [105.45018934087076]
半教師付き物体検出(SSOD)におけるDETRに基づくフレームワークの解析
本報告では,第1次変圧器を用いたエンド・ツー・エンド半教師対象検出器であるSemi-DETRについて述べる。
我々の手法は、最先端の手法をクリアマージンで上回る。
論文 参考訳(メタデータ) (2023-07-16T16:32:14Z) - ReAct: Temporal Action Detection with Relational Queries [84.76646044604055]
本研究は,アクションクエリを備えたエンコーダ・デコーダフレームワークを用いて,時間的行動検出(TAD)の進展を図ることを目的とする。
まず,デコーダ内の関係注意機構を提案し,その関係に基づいてクエリ間の関心を誘導する。
最後に、高品質なクエリを区別するために、推論時に各アクションクエリのローカライズ品質を予測することを提案する。
論文 参考訳(メタデータ) (2022-07-14T17:46:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。