論文の概要: Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis
- arxiv url: http://arxiv.org/abs/2607.25554v1
- Date: Tue, 28 Jul 2026 10:35:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.798169
- Title: Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis
- Title(参考訳): 蒸留時間探索と推論:高調波を用いた効率的なデータ合成による将来予測のためのLLMの進化
- Authors: Wanxu Cai, Zhengyu Chen, Huaisheng Zhu, Wei Wang, Jingang Wang, Qiang Xu,
- Abstract要約: 本稿では,各ターンで時間的カットオフを強制する時間トラクションハーネスを提案する。
我々のハーネスは自然に検索の時間的幅を拡大し、高品質なデータの割合を増大させることを示す。
実験により、ハーネス・インベンブド・データで訓練された学生が最高のパフォーマンスを達成することが示された。
- 参考スコア(独自算出の注目度): 27.759177826493637
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Future event prediction carries broad social impact yet remains challenging. SOTA approaches augment LLMs with external agent frameworks whose predictive capability vanishes once the harness is removed. While recent Tool-Integrated Reasoning (TIR) internalizes deep search for multi-hop retrieval of facts, forecasting further demands temporal search and reasoning over historical trends and dynamic shifts. The key obstacle is data: historical queries induce temporal leakage that degrades forecasting into retrieval. Prior works either freeze information gathering with static observations, or rely on rejection sampling or unresolved fresh queries that discard vast amounts of data, degrading synthesis efficiency. We propose a time-truncation harness that enforces a temporal cut-off at every turn, enabling TIR-style sampling from historical events, reducing temporal leakage and reliance of rejection sampling or unsolved queries, increasing the sampling efficiency. We further build a large-scale corpus and a process-based metric and show that our harness naturally induces a broader temporal breadth of search and raises the proportion of high-quality data, further increasing the efficiency and reducing the reliance on complex rubrics. Distillation experiments show that students trained on harness-intervened data achieve the best performance, demonstrating harness-assisted model evolving that turns higher quality temporal search and reasoning data into a parametric advancement of the students.
- Abstract(参考訳): 将来のイベント予測には幅広い社会的影響が伴うが、依然として困難である。
SOTAは、ハーネスが取り除かれた後、予測能力が消滅する外部エージェントフレームワークでLLMを増強する。
近年のTool-Integrated Reasoning (TIR)は、事実のマルチホップ検索を内在化しており、過去の傾向や動的シフトに対する時間的検索と推論のさらなる要求を予測している。
重要な障害はデータである: 履歴クエリは時間的リークを誘発し、予測を検索に分解する。
以前の作業では、静的な観測による情報収集を凍結するか、あるいは大量のデータを捨てる未解決の新鮮なクエリに依存するか、合成効率を低下させる。
本稿では,各ターンで時間的カットオフを強制し,歴史的イベントからのTIRスタイルサンプリングを可能にし,時間的リークを低減し,リジェクションサンプリングや未解決クエリの信頼性を高め,サンプリング効率を向上する時間的トラクションハーネスを提案する。
さらに、大規模コーパスとプロセスベースメトリクスを構築し、我々のハーネスが自然に検索の時間的幅を拡大し、高品質なデータの比率を高め、さらに効率を高め、複雑なルーリックへの依存を減らすことを示す。
蒸留実験により, ハーネス・インターベンション・データを用いて訓練した学生は, より高品質な時間探索と推論を学生のパラメトリックな進歩に変換するハーネス・アシスト・モデルの発展を実証し, 最高のパフォーマンスを得ることができた。
関連論文リスト
- Tool-Adaptive LLM Reranker [6.360159778061184]
TALRankerは、エージェントマルコフ決定プロセスとしてポイントワイズ関連スコアを定式化する新しいフレームワークである。
標準および推論集約型検索ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-12T04:04:59Z) - Data-dependent Exploration for Online Reinforcement Learning from Human Feedback [50.34161049551627]
人的フィードバックからのオンライン強化学習(RLHF)は、トレーニング中に新たな嗜好フィードバックを継続的に収集することにより、大規模言語モデル(LLM)を整合させるための有望なパラダイムとして登場した。
既存の調査戦略は、しばしば政治上の期待を通じてボーナスを導き出すが、これは訓練中に利用できる限られた歴史的嗜好データから確実に見積もることが難しい。
高不確実性領域に対する余分な不確実性ボーナスを構築するために、履歴データを活用するシンプルでスケーラブルなデータ依存型選好最適化法(DEPO)を提案する。
論文 参考訳(メタデータ) (2026-05-06T03:56:45Z) - Real-Time RAG for the Identification of Supply Chain Vulnerabilities [0.0]
本研究は, 新規な検索前処理と検索技術を統合することで, サプライチェーン解析への革新的アプローチを提案する。
本手法は,新たな情報を拡張LLMに組み込む際の遅延を低減することを目的として,サプライチェーンディスラプタのタイムリーな解析を可能にする。
論文 参考訳(メタデータ) (2025-08-23T22:06:19Z) - Valid Inference with Imperfect Synthetic Data [39.10587411316875]
モーメントの一般化法に基づく新しい推定器を提案する。
合成データのモーメント残差と実データのモーメント間の相互作用は、対象パラメータの推定を大幅に改善できることがわかった。
論文 参考訳(メタデータ) (2025-08-08T18:32:52Z) - Preference Learning with Response Time: Robust Losses and Guarantees [17.197459677427297]
応答時間情報をバイナリ選択データとともに組み込む新しい手法を提案する。
我々は、報酬モデル学習のためのオラクル収束率を達成するニーマン直交損失関数を開発する。
我々の実験は、画像よりも好み学習の文脈における理論的知見を検証した。
論文 参考訳(メタデータ) (2025-05-28T19:55:54Z) - DeepRAG: Thinking to Retrieve Step by Step for Large Language Models [92.87532210660456]
我々はマルコフ決定過程(MDP)として検索強化推論をモデル化するDeepRAGを提案する。
クエリを反復的に分解することで、DeepRAGは外部知識を取得するか、あるいは各ステップでパラメトリック推論に依存するかを動的に決定する。
実験の結果,DeepRAGは検索効率を向上し,回答精度を26.4%向上させ,検索強化推論の有効性を示した。
論文 参考訳(メタデータ) (2025-02-03T08:22:45Z) - Dynamic Data Pruning for Automatic Speech Recognition [58.95758272440217]
ASR(DDP-ASR)のダイナミック・データ・プルーニング(Dynamic Data Pruning for ASR)を導入し,音声関連データセットに特化して微細なプルーニングの粒度を提供する。
実験の結果,DDP-ASRは最大1.6倍のトレーニング時間を節約できることがわかった。
論文 参考訳(メタデータ) (2024-06-26T14:17:36Z) - Zero-shot Retrieval: Augmenting Pre-trained Models with Search Engines [83.65380507372483]
大規模で事前訓練されたモデルは、問題を解決するのに必要なタスク固有のデータの量を劇的に削減するが、多くの場合、ドメイン固有のニュアンスを箱から取り出すのに失敗する。
本稿では,NLPとマルチモーダル学習の最近の進歩を活用して,検索エンジン検索による事前学習モデルを強化する方法について述べる。
論文 参考訳(メタデータ) (2023-11-29T05:33:28Z) - Lifelong Hyper-Policy Optimization with Multiple Importance Sampling
Regularization [40.17392342387002]
本稿では,その時にクエリされるポリシーのパラメータを出力する,入力が時間である超政治を学習する手法を提案する。
この超政治は、推定される将来のパフォーマンスを最大化し、重要サンプリングによって過去のデータを効率的に再利用するように訓練されている。
実環境において、最先端のアルゴリズムと比較して、我々のアプローチを実証的に検証する。
論文 参考訳(メタデータ) (2021-12-13T13:09:49Z) - DeepRite: Deep Recurrent Inverse TreatmEnt Weighting for Adjusting
Time-varying Confounding in Modern Longitudinal Observational Data [68.29870617697532]
時系列データにおける時間変化の相違に対するDeep Recurrent Inverse TreatmEnt重み付け(DeepRite)を提案する。
DeepRiteは、合成データから基底的真理を復元し、実際のデータから偏りのない処理効果を推定する。
論文 参考訳(メタデータ) (2020-10-28T15:05:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。