論文の概要: When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2606.20113v1
- Date: Thu, 18 Jun 2026 11:38:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.82613
- Title: When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation
- Title(参考訳): ストリーミングツールはいつ役に立つのか? ストリーミング検索強化生成におけるツールインテリジェンス安定化の特徴
- Authors: Elroy Galbraith,
- Abstract要約: Streaming Retrieval-Augmented Generation (Streaming RAG)は、進行中のユーザ入力と並行してツールクエリを発行することで、ユーザ認識のレイテンシを低減する。
提案手法は,投機的クエリの検索が解答結果に収束する入力ストリームの点であるツールインテント安定化を測定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming Retrieval-Augmented Generation (Streaming RAG) reduces user-perceived latency by issuing tool queries in parallel with ongoing user input, before the utterance is complete. Reported gains are aggregate, yet the mechanism's benefit is fundamentally query-intrinsic: speculation can only help when the correct tool query becomes determinable before the user stops speaking or typing. We isolate and measure this property -- tool-intent stabilization, the point in the input stream at which a speculative query's retrieval converges to the answer-bearing result. On the CRAG benchmark (1371 validation questions) we (i) measure the distribution of stabilization, (ii) derive a model-agnostic bound H on the portion of tool latency that can be hidden behind the user's remaining input, as a function of tool latency L and input cadence δ, (iii) validate against a working streaming pipeline that realized savings meet or exceed this bound, and (iv) identify which query properties predict early versus late stabilization. The study requires no model training and runs on commodity CPU hardware. We find that at a realistic operating point (L=600ms, δ=3w/s, θ=0.8), 73.9% of queries across the full benchmark admit substantial latency hiding -- a blended figure that mixes sufficiency stabilization on the 21.3% of questions where gold evidence is verbatim-present and BM25-retrievable (95.2% streamable on this favorable slice) with a grounding-free top-1-settling fallback on the remainder. On the favorable slice, φ_suf is bracketed to [0.26, 0.281] by exact and relaxed grounding -- both early. Question type produces a significant but coarse early/late split (Kruskal-Wallis p=0.017, epsilon^2=0.04), directly informing when a learned speculative trigger is worth its cost.
- Abstract(参考訳): Streaming Retrieval-Augmented Generation (Streaming RAG)は、発話が完了する前に、進行中のユーザ入力と並行してツールクエリを発行することで、ユーザの知覚するレイテンシを低減する。
推測は、ユーザが話すかタイプするのをやめる前に、正しいツールクエリが決定可能になったときにのみ役立ちます。
我々は、この特性を分離し、測定する -- ツールインテント安定化、投機的クエリの検索が解答結果に収束する入力ストリームのポイント。
CRAGベンチマーク(1371)について
一 安定化の分布を測定すること。
(ii)ツール待ち時間Lと入力待ち時間δの関数として、残りの入力の後方に隠されるツール待ち時間の一部に、モデル非依存のバウンダリHを導出する。
三 貯蓄がこの制限を満たさないか又は超えていることを悟ったワーキング・ストリーミング・パイプラインに対する検証
(iv)どのクエリプロパティが早期と後期の安定化を予測するかを特定する。
この研究はモデルトレーニングを必要とせず、コモディティなCPUハードウェア上で実行される。
現実的な運用ポイント(L=600ms, δ=3w/s, θ=0.8)では、全ベンチマークで73.9%のクエリが、相当な遅延隠蔽を許容している。これは、金の証拠が垂直である21.3%の質問と、BM25-Retrievable(95.2%は、この好ましいスライスでストリーミング可能)で、残りはグラウンドフリーのトップ-1-セッティングフォールバックである。
好都合なスライスでは、φ_suf は[0.26, 0.281] に正確に、緩和された接地によってブラッキングされる。
質問タイプは、学習された投機的トリガーがそのコストに値するときに直接通知する、重要なが粗いアーリー/レイトスプリット(Kruskal-Wallis p=0.017, epsilon^2=0.04)を生成する。
関連論文リスト
- Closing the Loop on Latent Reasoning via Test-Time Reconstruction [45.08180971427891]
最近の研究は、中間推論を自然言語のトレースから潜時あるいはキャッシュレベルの表現に移行している。
本稿では,クエリ自体を参照としてループをクローズする自己教師型テストタイムトレーニング手法であるRELATを提案する。
ReLATは、単一モデル推論、テキストベースのコラボレーション、オープンループラテントコラボレーション、代替テストタイムトレーニング目標よりも一貫して改善されていることを示す。
論文 参考訳(メタデータ) (2026-06-04T14:54:40Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance [9.771590610969918]
WMF-AM(Working Memory Fidelity-Active Manipulation)を紹介する。
その結果,20種類のオープンウェイトモデル (0.5B-35B, 13ファミリー) で10タスク・エージェント・バッテリを発売した。
論文 参考訳(メタデータ) (2026-03-28T17:25:11Z) - First-Mover Bias in Gradient Boosting Explanations: Mechanism, Detection, and Resolution [0.0]
第1モーバーバイアス(英: First-mover bias)は、勾配上昇における逐次的残留フィッティングに起因する特徴量の集中である。
モデル独立性は線形状態における最優先バイアスを解くのに十分であり、非線形データ生成プロセス下では最も効果的な緩和法であることを示す。
論文 参考訳(メタデータ) (2026-03-22T02:59:40Z) - Interpretable AI-Assisted Early Reliability Prediction for a Two-Parameter Parallel Root-Finding Scheme [0.0]
我々は,kNN-LLEプロキシ安定度プロファイルとマルチ水平早期予測に基づくパラメータ化ルートフィンディングスキームのAI支援信頼性診断フレームワークを提案する。
このフレームワークは解釈可能な安定性指標を提供し、継続、再起動、パラメータの調整など、ソルバ実行時の早期決定をサポートする。
論文 参考訳(メタデータ) (2026-03-17T15:17:35Z) - Constraint-Aware Discrete-Time PID Gain Optimization for Robotic Joint Control Under Actuator Saturation [18.71390061417015]
実効ループは離散時間実行、アクチュエータ飽和、小さな遅延と測定の不完全さによって連続時間理論から逸脱する。
飽和離散時間ジョイント制御のための実装認識分析およびチューニングワークフローを提案する。
論文 参考訳(メタデータ) (2026-01-26T16:11:05Z) - Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z) - Stochastic Approximation with Delayed Updates: Finite-Time Rates under Markovian Sampling [73.5602474095954]
マルコフサンプリングの遅延更新による近似スキームの非漸近的性能について検討した。
我々の理論的な発見は、幅広いアルゴリズムの遅延の有限時間効果に光を当てた。
論文 参考訳(メタデータ) (2024-02-19T03:08:02Z) - The Curse of Performance Instability in Analysis Datasets: Consequences,
Source, and Suggestions [93.62888099134028]
自然言語推論(NLI)および読み込み(RC)解析/ストレスセットにおける最先端モデルの性能は極めて不安定であることがわかった。
このことは、(1)不安定さがこれらの分析セットに基づいて引き出された結論の信頼性にどのように影響するかという3つの疑問を提起する。
不安定の原因に関する理論的説明と実証的証拠の両方を提示する。
論文 参考訳(メタデータ) (2020-04-28T15:41:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。