論文の概要: When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2606.20113v2
- Date: Fri, 19 Jun 2026 09:35:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-23 13:41:31.030789
- Title: When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation
- Title(参考訳): ストリーミングツールはいつ役に立つのか? ストリーミング検索強化生成におけるツールインテリジェンス安定化の特徴
- Abstract要約: Streaming Retrieval-Augmented Generationは、発話が完了する前に、ユーザのまだ到着している入力と並行して検索クエリを発行することで、ツールのレイテンシを隠蔽する。
我々は,この特性,ツールインテリジェンス安定化,すなわち,投機的クエリの検索が解答結果に収束する入力ストリーム内の点を命名し,測定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming Retrieval-Augmented Generation (Streaming RAG) hides tool latency by issuing retrieval queries in parallel with the user's still-arriving input, before the utterance is complete. Speculation can only help, though, when the correct query becomes determinable before the user stops speaking or typing -- a property of the query, not the system. We name and measure this property, tool-intent stabilization: the point in the input stream at which a speculative query's retrieval converges on the answer-bearing result. On the CRAG benchmark (1371 validation questions) we (i) characterize how stabilization is distributed across queries; (ii) derive a model-agnostic bound H on the share of tool latency hideable behind the remaining input, given tool latency L and input cadence delta; (iii) validate it against a working streaming pipeline; and (iv) ask which query properties predict early versus late stabilization. Stabilization is typically early: at a realistic operating point a 73.9% streamable fraction of the benchmark admits latency hiding, and H acts as a conservative aggregate floor that realized savings meet or exceed -- though it does not predict savings query by query. Question type yields a statistically significant but small early/late split. The study needs no model training and runs on commodity CPU hardware; a dense-retriever replication confirms the early-stabilization effect is not a BM25 lexical artifact.
- Abstract(参考訳): Streaming Retrieval-Augmented Generation (Streaming RAG)は、発話が完了する前に、ユーザの入力と並行して検索クエリを発行することで、ツールのレイテンシを隠蔽する。
推測は、ユーザが話すのをやめる前に正しいクエリが決定可能になったとき、つまり、システムではなくクエリのプロパティである場合にのみ有効である。
我々は,この特性,ツールインテリジェンス安定化,すなわち,投機的クエリの検索が解答結果に収束する入力ストリーム内の点を命名し,測定する。
CRAGベンチマーク(1371)について
i) クエリ間で安定化がどのように分散しているかを特徴付ける。
(ii) 与えられたツール待ち時間Lと入力待ち時間デルタの入力に隠れ可能なツール待ち時間シェアのモデル非依存境界Hを導出すること。
三 動作中のストリーミングパイプラインに対して検証すること、及び
(iv)どのクエリプロパティが早期と後期の安定化を予測するかを尋ねる。
現実的な運用ポイントでは、73.9%のストリーム可能なベンチマークがレイテンシの隠蔽を認め、Hは、クエリによるセーブクエリを予測していないにも関わらず、セーブが一致または超えることを認識した保守的な集約フロアとして機能する。
質問タイプは統計的に有意であるが、早期/後期の分裂が小さい。
この研究はモデルトレーニングを必要とせず、コモディティなCPUハードウェア上で実行される。
関連論文リスト
- Leakage-Safe and Scheduler-Aware Machine Learning for Grid Job Runtime Prediction [0.42821598129654453]
本稿では、GWA-T-4 AuverGridのワークロードトレースにおけるCPUバースト時間予測を再検討し、リークセーフなジョブ実行時予測として再検討する。
我々は、ターゲットをジョブレベルのランタイムとして定義し、提出時属性のみを使用し、実行後変数を除外し、時間的およびコールドスタート設定下でモデルを評価する。
論文 参考訳(メタデータ) (2026-09-12T04:20:41Z) - Prediction of Prediction (PoP): Inter-Layer Activation Fusion for Single-Pass Hallucination Detection in Large Language Models [0.0]
この研究は、生成中の内部の隠れ状態遷移ダイナミクスが、補助的な復号呼び出しを伴わずに事実エラーを信号化できるかどうかを評価する。
本稿では,層間遷移の不確実性を捉えるメカニズムである予測予測(PoP)を導入する。
PoPは受信機動作特性曲線(AUROC)の領域を75.5%の精度で達成している。
論文 参考訳(メタデータ) (2026-08-27T14:17:14Z) - Closing the Loop on Latent Reasoning via Test-Time Reconstruction [45.08180971427891]
最近の研究は、中間推論を自然言語のトレースから潜時あるいはキャッシュレベルの表現に移行している。
本稿では,クエリ自体を参照としてループをクローズする自己教師型テストタイムトレーニング手法であるRELATを提案する。
ReLATは、単一モデル推論、テキストベースのコラボレーション、オープンループラテントコラボレーション、代替テストタイムトレーニング目標よりも一貫して改善されていることを示す。
論文 参考訳(メタデータ) (2026-06-04T14:54:40Z) - Fortress: A Case Study in Stabilizing Search Recommendations via Temporal Data Augmentation and Feature Pruning [2.6494136490021387]
Fortressは、時間の経過とともに一貫性のない予測スコアに寄与する特徴を特定し、誇張する。
Fortressを,大規模なアプリマーケットプレースにおけるクエリ・ツー・アプリ関連モデルで検証する。
論文 参考訳(メタデータ) (2026-05-14T18:13:05Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance [9.771590610969918]
WMF-AM(Working Memory Fidelity-Active Manipulation)を紹介する。
その結果,20種類のオープンウェイトモデル (0.5B-35B, 13ファミリー) で10タスク・エージェント・バッテリを発売した。
論文 参考訳(メタデータ) (2026-03-28T17:25:11Z) - First-Mover Bias in Gradient Boosting Explanations: Mechanism, Detection, and Resolution [0.0]
第1モーバーバイアス(英: First-mover bias)は、勾配上昇における逐次的残留フィッティングに起因する特徴量の集中である。
モデル独立性は線形状態における最優先バイアスを解くのに十分であり、非線形データ生成プロセス下では最も効果的な緩和法であることを示す。
論文 参考訳(メタデータ) (2026-03-22T02:59:40Z) - Interpretable AI-Assisted Early Reliability Prediction for a Two-Parameter Parallel Root-Finding Scheme [0.0]
我々は,kNN-LLEプロキシ安定度プロファイルとマルチ水平早期予測に基づくパラメータ化ルートフィンディングスキームのAI支援信頼性診断フレームワークを提案する。
このフレームワークは解釈可能な安定性指標を提供し、継続、再起動、パラメータの調整など、ソルバ実行時の早期決定をサポートする。
論文 参考訳(メタデータ) (2026-03-17T15:17:35Z) - RAG without Forgetting: Continual Query-Infused Key Memory [27.597076561986594]
Evolving Retrieval Memory (ERM) は、過渡的なクエリ時間ゲインを永続的な検索改善に変換する、トレーニング不要のフレームワークである。
ERMは、正しさに制限されたフィードバックを通じて検索インデックスを更新し、アトミック拡張信号を選択的にそれらが有益であるドキュメントキーに属性付け、安定でノルムバウンドな更新を通じてキーを段階的に進化させる。
我々は,クエリとキー拡張が理論的に標準的な類似関数の下で等価であることを示し,ERMの選択的更新の収束を証明し,最適なクエリ拡張を推論時間オーバーヘッドゼロの安定インデックスに補正することを示した。
論文 参考訳(メタデータ) (2026-02-05T00:12:45Z) - Constraint-Aware Discrete-Time PID Gain Optimization for Robotic Joint Control Under Actuator Saturation [18.71390061417015]
実効ループは離散時間実行、アクチュエータ飽和、小さな遅延と測定の不完全さによって連続時間理論から逸脱する。
飽和離散時間ジョイント制御のための実装認識分析およびチューニングワークフローを提案する。
論文 参考訳(メタデータ) (2026-01-26T16:11:05Z) - Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - Stochastic Approximation with Delayed Updates: Finite-Time Rates under Markovian Sampling [73.5602474095954]
マルコフサンプリングの遅延更新による近似スキームの非漸近的性能について検討した。
我々の理論的な発見は、幅広いアルゴリズムの遅延の有限時間効果に光を当てた。
論文 参考訳(メタデータ) (2024-02-19T03:08:02Z) - Streaming Motion Forecasting for Autonomous Driving [71.7468645504988]
ストリーミングデータにおける将来の軌跡を問うベンチマークを導入し,これを「ストリーミング予測」と呼ぶ。
我々のベンチマークは本質的に、スナップショットベースのベンチマークでは見過ごされていない安全上の問題であるエージェントの消失と再出現を捉えている。
我々は,任意のスナップショットベースの予測器をストリーミング予測器に適応させることのできる,"Predictive Streamer"と呼ばれるプラグアンドプレイメタアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-10-02T17:13:16Z) - Sequential Kernelized Independence Testing [77.237958592189]
我々は、カーネル化依存度にインスパイアされたシーケンシャルなカーネル化独立試験を設計する。
シミュレーションデータと実データの両方にアプローチのパワーを実証する。
論文 参考訳(メタデータ) (2022-12-14T18:08:42Z) - The Curse of Performance Instability in Analysis Datasets: Consequences,
Source, and Suggestions [93.62888099134028]
自然言語推論(NLI)および読み込み(RC)解析/ストレスセットにおける最先端モデルの性能は極めて不安定であることがわかった。
このことは、(1)不安定さがこれらの分析セットに基づいて引き出された結論の信頼性にどのように影響するかという3つの疑問を提起する。
不安定の原因に関する理論的説明と実証的証拠の両方を提示する。
論文 参考訳(メタデータ) (2020-04-28T15:41:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。