論文の概要: StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams
- arxiv url: http://arxiv.org/abs/2609.38612v2
- Date: Thu, 01 Oct 2026 14:48:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.53651
- Title: StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams
- Title(参考訳): StreamDecisionBench: 言語ストリームの進化における決定力の評価
- Abstract要約: 言語モデルは、新しいものが到着するまで、最新の回答を適用するアプリケーションにおいて、ますますリアルタイムな決定をする。
遅れた答えは、顧客がカードの詳細を読み出している間、コールレコーダーがまだ実行されているなど、古い決定を延ばすことができる。
StreamDecisionBench(SDB)は、4つのアプリケーションファミリで8つのストリーミングシナリオのデータセットで、パブリックルールから導かれる参照決定を実行可能なものにします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models increasingly make real-time decisions in applications that apply the latest answer until a newer one arrives. A late answer can prolong an outdated decision, such as a call recorder still running while a customer reads out card details, an error offline accuracy misses. We make three contributions. First, we release StreamDecisionBench (SDB), a dataset of eight streaming scenarios in four application families, with executable reference decisions derived from public rules. Second, we propose an evaluation protocol and a metric, in-force accuracy: the share of time the applied decision is correct across update intervals of 0.5-8 s. It reflects accuracy and latency jointly, attributing each error to judgment, latency or both. Third, we evaluate thirteen single-model settings, and this attribution separates speed-limited from judgment-limited models: slower, more accurate models lose 42-51% of the time to outdated answers, a fast model 34% to wrong ones. We therefore test hybrids in which a slow model corrects a fast one; with the right pairing and configuration, a hybrid outperforms every single model. However, even the best evaluated system keeps a correct decision in force only about two-thirds of the time, leaving a substantial gap for real-time use.
- Abstract(参考訳): 言語モデルは、新しいものが到着するまで、最新の回答を適用するアプリケーションにおいて、ますますリアルタイムな決定をする。
顧客がカードの詳細を読み上げている間に、コールレコーダが動作し、エラーのオフライン精度が失われるなど、遅れた回答は古い決定を延ばすことができる。
私たちは3つの貢献をします。
まず、SDB(StreamDecisionBench)という、4つのアプリケーションファミリで8つのストリーミングシナリオのデータセットをリリースします。
第2に,0.5~8秒の更新間隔で,適用した判定時間の割合が正し,評価プロトコルと測定値のインフォース精度を提案する。
精度とレイテンシを共同で反映し、各エラーを判断やレイテンシ、あるいはその両方に原因付ける。
第3に、13の単一モデル設定を評価し、この属性は、速度制限モデルと判断制限モデルとを区別する。
したがって、遅いモデルが高速なモデルを修正するハイブリッドをテストします。
しかし、最高の評価システムでさえ、その3分の2の時間しか正しい判断をしないため、リアルタイム利用にはかなりのギャップが残されている。
関連論文リスト
- Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding [65.85599131866623]
私たちはJevとContractNLIの9つの言語モデルを比較します。
制御された比較は、仮説の可視性、要求された出力、および出力順序によって異なる。
Jevは、評価された構成の中で、最低コストと中央値のレスポンス時間を持っています。
論文 参考訳(メタデータ) (2026-09-23T10:53:01Z) - GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning [61.67411833252235]
本稿では,プロンプトの隠蔽表現と生成された継続の間に,選択したTransformer層に最適化可能な潜在状態を挿入するGradCuitを紹介する。
5つの命令調整されたバックボーン、3つの推論ベンチマーク、2つの回答フォーマットで、GradCuitの平均精度は64.5%である。
解釈可能性について、トークンレベルの勾配属性は、遅延の影響が推論・接続子トークンに集中していることを明らかにする一方、層解析は、初期から中間のトランスフォーマー層を最も効果的な最適化空間として認識する。
論文 参考訳(メタデータ) (2026-08-03T17:55:24Z) - Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models [0.3142999832608949]
出力された応答,オプションロジット,それらのロジットのアフィン読み出し,および同じ応答トークンにおける隠蔽状態の線形読み出しを比較する。
状態復号は平均27.8の精度で生成され、判定ルールと読み出しカバーギャップは10条件すべてで正である。
論文 参考訳(メタデータ) (2026-08-03T17:34:33Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration [0.0]
ゲームエンジンが、どのモデルでも、クエストが完了するかどうかを知ることができるような、テキストアドベンチャーの世界を構築します。
結果が読まれる前に決定ルールが記録され、実行するアーティファクトが実行されたリビジョンにバインドされる。
プレイヤーが固定された状態で、楽器の選択は測定された振る舞いを大きく変えた。
論文 参考訳(メタデータ) (2026-07-15T22:33:53Z) - A Proprioceptive-Only Benchmark for Quadruped State Estimation: ATE, RPE, and Runtime Trade-offs Between Filters and Smoothers [3.926021278968717]
MUSE, Invariant Extended Kalman Filter (IEKF), Invariant Smoother (IS) の3つの状態受容状態推定器を比較した。
本稿では,長期精度(ATE),短期精度(Translational and rotational Relative Pose metrics RPE),および固定ハードウェア/ソフトウェアスタック上での更新時間について報告する。
全体として、本研究では正確さとコストのスナップショットを提供し、読者がアプリケーション制約に適合する推定器を選択するのに役立つ。
論文 参考訳(メタデータ) (2026-05-12T07:31:57Z) - The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation [17.386684382460242]
大規模言語モデル(LLM)は、推論、質問応答、創造的記述といったタスクにおけるシステムの出力を評価するために、ますます使われてきている。
6つの判定モデルに対する評価プロンプトに挿入された制御キュー摂動合成メタデータラベルを用いて,この理想を検証した。
情報源,時間,年齢,性別,民族,教育的地位の6つのキュー族を調査する。
論文 参考訳(メタデータ) (2026-02-08T14:45:23Z) - Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference [31.2331188304598]
評価バッチサイズ、GPUカウント、GPUバージョンなどのシステム構成の変更は、生成されたレスポンスに大きな違いをもたらす可能性がある。
この変数の根本原因は、限定的な数値精度で浮動小数点算術の非連想性に遡る。
そこで我々は16ビットの精度で重みを格納するが、FP32では全ての計算を実行する軽量な推論パイプラインLayerCastを開発した。
論文 参考訳(メタデータ) (2025-06-11T08:23:53Z) - Thought calibration: Efficient and confident test-time scaling [11.028893528095196]
大きな言語モデルを推論することで、長いこと考えることで、素晴らしいテスト時間のスケーリングを実現しますが、このパフォーマンス向上は、かなりの計算コストを伴います。
思考終了時の動的決定を動的に行うための思考校正を提案する。
このフレームワークは,言語モデルに隠された表現をベースとした軽量なプローブによって実現されている。
論文 参考訳(メタデータ) (2025-05-23T22:17:18Z) - Towards Streaming Perception [70.68520310095155]
本稿では、リアルタイムオンライン知覚のための単一のメトリクスにレイテンシと精度を協調的に統合するアプローチを提案する。
この指標の背後にある重要な洞察は、瞬間ごとに認識スタック全体の出力を共同で評価することである。
本稿では,都市ビデオストリームにおけるオブジェクト検出とインスタンスセグメンテーションの具体的タスクに注目し,高品質で時間依存的なアノテーションを備えた新しいデータセットを寄贈する。
論文 参考訳(メタデータ) (2020-05-21T01:51:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。