論文の概要: CASE: Cost-Aware Stopping for Efficient Long-Video Agents
- arxiv url: http://arxiv.org/abs/2610.05400v1
- Date: Sun, 04 Oct 2026 17:35:33 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:49:00.120715
- Title: CASE: Cost-Aware Stopping for Efficient Long-Video Agents
- Title(参考訳): ケース:効率的なロングビデオエージェントのコスト認識停止
- Abstract要約: 長ビデオエージェントのためのプラグイン終端フレームワークであるCASEを提案する。
Caseは、この決定をポリシー付きシーケンシャル・ストップとして表している。
軽量なリッジ回帰器は、この決定ギャップを学び、STOP/E決定を生成する。
- 参考スコア(独自算出の注目度): 47.793956973688616
- License:
- Abstract: Long-video agents can actively gather question-relevant evidence, but they typically leave a central decision implicit: when has the agent seen enough to answer? We propose CASE, a plug-in termination framework that frames this decision as policy-conditioned sequential stopping. At each causal checkpoint, CASE combines an auxiliary multiple-choice assessment of accumulated evidence with the host agent's execution state. From complete native trajectories, we construct a cost-aware target that compares answering now with stopping later along the same search path, accounting jointly for answer correctness and the full cost of continued reasoning. A lightweight Ridge regressor learns this decision gap and produces STOP/CONTINUE decisions. We evaluate three vision-language models with VideoSeek and AVP. On Video-MME, end-to-end accuracy changes by +0.67 percentage points on average while CASE reduces model-token use by 53.63%. The same frozen policies then transfer zero-shot to LongVideoBench and MLVU, with end-to-end accuracy changes of +3.38 and +4.58 points while saving 58.78% and 51.28% of model tokens, respectively. Across all agent-model-benchmark combinations, CASE attains the highest accuracy-efficiency Pareto-frontier coverage among the compared stopping methods (83.3%) at the selected operating points. Online execution preserves this favorable accuracy-efficiency trade-off and additionally reduces measured runtime by 54.1% on average. CASE provides a plug-in termination framework for long-video reasoning agents, enabling them to decide when further evidence acquisition is no longer worthwhile.
- Abstract(参考訳): 長時間ビデオのエージェントは、質問に関連する証拠を積極的に集めることができるが、彼らは通常、中心的な決定を暗黙に残す。
本稿では,この決定を政策条件付きシーケンシャル停止とみなすプラグイン終端フレームワークであるCASEを提案する。
それぞれの因果チェックポイントにおいて、CASEは蓄積された証拠の補助的多重選択評価とホストエージェントの実行状態を組み合わせる。
完全ネイティブな軌道から,解答と後続の探索経路における停止を比較検討し,解答正解と連続推論の完全コストを共同で説明する。
軽量リッジ回帰器はこの決定ギャップを学習し、STOP/CONTINUE決定を生成する。
我々はVideoSeekとAVPで3つの視覚言語モデルを評価する。
Video-MMEでは、エンドツーエンドの精度は平均で+0.67ポイント、CASEでは53.63%低下する。
同じフリーズポリシはゼロショットをLongVideoBenchとMLVUに転送し、エンドツーエンドの精度は+3.38と+4.58で、それぞれ58.78%と51.28%のモデルトークンを節約した。
すべてのエージェント-モデル-ベンチマークの組み合わせの中で、CASEは選択された操作点における比較停止方法(83.3%)の中で、最も精度-効率のパレート-フロントカバーを達成している。
オンライン実行は、この良好な精度と効率のトレードオフを維持し、測定されたランタイムを平均54.1%削減する。
CASEは、長期ビデオ推論エージェントのためのプラグイン終端フレームワークを提供し、さらなるエビデンス取得がもはや価値がないかどうかを判断することを可能にする。
関連論文リスト
- Continuous Process-Level Evaluation for Evolving Enterprise AI Agent Skills [0.39508022083907385]
結果レベルとプロセスレベルのチェックを組み合わせた継続的評価フレームワークを提案する。
我々は,2つのスキル,2つの仕様変種,2つのエージェントハーネス,3つのモデルに対する240の試行を評価した。
論文 参考訳(メタデータ) (2026-10-01T15:06:23Z) - Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses [6.778374627376906]
System-1決定モデルは、クラス確率で単一のフォワードパスでそのような質問に答える。
オープンウェイト (Laya) モデルとホスト (Jev) System-1 モデルとのペア評価を行った。
論文 参考訳(メタデータ) (2026-10-01T05:57:14Z) - Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning [104.97890382020937]
エージェントメタ推論は,制御選択を明示的かつ構造化する推論時ハーネスである。
ワーカーはタスクレベルの計算を実行し、コントローラは実行が確立したものを統合する。
決定の間、コントローラはその全履歴を再生するのではなく、実行時のコンパクトな説明しか持たない。
論文 参考訳(メタデータ) (2026-09-29T17:57:25Z) - State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation [51.32912774464992]
大規模な言語モデルは、しばしば完全に指定されたプロンプトからタスクを解くが、同じ要求が複数のターンに広がると分解する。
本研究は, モデル自体の方針から, 履歴をクリアした基準を用いて汚染を低減させる, オンライン自己蒸留法であるMAIGOを提案する。
ミドルターンの場合、MAIGOは、ユーザ可視のシャードプレフィックスを保持しながら、事前のアシスタント応答を削除します。
論文 参考訳(メタデータ) (2026-05-26T15:38:46Z) - Ask Early, Ask Late, Ask Right: When Does Clarification Timing Matter for Long-Horizon Agents? [0.7199239000118145]
本稿では,エージェントの軌道の制御点における接地真実の明確化を提供する強制注入フレームワークを提案する。
明確化の価値は、どの情報が欠落しているかに大きく依存している。
300のセッションを補完する研究により、現在のフロンティアモデルは経験的に最適なウィンドウ内では問わないことが明らかになった。
論文 参考訳(メタデータ) (2026-05-08T16:08:03Z) - Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.0]
DASEは、ベンチマークをまたいで一般化するコミット型ルーティングパーティションを生成する。
インジェクション帯域ではなく、適応的な停止が正確さを駆動する。
インジェクションベースの手法は、逆Uの精度-vs-推論軌道を示す。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。