論文の概要: A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering
- arxiv url: http://arxiv.org/abs/2607.01469v1
- Date: Wed, 01 Jul 2026 21:01:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.592317
- Title: A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering
- Title(参考訳): エージェントビデオ質問応答における動的ツール合成の費用対効果評価プロトコル
- Abstract要約: Agentic Video Questioning (VideoQA) システムは推論中にツールを呼び出すが、ツールライブラリは修正されている。
本稿では,ツール拡張ビデオエージェントの監査のための費用対プロトコルを提案する。
- 参考スコア(独自算出の注目度): 2.1096366377985185
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic Video Question Answering (VideoQA) systems invoke tools during inference, but their tool libraries are fixed, so recurring procedures are rebuilt from primitives on every question. Synthesizing composite tools could remove this overhead, but whether such expansion helps is hard to assess: final-answer accuracy, the standard metric, ignores inference effort, so it cannot reveal how a system shifts cost. We propose a cost-aware, paired protocol for auditing tool-augmented video agents. The protocol pairs two complete systems on the same input for each question and reports their net difference across accuracy and cost jointly. For each question, it sorts the paired outcome into one of six groups defined by joint correctness and by the change in visible tool calls, separating accuracy-preserving efficiency gains from harmful regressions. Significance is reported with McNemar's test and paired bootstrap confidence intervals. We instantiate the protocol on Dynamic-SAGE, an agentic VideoQA framework that synthesizes, validates, and persistently registers executable composite tools for reuse on unseen questions, and evaluate it against the SAGE baseline on SAGE-Bench. The audit reveals a multi-axis profile that a scalar accuracy comparison would miss: Dynamic-SAGE improves accuracy by 7.5 points (p < 0.001) and reduces reasoning turns and visible tool calls by roughly 28%, while shifting rather than reducing inference cost, as token usage rises 34% and cost 26%. Gains are largest on visual and open-ended questions and neutral on verbal and multimodal ones, and residual failures concentrate on hard, open-ended questions where the pipeline does the most work. By measuring accuracy and cost jointly, the protocol shows where the pipeline-level difference is reliable and where it is not. The code is available at https://github.com/KurbanIntelligenceLab/Dynamic-SAGE.
- Abstract(参考訳): Agentic Video Question Answering (VideoQA) システムは推論中にツールを起動するが、ツールライブラリは固定されているため、すべての質問においてプリミティブから繰り返し手順を再構築する。
複合ツールを合成することは、このオーバーヘッドを取り除くことができるが、そのような拡張が役に立つかどうかを評価するのは難しい。
本稿では,ツール拡張ビデオエージェントの監査のための費用対プロトコルを提案する。
このプロトコルは、各質問に対して同じ入力に対して2つの完全なシステムをペアリングし、精度とコストの相違点を共同で報告する。
各質問に対して、ペア化された結果は、関節の正しさと目に見えるツールコールの変化によって定義された6つのグループのうちの1つに分類し、有害な回帰から精度保存効率の利得を分離する。
McNemarのテストとペアのブートストラップの信頼区間で重要なことが報告されている。
エージェントビデオQAフレームワークであるDynamic-SAGEのプロトコルをインスタンス化し、未確認の質問を再利用するための実行可能な複合ツールを合成し、検証し、永続的に登録し、SAGE-BenchのSAGEベースラインに対して評価する。
Dynamic-SAGEは7.5ポイント (p < 0.001) の精度を改善し、推論コストを下げるのではなく、推論のターンと可視的なツールコールを約28%削減し、トークン使用率が34%増加し、コストが26%上昇する。
利得は視覚的、オープンエンドの質問で最大であり、言語的、マルチモーダルな質問では中立的であり、残余の失敗はパイプラインが最もうまく機能する、ハードでオープンエンドの質問に集中する。
精度とコストを共同で測定することにより、パイプラインレベルの差がどこに信頼性があり、どこがそうでないかを示す。
コードはhttps://github.com/KurbanIntelligenceLab/Dynamic-SAGEで入手できる。
関連論文リスト
- AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs [17.842477184182556]
AsymSpecはエージェントパイプラインのための非対称な投機的デコーディングフレームワークである。
AsymSpecは平均して90%のフルコンテキスト精度で$approxに到達し、1.3$-$1.7times$スループットのスピードアップを提供する。
その結果、非対称な文脈アクセスは、圧縮が臨界推論信号を捨てたとき、正確にかなりの利得が得られることが示された。
論文 参考訳(メタデータ) (2026-08-26T16:50:02Z) - Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - Stable Curves, Unstable Items: Item-Level Scaling Heterogeneity in Video LLMs [16.31176289941024]
ビデオLLMは、視覚的予算が大きくなるにつれて、スムーズに改善されるか、飽和していることを示す。
制御された視覚的予算の下で,各凍結モデルペアを応答軌道で表現する。
我々は、構成の相補性、有害な遷移、およびテキスト上書きの一致したグリッド測度を導出する。
論文 参考訳(メタデータ) (2026-08-07T09:25:20Z) - AuditWeave: A Tamper-Evident, Auditor-Navigable Evidence Layer for AI-Assisted and Data-Transformation Workflows [0.0]
AuditWeaveは、AIアシストとデータ変換のステップを1つのハッシュチェーンの台帳に記録する軽量Pythonライブラリである。
本稿では,参照実装におけるオーバヘッド,拡張性,タンパー検出の正確さを設計し,評価する。
論文 参考訳(メタデータ) (2026-06-14T21:46:04Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems [20.846301581161978]
マルチエージェントシステムにおける障害帰属は、批判的だが未解決の課題である。
現在の手法では、これを長い会話ログ上のパターン認識タスクとして扱う。
A2P Scaffoldingは、パターン認識から構造化因果推論タスクへの障害帰属を変換する。
論文 参考訳(メタデータ) (2025-09-12T16:51:15Z) - How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $τ$-bench [58.114899897566964]
マルチターンの会話環境では、大きな言語モデル(LLM)は、一貫性のある推論とドメイン固有のポリシーへの固執にしばしば苦労する。
本稿では,関連するドメインルールを付加したユーザクエリを自動的に再構成するIRMA(Input-Reformulation Multi-Agent)フレームワークを提案する。
IRMAはReAct、Function Calling、Self-Reflectionをそれぞれ16.1%、12.7%、19.1%で大きく上回っている。
論文 参考訳(メタデータ) (2025-08-28T15:57:33Z) - AQD: Towards Accurate Fully-Quantized Object Detection [94.06347866374927]
本稿では,浮動小数点演算を除去するために,AQDと呼ばれる高精度な量子化オブジェクト検出ソリューションを提案する。
我々のAQDは、非常に低ビットのスキームの下での完全精度と比較して、同等またはそれ以上の性能を実現しています。
論文 参考訳(メタデータ) (2020-07-14T09:07:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。