論文の概要: Confidence-Aware Tool Orchestration for Robust Video Understanding
- arxiv url: http://arxiv.org/abs/2606.26904v1
- Date: Thu, 25 Jun 2026 11:37:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.259047
- Title: Confidence-Aware Tool Orchestration for Robust Video Understanding
- Title(参考訳): ロバストビデオ理解のための信頼度対応ツールオーケストレーション
- Authors: Yangfan He, Yujin Choi, Jaehong Yoon,
- Abstract要約: 本稿では,フレーム単位の信頼性を推論のあらゆる段階に統合するエージェントビデオ理解フレームワークであるRobust-TOを提案する。
8つのタスクにまたがる2つのビデオ推論ベンチマークで、Robost-TOはクリーンな入力で平均56.4%の精度を達成した。
5つの現実的な汚職タイプの下では、Robust-TOは54.3%の平均精度を維持し、5.8%が最強のオープンソースベースラインより上である。
- 参考スコア(独自算出の注目度): 30.37722671405153
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video reasoning language models implicitly assume that every input frame is equally reliable. This leads to what we term the Blind Trust Problem: under realistic perturbations such as motion blur, glare, or occlusion, frontier video reasoning models can suffer 15-30%p accuracy drops on real-world embodied benchmarks, while remaining unaware that their visual evidence has been degraded. To address this challenge, we propose Robust-TO, an agentic video understanding framework that explicitly integrates per-frame trustworthiness into every stage of reasoning. Robust-TO organizes heterogeneous visual perception tools under a unified evidence interface. Each tool receives a sub-query derived from the original question and a set of trustworthy frames selected by the reliability-relevance score. It returns evidence in a shared format: a concrete prediction (e.g., a bounding box, motion trajectory, recognized text, or action label), temporal grounding, and a calibrated reliability score. During reasoning, these calibrated scores guide evidence weighting in a three-tier synthesis process (high/medium/low) and define a confidence-cost GRPO reward that jointly optimizes correctness, evidence reliability, and efficiency. On two video reasoning benchmarks spanning eight tasks, Robust-TO achieves 56.4% average accuracy on clean inputs, surpassing the strongest open-source baseline by 10.6%p and outperforming Gemini-2.5-Pro (46.2%). Under five realistic corruption types, Robust-TO maintains 54.3% average accuracy, 5.8%p above the strongest open-source baseline, while exhibiting the smallest clean-to-corrupted accuracy drop among all compared methods.
- Abstract(参考訳): ビデオ推論言語モデルは、すべての入力フレームが等しく信頼できると暗黙的に仮定する。
モーションボケ、グラア、オクルージョンのような現実的な摂動の下で、フロンティアビデオ推論モデルは、実世界のエンボディドベンチマークで15~30%の精度低下を被るが、その一方で、彼らの視覚的証拠が劣化していることに気づかない。
この課題に対処するために,フレーム毎の信頼性を推論のすべての段階に明示的に統合する,エージェントビデオ理解フレームワークであるRobust-TOを提案する。
Robust-TOは、統一されたエビデンスインタフェースの下で異種視覚認識ツールを編成する。
各ツールは、元の質問から派生したサブクエリと、信頼性関連スコアで選択された信頼できるフレームのセットを受信する。
具体的な予測(例えば、バウンディングボックス、モーショントラジェクトリ、認識されたテキスト、アクションラベル)、時間的グラウンド、キャリブレーションされた信頼性スコア。
これらの校正されたスコアは、3層合成プロセス(ハイ/メジウム/ロー)において重み付けされたエビデンスを示し、信頼性の高いGRPO報酬を定義し、正確性、エビデンス信頼性、効率性を共同で最適化する。
8つのタスクにまたがる2つのビデオ推論ベンチマークにおいて、Robust-TOは56.4%の平均的な入力精度を達成し、オープンソースのベースラインを10.6%上回り、Gemini-2.5-Pro(46.2%)を上回った。
5つの現実的な汚職タイプの下では、Robost-TOは54.3%の平均精度を維持し、5.8%が最強のオープンソースベースラインを上回っている。
関連論文リスト
- Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring [1.0170129555792935]
802.11パケットキャプチャの診断には、専門家のプロトコル知識が必要で、遅く、エンジニア間で一貫性がなく、スケールできない。
LLMベースのアプローチは、キャプチャーから欠落するが製造されたプロトコルイベントを聴取し、未校正された信頼スコアを生成し、テスト中のモデルによって黄金の基準が共同生成されると評価バイアスを被る。
PROBEは3つの障害に対処する多段階パイプラインである。
論文 参考訳(メタデータ) (2026-06-05T03:39:58Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Parrot: Persuasion and Agreement Robustness Rating of Output Truth -- A Sycophancy Robustness Benchmark for LLMs [0.0]
PARROT (Persuasion and Agreement Robustness Rating of Output Truth) は、ユーザの社会的圧力下での精度の劣化を測定するための堅牢性にフォーカスしたフレームワークである。
我々は13のドメインにまたがる1,302のMMLUスタイルの多重選択質問とドメイン固有の権威テンプレートを用いて22のモデルを評価する。
論文 参考訳(メタデータ) (2025-11-21T13:01:28Z) - Formal Models and Convergence Analysis for Context-Aware Security Verification [0.0]
本稿では,ML強化適応システムに対する証明可能な保証を確立する,文脈認識型セキュリティ検証のための公式なフレームワークを提案する。
1)適応的検証が成功した場合のサンプル複雑性境界,(2)コンテキストリッチネスと検出能力に関する情報理論制限,(3)MLベースのペイロードジェネレータの収束保証。
論文 参考訳(メタデータ) (2025-10-14T12:21:36Z) - ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability [23.70973331911138]
使用可能な推論システムは、解釈可能性、忠実性、信頼性の3つの特性を特徴とする、信頼できるものでなければならない、と我々は主張する。
本稿では,GRPOと教師付き微調整を統合した新しいトレーニングフレームワークReFIneを提案する。
実験の結果,ReFIneモデルはより明確でより構造化された推論トレースを生成することがわかった。
論文 参考訳(メタデータ) (2025-10-10T07:08:44Z) - Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation [0.0]
大規模言語モデルは幻覚に悩まされ、可視だが事実的に誤った内容を生成する。
現在の緩和戦略は、計算コストが高く、信頼性の低いコンテンツ生成を防げない、ポストジェネレーション補正に重点を置いている。
本稿では,予測された信頼性に基づいて,モデルの不確実性を積極的に評価し,クエリをリダイレクトする信頼度対応ルーティングシステムを提案する。
論文 参考訳(メタデータ) (2025-09-23T18:34:20Z) - Understanding and Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding [59.50808215134678]
この研究では、23の最先端のビデオLLMを評価する最初の総合的なベンチマークであるTrust-videoLLMを紹介した。
その結果、動的シーン理解、クロスモーダルレジリエンス、現実世界のリスク軽減において、大きな制限が示された。
論文 参考訳(メタデータ) (2025-06-14T04:04:54Z) - Reasoning Models Are More Easily Gaslighted Than You Think [85.84943447589511]
我々はOpenAIのo4-mini、Claude-3.7-Sonnet、Gemini-2.5-Flashの3つの最先端推論モデルを評価する。
ガス灯消火プロンプトによる精度低下が認められた。
GaslightingBench-Rは、推論モデルの認識可能性を評価するために設計された新しい診断ベンチマークである。
論文 参考訳(メタデータ) (2025-06-11T12:52:25Z) - Synchronous Faithfulness Monitoring for Trustworthy Retrieval-Augmented Generation [96.78845113346809]
Retrieval-augmented Language Model (RALMs) は、知識集約型タスクにおいて、高い性能と幅広い適用性を示している。
本稿では,非偽文の検出に微細な復号力学を利用する軽量モニタであるSynCheckを提案する。
また、長文検索拡張生成のためのビームサーチによって導かれる忠実度指向の復号アルゴリズムであるFODを導入する。
論文 参考訳(メタデータ) (2024-06-19T16:42:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。