論文の概要: InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations
- arxiv url: http://arxiv.org/abs/2609.01383v1
- Date: Tue, 01 Sep 2026 15:15:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.794514
- Title: InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations
- Title(参考訳): InSight:インタラクティブな可視化におけるエージェントクレーム検証のベンチマーク
- Authors: Maeve Hutchinson, Syed Mahbubul Huq, Mohammad Albinhassan, Radu Jianu, Aidan Slingsby, Pranava Madhyastha,
- Abstract要約: 本稿では,対話型ビジュアライゼーションを用いたエージェントクレーム検証のベンチマークであるInSightを紹介する。
データセットは21,349件のクレームからなり,完全にインタラクティブなWebベースの環境を基盤としている。
従来の評価とは異なり、InSightは相互作用トレースを推論の固有のプロキシとして扱い、モデルがどのように視覚的証拠を求め合成するかの厳密な監査を可能にする。
- 参考スコア(独自算出の注目度): 5.169269482194285
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision Language Models have demonstrated remarkable proficiency in interpreting static visual artifacts, but modern data analysis is inherently dynamic, requiring the active interrogation of interactive environments. Existing benchmarks are predominantly constrained to static imagery and one-shot question answering and fail to capture the epistemic demands of this domain, where evidence is frequently occluded, distributed across linked views, or conditionally revealed through user agency. In this paper, we introduce InSight, a benchmark for agentic claim verification over interactive visualizations. The dataset consists of 21,349 claims derived from human-authored analytical narratives and grounded in fully interactive web-based environments. Agents must navigate these environments to determine whether a natural language claim is supported, refuted or not verifiable given the available evidence. Unlike traditional evaluations, InSight treats interaction traces as intrinsic proxies for reasoning, enabling a rigorous audit of how models seek and synthesize visual evidence. We evaluate state-of-the-art models, revealing that interactive verification remains a non-trivial challenge. We release InSight at https://github.com/maevehutch/insight.
- Abstract(参考訳): 視覚言語モデルは静的な視覚的アーティファクトの解釈に顕著な習熟性を示してきたが、現代のデータ分析は本質的に動的であり、対話的な環境を積極的に問う必要がある。
既存のベンチマークは、静的画像とワンショットの質問応答に主に制約されており、エビデンスを頻繁に排除したり、リンクされたビューに分散したり、あるいはユーザエージェンシーによって条件付きで開示されたりする領域の疫学的な要求を捉えていない。
本稿では,対話型ビジュアライゼーションを用いたエージェントクレーム検証のベンチマークであるInSightを紹介する。
データセットは21,349件のクレームからなり,完全にインタラクティブなWebベースの環境を基盤としている。
エージェントはこれらの環境をナビゲートして、利用可能な証拠から、自然言語のクレームがサポートされているか、否定されているか、検証されていないかを決定する必要がある。
従来の評価とは異なり、InSightは相互作用トレースを推論の固有のプロキシとして扱い、モデルがどのように視覚的証拠を求め合成するかの厳密な監査を可能にする。
我々は最先端のモデルを評価し、インタラクティブな検証は相変わらず難しい課題であることを示した。
InSightはhttps://github.com/maevehutch/insight.comでリリースしています。
関連論文リスト
- Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis [55.78822230833247]
We present Inter-X++, a comprehensive and large-scale benchmark designed to empower useful HHI analysis。
インターX++は11,388個の高忠実な相互作用シーケンスと8.1Mフレームを提供する。
インタラクションの再構築と意味理解を協調的に最適化する,単一かつ統一されたHHI表現とモデリングフレームワークOpenHHIを提案する。
論文 参考訳(メタデータ) (2026-08-20T17:51:48Z) - Active Perception for Embodied Disambiguation [5.8993656688823135]
目的の曖昧さを具現化するための能動的知覚フレームワークを提案する。
このフレームワークは,物理的情報取得とユーザ意図の明確化を組み合わせたものであることを示す。
実ロボット実験により、このフレームワークは物理的情報取得とユーザ意図の明確化を組み合わせたものであることが示された。
論文 参考訳(メタデータ) (2026-08-11T09:47:20Z) - Behaviorally Adaptive Visual Diversion for Inclusive and Resilient Digital Assessment Delivery [0.0]
本稿では、合成非意味的視野を評価内容と合成する理論的枠組みである行動適応型視覚変換(BAVD)を紹介する。
BAVDにはアクセシビリティを意識したメカニズムが組み込まれており、承認された視覚処理施設を持つ候補者のディバージョン強度を減少または抑制する。
論文 参考訳(メタデータ) (2026-08-04T12:13:25Z) - Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions [15.505991441542372]
本稿では,評価モデルと自動検査器,グルーパーの3つのインタラクションとして評価をリキャストするフレームワークを提案する。
状態空間遷移をナビゲートすることで、CEDIは、明確化要求から敵のプローブまで、さまざまな戦略を展開し、パフォーマンスのエビデンスを引き出す。
幻覚はしばしば、自己強化的な対話履歴を通じて長い文脈に蓄積され、モデルは特に、前提的拒絶や拒絶を必要とする問題に対して脆弱であることを示す。
論文 参考訳(メタデータ) (2026-07-16T02:25:03Z) - Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild [49.77540427384148]
本稿では,基礎モデルの汎用的マルチモーダル推論能力を野生でのHOI検出に伝達する,訓練不要なエージェント型フレームワークであるAgenHoIを提案する。
不完全な相互作用発見と複雑な場面におけるあいまいな局所化の課題に対処するために,2つの重要なメカニズムを導入する。
AgentHOIは、リアルタイム設定において、最先端の教師付きおよび弱教師付きメソッドよりも優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-15T14:30:20Z) - Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue [3.1039961644960186]
話し手は、共有コンテキストの信頼性のある表現を維持する必要がある。
現在の会話エージェントは、しばしばこの要件に苦しむ。
本稿では,対話状態を永続的な視覚履歴に変換するアクティブな視覚足場フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-22T23:15:42Z) - Interactive Benchmarks [45.705288760439636]
予算制約下でのインタラクティブなプロセスにおけるモデルの推論能力を評価する統一評価パラダイムであるInteractive Benchmarksを提案する。
このフレームワークを2つの設定でインスタンス化する: 対話的証明(Interactive Proofs) — モデルは判断者と相互作用し、論理と数学の客観的な真実や答えを推論する。
論文 参考訳(メタデータ) (2026-03-05T02:18:26Z) - DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories [52.57197752244638]
本稿では,画像検索を自律探索タスクとして再構成する新しいエージェントパラダイムであるDeepImageSearchを紹介する。
モデルは、暗黙の文脈的手がかりに基づいてターゲットを特定するために、生の視覚履歴に対して多段階の推論を計画し実行しなければならない。
DisBenchは、相互接続された視覚データ上に構築された、挑戦的なベンチマークである。
論文 参考訳(メタデータ) (2026-02-11T12:51:10Z) - Automated Detection of Visual Attribute Reliance with a Self-Reflective Agent [58.90049897180927]
視覚モデルにおける視覚的特徴の意図しない依存を検出するための自動フレームワークを提案する。
自己反射エージェントは、モデルが依存する可能性のある視覚特性に関する仮説を生成し、テストする。
我々は,視覚特性の多様さを示すために設計された130モデルの新しいベンチマークに対して,我々のアプローチを評価した。
論文 参考訳(メタデータ) (2025-10-24T17:59:02Z) - Generalized Visual Relation Detection with Diffusion Models [94.62313788626128]
視覚的関係検出(VRD)は、画像内のオブジェクトペア間の関係(または相互作用)を特定することを目的としている。
本稿では,視覚的関係を連続的な埋め込みとしてモデル化し,一般化されたVRDを条件付き生成方法で実現するための拡散モデルの設計を提案する。
我々のDiff-VRDは、予め定義されたデータセットのカテゴリラベルを超えて、視覚的な関係を生成できる。
論文 参考訳(メタデータ) (2025-04-16T14:03:24Z) - Exploiting Multi-Object Relationships for Detecting Adversarial Attacks
in Complex Scenes [51.65308857232767]
ディープニューラルネットワーク(DNN)をデプロイするビジョンシステムは、敵の例に弱いことが知られている。
近年の研究では、入力データの固有成分のチェックは、敵攻撃を検出するための有望な方法であることが示された。
言語モデルを用いてコンテキスト整合性チェックを行う新しい手法を開発した。
論文 参考訳(メタデータ) (2021-08-19T00:52:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。