論文の概要: Overreliance on AI in Information-seeking from Video Content
- arxiv url: http://arxiv.org/abs/2603.19843v1
- Date: Fri, 20 Mar 2026 10:38:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.109921
- Title: Overreliance on AI in Information-seeking from Video Content
- Title(参考訳): 映像コンテンツからの情報検索におけるAIの過信
- Authors: Anders Giovanni Møller, Elisa Bassignana, Francesco Pierri, Luca Maria Aiello,
- Abstract要約: ビデオからの情報検索において,生成AIが精度,効率,信頼性にどのように影響するかを検討する。
本研究は,AIによる映像情報検索における基本的安全性リスクを明らかにする。
- 参考スコア(独自算出の注目度): 4.692076243895479
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The ubiquity of multimedia content is reshaping online information spaces, particularly in social media environments. At the same time, search is being rapidly transformed by generative AI, with large language models (LLMs) routinely deployed as intermediaries between users and multimedia content to retrieve and summarize information. Despite their growing influence, the impact of LLM inaccuracies and potential vulnerabilities on multimedia information-seeking tasks remains largely unexplored. We investigate how generative AI affects accuracy, efficiency, and confidence in information retrieval from videos. We conduct an experiment with around 900 participants on 8,000+ video-based information-seeking tasks, comparing behavior across three conditions: (1) access to videos only, (2) access to videos with LLM-based AI assistance, and (3) access to videos with a deceiving AI assistant designed to provide false answers. We find that AI assistance increases accuracy by 3-7% when participants viewed the relevant video segment, and by 27-35% when they did not. Efficiency increases by 10% for short videos and 25% for longer ones. However, participants tend to over-rely on AI outputs, resulting in accuracy drops of up to 32% when interacting with the deceiving AI. Alarmingly, self-reported confidence in answers remains stable across all three conditions. Our findings expose fundamental safety risks in AI-mediated video information retrieval.
- Abstract(参考訳): マルチメディアコンテンツの多様さは、特にソーシャルメディア環境において、オンライン情報空間を変革している。
同時に、検索は生成AIによって急速に変化しており、大きな言語モデル(LLM)が情報を取得して要約するために、ユーザとマルチメディアコンテンツの間の仲介者として日常的にデプロイされている。
影響が増大しているにもかかわらず、LLMの不正確さと潜在的な脆弱性がマルチメディア情報検索タスクに与える影響は、未解明のままである。
ビデオからの情報検索において,生成AIが精度,効率,信頼性に与える影響について検討する。
我々は、(1)ビデオのみへのアクセス、(2)LLMベースのAIアシストによるビデオへのアクセス、(3)誤った回答を提供するように設計されたAIアシスタントによるビデオへのアクセス、の3つの条件で、約900人の参加者を対象に、8000以上のビデオベースの情報検索タスクについて実験を行った。
その結果、参加者が関連するビデオセグメントを見た場合、AIアシストは精度を3~7%向上し、そうでない場合、27~35%向上した。
短いビデオでは効率が10%向上し、長いビデオでは25%向上する。
しかし、参加者はAIのアウトプットを過度に評価する傾向にあり、AIと対話する場合、精度は最大32%低下する。
驚くべきことに、答えに対する自己申告された自信は3つの条件すべてにわたって安定している。
本研究は,AIによる映像情報検索における基本的安全性リスクを明らかにする。
関連論文リスト
- Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning [66.51617619673587]
AI生成ビデオにおける人間の知覚可能な視覚的アーティファクトを識別する,特殊な大規模言語モデル(MLLM)であるSkyraを紹介する。
この目的を達成するために、我々は、人間のアノテーションを微粒化した最初の大規模AI生成ビデオデータセットである、Supervised Fine-Tuning (SFT)のためのViF-CoT-4Kを構築した。
次に,モデルの時間的知覚,説明能力,検出精度を体系的に向上する2段階のトレーニング戦略を開発する。
論文 参考訳(メタデータ) (2025-12-17T18:48:26Z) - Modeling Human Responses to Multimodal AI Content [10.65875439980452]
MhAIMデータセットには154,552のオンラインポストが含まれている(うち111,153がAI生成)
私たちの人間による研究は、投稿にテキストとビジュアルの両方が含まれている場合、人々はAIコンテンツを特定するのがより優れていることを示している。
マルチモーダル情報に予測応答を組み込むことにより,ユーザの問い合わせに応答するエージェントシステムであるT-Lensを提案する。
論文 参考訳(メタデータ) (2025-08-14T15:55:19Z) - Leveraging Pre-Trained Visual Models for AI-Generated Video Detection [54.88903878778194]
ビデオ生成の分野はDeepFakesを超えて進歩し、ジェネリックコンテンツでAI生成ビデオを検出する方法が緊急に必要になった。
本稿では,事前学習した視覚モデルを用いて,実写映像と実写映像を区別する手法を提案する。
提案手法は, 平均90%以上で高い検出精度を達成し, その有効性を裏付けるものである。
論文 参考訳(メタデータ) (2025-07-17T15:36:39Z) - Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding [60.88843818016968]
長時間のビデオ理解は時間空間の複雑さと質問応答の難しさによって大きな課題を呈する。
セグメント化されたビデオクリップ上でのエージェント検索戦略を活用するために,Deep Video Discovery (DVD) エージェントを提案する。
当社のDVDエージェントは,LVBenchデータセット上での最先端性能を実現し,74.2%の精度を実現した。
論文 参考訳(メタデータ) (2025-05-23T16:37:36Z) - Open-Ended and Knowledge-Intensive Video Question Answering [20.256081440725353]
知識集約型ビデオ質問応答 (KI-VideoQA) を多モード検索拡張世代のレンズを用いて検討する。
本稿では,最先端の検索モデルと視覚言語モデルを用いて,様々な検索拡張手法について検討する。
我々は、KnowIT VQAデータセットにおいて、複数の選択質問に対する精度を17.5%向上させる。
論文 参考訳(メタデータ) (2025-02-17T12:40:35Z) - Generative Ghost: Investigating Ranking Bias Hidden in AI-Generated Videos [106.5804660736763]
ビデオ情報検索は、ビデオコンテンツにアクセスするための基本的なアプローチである。
我々は,検索モデルがアドホックや画像検索タスクにおいて,AI生成コンテンツに好適であることを示す。
我々は、ビデオ検索に挑戦する文脈において、同様のバイアスが出現するかどうかを考察する。
論文 参考訳(メタデータ) (2025-02-11T07:43:47Z) - What Else Do I Need to Know? The Effect of Background Information on
Users' Reliance on QA Systems [23.69129423040988]
本研究では,予測に十分な情報がない場合のQAシステムとのインタラクションについて検討する。
本研究は,モデルの正しさを評価するのに十分な情報がない場合でも,利用者がモデル予測に頼っていることを明らかにした。
論文 参考訳(メタデータ) (2023-05-23T17:57:12Z) - Toward Accurate Person-level Action Recognition in Videos of Crowded
Scenes [131.9067467127761]
我々は、シーンの情報を完全に活用し、新しいデータを集めることで、アクション認識を改善することに集中する。
具体的には、各フレームの空間的位置を検出するために、強い人間の検出器を採用する。
そして、行動認識モデルを適用して、HIEデータセットとインターネットから多様なシーンを持つ新しいデータの両方でビデオフレームから時間情報を学ぶ。
論文 参考訳(メタデータ) (2020-10-16T13:08:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。