論文の概要: AiSearch: Interactive Multi-Modal Search with VLMs
- arxiv url: http://arxiv.org/abs/2610.01389v1
- Date: Thu, 01 Oct 2026 09:56:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.043963
- Title: AiSearch: Interactive Multi-Modal Search with VLMs
- Title(参考訳): AiSearch: VLMを使った対話型マルチモーダル検索
- Abstract要約: AiSearchは、画像やビデオの自然言語検索にビジョン言語モデル(VLM)のゼロショット機能を利用する、柔軟なマルチモーダル検索フレームワークである。
AiSearchは、ユーザの意図に合わせて検索結果を調整するためのユーザフィードバックを通じて、インタラクティブな検索リファインメントをサポートする。
- 参考スコア(独自算出の注目度): 0.815557531820863
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern retrieval systems must both be automated and interactive, allowing users to search and refine results in real time. We present AiSearch, a flexible multimodal retrieval framework that leverages the zero shot capabilities of Vision Language Models (VLMs) for natural language search over images and videos. AiSearch supports interactive search refinement through user feedback to tailor results to the user's intent, and allows visual benchmarking across multiple VLMs, enabling users to select the most suitable model for their task.
- Abstract(参考訳): 現代の検索システムは自動化され、対話的であり、ユーザーはリアルタイムで検索結果を検索および精査することができる。
AiSearchは、視覚言語モデル(VLM)のゼロショット機能を利用して、画像やビデオ上の自然言語検索を行う、柔軟なマルチモーダル検索フレームワークである。
AiSearchは、ユーザのフィードバックによるインタラクティブな検索改善をサポートし、ユーザの意図に合わせて結果を調整し、複数のVLMにわたって視覚的なベンチマークを可能にし、ユーザがタスクに最も適したモデルを選択することができる。
関連論文リスト
- Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models [79.77807330964576]
Vision-DeepResearchシステムは複雑なビジュアルテキストのファクトフィンディングに検索エンジンを使用する。
既存のベンチマークはビジュアル検索中心ではない。
2,000のVQAインスタンスからなるVision-DeepResearchベンチマーク(VDR-Bench)を構築した。
論文 参考訳(メタデータ) (2026-02-02T14:53:11Z) - IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval [36.33423199468626]
対話型ビデオコーパス検索(IVCR)タスクは,ユーザと検索システム間のマルチターン,対話,現実的な対話を可能にする。
IVCR-200Kは高品質、バイリンガル、マルチターン、会話、抽象的なセマンティックデータセットであり、ビデオ検索やモーメント検索もサポートしている。
本稿では,マルチモーダルな大規模言語モデル(MLLM)に基づく包括的フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-01T06:12:59Z) - V-Agent: An Interactive Video Search System Using Vision-Language Models [5.245473886566199]
V-Agentは、高度なビデオ検索と対話型ユーザシステム会話のために設計された、新しいマルチエージェントプラットフォームである。
提案フレームワークは,MultiVENT 2.0ベンチマークで最先端のゼロショット性能を示す。
論文 参考訳(メタデータ) (2025-11-04T07:24:45Z) - DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search [61.77858432092777]
DeepMMSearch-R1は,オンデマンドでマルチターンWeb検索が可能な,最初のマルチモーダルな大規模言語モデルである。
DeepMMSearch-R1は、画像検索をより効果的にするために、入力画像の関連する作物に基づいてWeb検索を開始することができる。
我々は、アプローチの優位性を実証するために、知識集約型ベンチマークを幅広く実施する。
論文 参考訳(メタデータ) (2025-10-14T17:59:58Z) - ABC: Achieving Better Control of Multimodal Embeddings using VLMs [61.396457715710774]
ビジュアル埋め込みモデルは、ビジュアル検索や分類のようなゼロショットタスクで優れている。
これらのモデルは曖昧さやユーザ命令を必要とするタスクには使用できない。
本稿では,視覚言語モデルバックボーンを用いたオープンソースのマルチモーダル埋め込みモデルABCを紹介する。
論文 参考訳(メタデータ) (2025-03-01T03:29:02Z) - Designing Interfaces for Multimodal Vector Search Applications [0.08192907805418582]
マルチモーダルベクトル探索は,従来の語彙検索エンジンでは不可能な多数の機能を公開することで,情報検索の新しいパラダイムを提供する。
本稿では,ユーザによる情報ニーズの表現と,これらのシステムとの効果的なインタラクションを可能にする実装と設計パターンを提案する。
論文 参考訳(メタデータ) (2024-09-18T01:23:26Z) - The Contemporary Art of Image Search: Iterative User Intent Expansion
via Vision-Language Model [4.531548217880843]
画像検索のための革新的なユーザ意図拡張フレームワークを提案する。
本フレームワークは,視覚モデルを用いてマルチモーダルなユーザ入力を解析・構成する。
提案フレームワークは,ユーザの画像検索体験を大幅に改善する。
論文 参考訳(メタデータ) (2023-12-04T06:14:25Z) - LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation,
Generation and Editing [99.80742991922992]
本システムは,マルチモーダルなユーザ入力を受信し,マルチモーダルな応答を生成することで,ユーザとのマルチターン対話を実現する。
LLaVA-Interactiveは言語プロンプトを超えており、視覚的プロンプトは、インタラクションにおける人間の意図を調整するために有効である。
論文 参考訳(メタデータ) (2023-11-01T15:13:43Z) - Large Search Model: Redefining Search Stack in the Era of LLMs [63.503320030117145]
我々は,1つの大言語モデル(LLM)で検索タスクを統一することにより,従来の検索スタックを再定義する,大規模検索モデルと呼ばれる新しい概念的フレームワークを導入する。
全てのタスクは自動回帰テキスト生成問題として定式化され、自然言語のプロンプトを使ってタスクをカスタマイズできる。
提案フレームワークは,LLMの強力な言語理解と推論能力を活用し,既存の検索スタックを簡素化しつつ,検索結果の質を向上させる能力を提供する。
論文 参考訳(メタデータ) (2023-10-23T05:52:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。