論文の概要: Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach
- arxiv url: http://arxiv.org/abs/2607.01115v1
- Date: Wed, 01 Jul 2026 16:03:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.979762
- Title: Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach
- Title(参考訳): 大学学生のためのマルチモーダルチャットアシスタントの開発に向けて:RAGに基づくアプローチ
- Abstract要約: 既存のルールベースのチャットボットは、複雑なドメイン固有のクエリを扱うことができず、進化する制度的なポリシーに適応するには十分な装備がない。
検索機能付きマルチモーダル大学チャットボットを提案する。
FastAPIで構築されたスケーラブルなバックエンドには、Next.jsで開発された応答性推論が付属しており、リアルタイムのユーザビリティを保証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: University stakeholders often face difficulties in accessing timely and reliable information, especially in developing countries, where there are very few intelligent support systems. Existing rule-based chatbots are unable to handle complex, domain-specific queries and are not well-equipped to adapt to evolving institutional policies. As a fill-in-the-gap solution, we present the multimodal university chatbot with retrieval-augmented generation. The system combines the large language model with semantic retrieval to produce context-based responses from institution-centric resources, such as the university handbook. The system accepts text and image queries through the vision-language model and applies quantized inference for rapid deployment on constrained hardware. A scalable backend built with FastAPI, adjoined with a responsive frontend developed with Next.js, ensures real-time usability. Our multimodal evaluation demonstrates that the system maintains strong satisfaction scores across both text and image queries, despite increased response time for visual inputs. Furthermore, quantitative evaluation shows that hallucination is reduced from 31.7% to 6.6% in our proposed RAG-based system, confirming the effectiveness of retrieval grounding.
- Abstract(参考訳): 大学関係者は、特に知的支援システムが非常に少ない発展途上国において、タイムリーで信頼できる情報にアクセスするのに困難に直面していることが多い。
既存のルールベースのチャットボットは、複雑なドメイン固有のクエリを扱うことができず、進化する制度的なポリシーに適応するには十分な装備がない。
マルチモーダル・ユニバーシティ・チャットボットは,マルチモーダル・イン・ザ・ギャップ・ソリューションである。
このシステムは、大規模言語モデルと意味検索を組み合わせて、大学ハンドブックのような機関中心のリソースからコンテキストベースの応答を生成する。
このシステムは、視覚言語モデルを通してテキストと画像のクエリを受け取り、制約のあるハードウェアへの迅速な展開に量子化推論を適用する。
FastAPIで構築されたスケーラブルなバックエンドには、Next.jsで開発された応答性のあるフロントエンドが付属しており、リアルタイムのユーザビリティを保証する。
我々のマルチモーダル評価は,視覚入力に対する応答時間の増加にもかかわらず,テキストと画像の問合せに対して高い満足度を保っていることを示す。
さらに,提案したRAGシステムでは,幻覚が31.7%から6.6%に減少し,検索接地の有効性が確認された。
関連論文リスト
- ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering [54.72902502486611]
ReAG(Reasoning-Augmented Multimodal RAG)は、粗い部分ときめ細かい部分の検索と、無関係な通路をフィルタリングする批評家モデルを組み合わせた手法である。
ReAGは従来の手法よりも優れており、解答精度が向上し、検索された証拠に根ざした解釈可能な推論を提供する。
論文 参考訳(メタデータ) (2025-11-27T19:01:02Z) - RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering [50.42577862494645]
本稿では,RAG-IG(Retrieval-Augmented Generation)に基づくインターリーブドジェネレーション(Interleaved Generation)の課題を評価するためのベンチマークであるRAG-IGBenchを提案する。
RAG-IGは、MLLM(Multimodal large language model)と検索機構を統合し、モデルがコヒーレントなマルチモーダルコンテンツを生成するための外部画像テキスト情報にアクセスできるようにする。
論文 参考訳(メタデータ) (2025-10-11T03:06:39Z) - Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage [66.67531241554546]
従来のASR-LLM-TTSパイプラインに代わる強力な対話システムとして、エンドツーエンドの音声対話システムが登場している。
本稿では,音声入力システムに直接ツールの使用を拡張するための最初のアプローチを紹介する。
提案するStreaming Retrieval-Augmented Generation (Streaming RAG) は,ユーザ音声と並行してツールクエリを予測することにより,ユーザ知覚のレイテンシを低減する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-02T14:18:20Z) - Test-Time Scaling Strategies for Generative Retrieval in Multimodal Conversational Recommendations [70.94563079082751]
電子商取引は、複雑なマルチターンユーザーインタラクションを管理する上で、伝統的な製品検索システムの限界を明らかにしている。
本稿では,対話型マルチモーダル製品検索にテスト時間スケーリングを導入する新しいフレームワークを提案する。
提案手法は生成型レトリバー上に構築され,さらに検索精度の向上と,対話を通してユーザ意図の進化と結果の整合性を向上するテストタイムリグレード機構が組み込まれている。
論文 参考訳(メタデータ) (2025-08-25T15:38:56Z) - Developing Visual Augmented Q&A System using Scalable Vision Embedding Retrieval & Late Interaction Re-ranker [0.0]
本稿では,視覚検索プロセスのスケーラビリティと効率を向上するための実用的アプローチを,性能品質を損なうことなく検討する。
本稿では,広く採用されているハイブリッド検索(メタメタと埋め込み)と,遅延インタラクションリランカの状態を利用して,最適なマッチングページを検索する多段階カスタム実装を提案する。
論文 参考訳(メタデータ) (2025-07-16T16:27:05Z) - UniConv: Unifying Retrieval and Response Generation for Large Language Models in Conversations [71.79210031338464]
会話における大規模言語モデルに対する高密度検索と応答生成の統一方法を示す。
目的の異なる共同微調整を行い、不整合リスクを低減するための2つのメカニズムを設計する。
5つの対話型検索データセットの評価は、我々の統合モデルがタスクを相互に改善し、既存のベースラインより優れていることを示す。
論文 参考訳(メタデータ) (2025-07-09T17:02:40Z) - From Query to Explanation: Uni-RAG for Multi-Modal Retrieval-Augmented Learning in STEM [35.20687923222239]
We developed a lightweight, efficient multi-modal search module called Uni-Retrieval。
クエリスタイルのプロトタイプを抽出し、継続的に更新されたPrompt Bankのトークンと動的にマッチする。
このPrompt Bankは、Mixture-of-Expert Low-Rank Adaptation (MoE-LoRA)モジュールを利用して、ドメイン固有の知識を符号化し、保存する。
元のUni-Retrievalをコンパクトな命令調整言語モデルと統合し、Uni-RAGという完全検索拡張生成パイプラインを形成する。
論文 参考訳(メタデータ) (2025-07-05T02:44:38Z) - Hybrid AI for Responsive Multi-Turn Online Conversations with Novel Dynamic Routing and Feedback Adaptation [2.4830284216463]
本稿では,RAGとインテントベースの缶詰応答を統合した新しいハイブリッドフレームワークを提案する。
本フレームワークでは,対話コンテキストマネージャを用いて,マルチターンインタラクションにおけるコヒーレンスを保証し,インテントを洗練するためのフィードバックループを組み込む。
実験結果から,提案手法は高い精度 (95%) と低レイテンシ (180ms) のバランスが得られた。
論文 参考訳(メタデータ) (2025-06-02T17:59:27Z) - Beyond Retrieval: Joint Supervision and Multimodal Document Ranking for Textbook Question Answering [3.6799953119508735]
本稿では,意味表現を拡張化するためのメカニズムを導入することで,マルチモーダルな教科書質問応答手法を提案する。
我々のモデルであるJETRTQA(Joint Embedding Training With Ranking Supervision for Textbook Question Answering)は、検索ジェネレータアーキテクチャ上に構築されたマルチモーダル学習フレームワークである。
本手法をCK12-QAデータセット上で評価し,情報化文書と無関係文書の識別を著しく改善することを示す。
論文 参考訳(メタデータ) (2025-05-17T13:23:54Z) - An Interactive Multi-modal Query Answering System with Retrieval-Augmented Large Language Models [21.892975397847316]
本稿では,新たに開発したマルチモーダル検索フレームワークとナビゲーショングラフインデックスを用いて,対話型マルチモーダルクエリ・アンサーリング(MQA)システムを提案する。
MQAの特筆すべき点は、異なるモダリティの重要性を評価するために、コントラスト学習を利用することである。
本システムは,計算プルーニング技術を用いて改良した,先進的なナビゲーショングラフインデックスによる効率的な検索を実現する。
論文 参考訳(メタデータ) (2024-07-05T02:01:49Z) - Large Language Models for Information Retrieval: A Survey [83.75872593741578]
情報検索は、項ベースの手法から高度なニューラルモデルとの統合へと進化してきた。
近年の研究では、大規模言語モデル(LLM)を活用してIRシステムの改善が試みられている。
LLMとIRシステムの合流点を探索し、クエリリライト、リトリバー、リランカー、リーダーといった重要な側面を含む。
論文 参考訳(メタデータ) (2023-08-14T12:47:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。