論文の概要: VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- arxiv url: http://arxiv.org/abs/2607.06374v1
- Date: Tue, 07 Jul 2026 15:11:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.570982
- Title: VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- Title(参考訳): VaseMuseum:古代ギリシアの陶器のデジタルインテリジェントミュージアム
- Abstract要約: 視覚言語モデル(VLM)は、3Dデジタル化と自然言語のアーティファクト探索を結びつけてインタラクティブなデジタルミュージアムを実現する。
本稿では,古代ギリシア陶器の知的デジタル博物館のための軽量でモジュール型のマルチモーダルエージェントフレームワークであるVaseMuseumを提案する。
VaseMuseumは、2Dイメージと3Dアーティファクトの両方をサポートし、マルチモーダル認識、3D認識推論、外部知識検索、推論時の信頼性制御を行う。
- 参考スコア(独自算出の注目度): 38.77202832325029
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-language models (VLMs) have made interactive digital museums increasingly feasible by connecting 3D digitization with natural-language artifact exploration. However, in cultural heritage domains such as ancient Greek pottery, reliable VLM assistance is limited by two challenges. First, open-ended interpretation requires grounding fine-grained 2D/3D visual evidence in specialized curatorial knowledge, yet the retrieval process may introduce weak sources and unverifiable references. Second, when the available evidence is incomplete, noisy, or ambiguous, VLMs often produce confident but unsupported answers instead of calibrated uncertainty. To address these challenges, we propose VaseMuseum, a lightweight and modular multimodal agent framework for intelligent digital museums of ancient Greek pottery. VaseMuseum combines an interactive virtual museum with VaseAgent, which supports both 2D images and 3D artifacts through multimodal perception, 3D-aware reasoning, external knowledge retrieval, and inference-time reliability control. Specifically, VaseAgent retrieves evidence from authoritative web and museum knowledge sources, and source-level control selects diverse and verifiable evidence before generation. Meanwhile, response-level control checks generated claims against the evidence pool and encourages neutral, evidence-bounded answers when support is insufficient or conflicting. Moreover, a training-free GRPO-style selection mechanism favors responses with valid references and calibrated confidence without updating the VLM backbone. Experiments in a realistic digital museum simulation show that VaseMuseum improves citation validity, reduces hallucinations on knowledge-intensive queries, and produces more neutral answers under ambiguity compared with search-enabled VLM baselines.
- Abstract(参考訳): 視覚言語モデル(VLM)は、3Dデジタル化と自然言語のアーティファクト探索を結びつけてインタラクティブなデジタルミュージアムを実現する。
しかしながら、古代ギリシアの陶器のような文化遺産の領域では、信頼性の高いVLM援助は2つの課題によって制限されている。
第一に、オープンエンドの解釈は、専門のカリキュラム知識において、きめ細かい2D/3Dの視覚的証拠を基礎づけることを必要とするが、検索プロセスは、弱い情報源と検証不可能な参照を導入する可能性がある。
第二に、利用可能な証拠が不完全、うるさい、曖昧である場合、VLMは不確実性を校正する代わりに、自信はあるが支持しない回答をしばしば生み出す。
これらの課題に対処するため、古代ギリシアの陶器の知的デジタル博物館のための軽量でモジュラーなマルチモーダルエージェントフレームワークであるVaseMuseumを提案する。
VaseMuseumは、インタラクティブな仮想博物館とVaseAgentを組み合わせることで、マルチモーダル認識、3D認識推論、外部知識検索、推論時の信頼性制御を通じて、2Dイメージと3Dアーティファクトの両方をサポートする。
具体的には、VaseAgentは権威あるWebや博物館の知識ソースから証拠を回収し、ソースレベルの制御は生成前に多様で検証可能な証拠を選択する。
一方、応答レベルのコントロールは、エビデンスプールに対するクレームを生成し、サポートが不十分あるいは矛盾している場合、中立的でエビデンスに縛られた回答を奨励する。
さらに、トレーニング不要なGRPOスタイルの選択機構は、VLMバックボーンを更新することなく、有効な参照とキャリブレーションされた信頼性で応答を優先する。
リアルなデジタルミュージアムのシミュレーション実験では、VaseMuseumは引用の妥当性を改善し、知識集約的なクエリに対する幻覚を減らし、検索可能なVLMベースラインと比較してあいまいさの下でより中立な回答を生成する。
関連論文リスト
- The Living Library: Transforming Archival Collections into Conversational Knowledge Systems -- Lessons from the Theodore Roosevelt Presidential Library [0.9389625764981288]
リビング図書館はセオドア・ルーズベルト大統領図書館で開発・展開された。
このフレームワークは、デジタル化とコーパス生成、AIによる処理、検索と推論、オプションで具体化された会話インターフェイスの4つのレイヤで構成されている。
本研究では,Talk to TRの運用から学んだ教訓を公開展示として紹介し,アーカイブコレクションを信頼できる対話体験に変換するための伝達可能なモデルを提案する。
論文 参考訳(メタデータ) (2026-09-08T19:01:22Z) - ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs [16.622300148265275]
TriExは、整列されたアーティファクトでシーケンシャルな意思決定を行う、トリビュー説明可能性フレームワークである。
本稿では,TriExにより,説明の忠実さ,信念のダイナミクス,評価者の信頼性をスケーラブルに分析できることを示す。
論文 参考訳(メタデータ) (2026-04-21T22:55:57Z) - Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems [52.83669998269706]
テキストのみの設定で研究されてきたが、まだマルチモーダルに探索されていない。
現在のベンチマークでは、未解決性を無視するか、現実的な障害モードを見逃す粗末なメソッドに依存している。
MM-AQAは、2つの軸に沿った変換によって解答不能なインスタンスを解答可能なインスタンスから構築するベンチマークである。
論文 参考訳(メタデータ) (2026-04-16T09:23:22Z) - VaseVQA-3D: Benchmarking 3D VLMs on Ancient Greek Pottery [14.993425622341917]
VaseVQA-3Dデータセットは古代ギリシアの陶器分析のための最初の3次元視覚質問応答データセットとして機能する。
我々はさらにVaseVLMモデルを開発し、ドメイン適応学習によるVaseアーチファクト解析におけるモデル性能を向上させる。
論文 参考訳(メタデータ) (2025-10-06T04:28:39Z) - Breaking Down Monocular Ambiguity: Exploiting Temporal Evolution for 3D Lane Detection [79.98605061363999]
単眼3次元車線検出は,前頭側視像(FV)から車線の3次元位置を推定することを目的としている。
既存の手法は、単一フレーム入力の固有のあいまいさによって制約される。
車両が移動するときにシーンの時間的進化に埋め込まれたリッチな情報を解放することを提案する。
論文 参考訳(メタデータ) (2025-04-29T08:10:17Z) - Understanding Museum Exhibits using Vision-Language Reasoning [52.35301212718003]
博物館は、様々なエポック、文明、地域の文化遺産や歴史的遺物の保管所として機能している。
ドメイン固有モデルは、インタラクティブなクエリ解決と歴史的洞察を得るために不可欠である。
世界中の展示品に対して,65万枚の画像と2億枚の質問回答ペアの大規模なデータセットを収集し,キュレートする。
論文 参考訳(メタデータ) (2024-12-02T10:54:31Z) - MOHO: Learning Single-view Hand-held Object Reconstruction with
Multi-view Occlusion-Aware Supervision [75.38953287579616]
ハンドヘルドオブジェクト再構成のためのハンドオブジェクトビデオから,多視点オクルージョン対応監視を利用する新しいフレームワークを提案する。
このような設定において、手による排他と対象の自己排他という2つの主要な課題に対処する。
HO3D と DexYCB のデータセットを用いた実験では、2D のMOHO が 3D の教師付き手法に対して大きなマージンで優れた結果を得ることが示された。
論文 参考訳(メタデータ) (2023-10-18T03:57:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。