論文の概要: A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models
- arxiv url: http://arxiv.org/abs/2605.31080v1
- Date: Fri, 29 May 2026 09:47:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.521894
- Title: A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models
- Title(参考訳): 小型視覚言語モデルを用いた盲人・低ビジョン聴取者に対するキュレーターガイドによる多言語アート記述の試み
- Abstract要約: ブラインドとロービジョン(BLV)の観客は、視覚芸術の描写によって守られていない。
パイロットスタディは、ドイツ語、ルーマニア語、セルビア語のためのQwen2.5-VL-3B-インストラクトを用いたキュレーター誘導多言語アート記述について研究している。
- 参考スコア(独自算出の注目度): 50.00033296815133
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Blind and low-vision (BLV) audiences remain underserved by visual art descriptions, particularly across languages and in museum settings where privacy and intellectual-property constraints may favour small on-premise vision-language models (VLMs). This pilot study investigates curator-guided multilingual art description with Qwen2.5-VL-3B-Instruct for German, Romanian, and Serbian. We construct a parallel BLV-oriented caption corpus from artwork images and metadata, and compare language-specific LoRA adapters with a single multilingual adapter under a fixed backbone and training budget. Evaluation combines automatic lexical and embedding-based metrics with an LLM-as-Judge protocol calibrated against a small Romanian BLV pilot study. Under our pilot setup, language-specific adapters show more stable controllability and visually grounded description quality for Romanian and Serbian, while multilingual adaptation remains competitive in German. We frame these findings as deployment-oriented evidence for small on-premise VLMs, and highlight the need for larger BLV user studies and broader language coverage before drawing general conclusions about multilingual accessibility.
- Abstract(参考訳): ブラインドとロービジョン(BLV)のオーディエンスは、視覚芸術の記述、特にプライバシーと知的財産権の制約が小さなオンプレミスの視覚言語モデル(VLM)を好むような、言語や博物館の環境では、いまだに不足している。
このパイロットスタディは、ドイツ語、ルーマニア語、セルビア語のためのQwen2.5-VL-3B-インストラクトを用いて、キュレーターによる多言語アートの記述を調査する。
言語固有のLoRAアダプタを,固定されたバックボーンとトレーニング予算の下で,単一の多言語対応アダプタと比較し,BLV指向のパラレルキャプションコーパスを構築した。
評価は、自動語彙と埋め込みに基づくメトリクスと、小さなルーマニアのBLVパイロットスタディに対して校正されたLSM-as-Judgeプロトコルを組み合わせる。
パイロット設定では、言語固有のアダプタは、ルーマニア語とセルビア語でより安定した制御性と視覚的に基礎的な記述品質を示す一方、多言語適応はドイツ語で競争力のあるままである。
我々は,これらの知見を,小規模なオンプレミスVLMのデプロイメント指向の証拠として捉え,多言語アクセシビリティに関する一般的な結論を導き出す前に,より大きなBLVユーザスタディと広範な言語カバレッジの必要性を強調した。
関連論文リスト
- TowerVision: Understanding and Improving Multilinguality in Vision-Language Models [56.775118098058506]
TowerVisionは、画像テキストとビデオテキストの両方のためのオープンな多言語視覚言語モデルである。
微調整中に視覚的、文化的コンテキストを取り入れることで、私たちのモデルは既存のアプローチを超えます。
さらなる研究を支援するため、すべてのモデル、データ、トレーニングレシピを公開しています。
論文 参考訳(メタデータ) (2025-10-22T17:02:48Z) - Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models [44.159383734605456]
異文化間コミュニケーションにおけるメニュー翻訳の重要な役割を強調する特化評価フレームワークを提案する。
MOTBenchは、それぞれの料理を正確に認識し翻訳するLVLMと、その価格とメニュー上のユニットアイテム、そして正確な人間のアノテーションを必要とする。
我々のベンチマークは中国語と英語のメニューのコレクションで構成されており、複雑なレイアウト、さまざまなフォント、さまざまな言語にまたがる文化的に特定の要素、そして正確な人間のアノテーションが特徴である。
論文 参考訳(メタデータ) (2025-04-16T03:08:57Z) - A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning [27.350370419751385]
リモートセンシング画像キャプチャー(Remote Sensing Image Captioning、RSIC)は、リモートセンシング画像における特徴やシーンの自然言語記述を自動的に生成することを目的とした、クロスプラットフォームの視野と言語である。
非英語記述データセットの不足とモデルに対する多言語能力評価の欠如という2つの重要な課題が続いている。
本稿では,68,170のバイリンガルキャプションと組み合わせた13,634枚の画像を含む,3つの確立した英語RSICデータセットを中国語記述で強化した包括的バイリンガルデータセットであるBRSICを紹介し,分析する。
論文 参考訳(メタデータ) (2025-03-06T16:31:34Z) - MVL-SIB: A Massively Multilingual Vision-Language Benchmark for Cross-Modal Topical Matching [19.13134780850277]
MVL-SIBは,205言語にまたがるクロスモーダルおよびテキストのみのトピックマッチングを評価する多言語視覚ベンチマークである。
以上の結果から,LVLM は低リソース言語ではクロスモーダルなトピックマッチングに苦慮し,N'Koo などの言語ではチャンスに劣らない性能を示した。
論文 参考訳(メタデータ) (2025-02-18T13:40:05Z) - ICU: Conquering Language Barriers in Vision-and-Language Modeling by
Dividing the Tasks into Image Captioning and Language Understanding [1.9906814758497542]
ICUは、V&Lタスクを2段階に分割する: V&Lモデルが英語で画像キャプションを行い、マルチ言語モデル(mLM)がそのキャプションをaltテキストとして取り、言語間理解を行う。
ICUは5つの言語に対して新しい最先端の結果が得られ、残りの言語では同等の結果が得られることを示す。
論文 参考訳(メタデータ) (2023-10-19T07:11:48Z) - Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task
Instruction Tuning [27.544311403607786]
バイリンガルな大規模視覚言語モデル(LVLM)の集合であるZiya-Visualシリーズを紹介する。
我々のモデルは BLIP-2 から Querying Transformer を採用し,最適化手法のさらなる支援を探求している。
さらに,多モーダルシナリオにおけるGPT-4の理解能力を刺激し,収集した英語画像テキストデータセットを中国語に翻訳する。
論文 参考訳(メタデータ) (2023-10-12T09:39:17Z) - mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMs [50.17767479660832]
視覚言語モデル(Vision-LLMs)は、事前訓練された画像エンコーダを(凍結した)大型言語モデル(LLMs)とポストホック条件LLMsに整合させ、画像入力を理解する。
我々は,マルチ言語LLMを利用した最初のビジョン-LLMであるmBLIPを,コンシューマレベルのハードウェア上で計算的に効率よく提供する。
論文 参考訳(メタデータ) (2023-07-13T17:51:58Z) - Democratizing LLMs for Low-Resource Languages by Leveraging their English Dominant Abilities with Linguistically-Diverse Prompts [75.33019401706188]
大規模言語モデル(LLM)は、少数の例を単純に観察することで、効果的にタスクを実行することが知られている。
我々は,LLMが任意の言語から英語に翻訳するよう促すために,多種多様な高ソース言語から合成例を組み立てることを提案する。
我々の教師なしプロンプト法は、英語と13のIndic言語と21のアフリカ低リソース言語間の翻訳において、異なる大きさのLLMにおける教師付き少ショット学習と同等に機能する。
論文 参考訳(メタデータ) (2023-06-20T08:27:47Z) - Generalizing Multimodal Pre-training into Multilingual via Language
Acquisition [54.69707237195554]
英語のVision-Language Pre-Trainingは、様々な下流タスクで大きな成功を収めた。
この成功を英語以外の言語に一般化するために、Multilingual Vision-Language Pre-Trainingを通じていくつかの取り組みがなされている。
単言語視覚言語事前学習モデルを多言語に容易に一般化できるtextbfMultitextbfLingual textbfAcquisition (MLA) フレームワークを提案する。
論文 参考訳(メタデータ) (2022-05-29T08:53:22Z) - Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense
Spatiotemporal Grounding [75.03682706791389]
新しいビジョン・アンド・ランゲージ・ナビゲーション(VLN)データセットであるRoom-Across-Room(RxR)を紹介する。
RxRは多言語(英語、ヒンディー語、テルグ語)で、他のVLNデータセットよりも大きい(パスと命令がより多い)。
これはVLNにおける言語の役割を強調し、パスにおける既知のバイアスに対処し、可視化されたエンティティへのより多くの参照を引き出す。
論文 参考訳(メタデータ) (2020-10-15T18:01:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。