論文の概要: Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists
- arxiv url: http://arxiv.org/abs/2607.18514v1
- Date: Mon, 20 Jul 2026 21:14:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.245266
- Title: Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists
- Title(参考訳): マルチモーダル科学論文をAIで検索する: 盲人、低視力、目に見える科学者の実践と嗜好
- Abstract要約: ブラインドまたはロービジョン(BLV)の科学者は伝統的に、紙の中の数字にアクセスするための静的な代替テキストに依存してきた。
人工知能(AI)の台頭は、対話型質問応答(QA)を視覚探索の可能なパラダイムにした。
我々は、さまざまなSTEM分野の5人のBLVと5人の視覚科学者にインタビューし、ChatGPTとGeminiという2つのAIツールを使ってマルチモーダルな科学文書をクエリする方法について理解した。
- 参考スコア(独自算出の注目度): 19.90873686121111
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual diagrams, figures, and tables are central to scientific papers, and convey information beyond what is captured in text. While blind or low-vision (BLV) scientists have traditionally relied on static alternative text to access figures in papers, the rise of artificial intelligence (AI) has made interactive question-answering (QA) a feasible paradigm for visual exploration; yet little is known about how scientists use visual QA in practice or how to improve its accessibility. In this work, we interview five BLV and five sighted scientists across different STEM fields to understand how they use two AI tools, ChatGPT and Gemini, to query multimodal scientific documents. Our findings characterize how scientists review multimodal content, including existing practices (along with accessibility workarounds) for engaging with visuals, and feedback on the suitability of AI-generated responses to multimodal queries. We further find that vague or incomplete image descriptions, as well as incorrect AI outputs more broadly, can cause both BLV and sighted scientists to abandon AI workflows. To support future research, we additionally contribute a dataset of 115 queries and responses from our participants' interactions with the AI tools for papers in their field. We close by discussing implications for AI-powered scientific QA systems, emphasizing considerations for access across abilities and domains.
- Abstract(参考訳): 図表、図、表は科学論文の中心であり、テキストでキャプチャされたものを超えて情報を伝達する。
ブラインドまたはロービジョン(BLV)の科学者は伝統的に紙の数字にアクセスするための静的な代替テキストを頼りにしてきたが、人工知能(AI)の台頭により、インタラクティブな質問回答(QA)が視覚的な探索の可能なパラダイムとなった。
本研究では、さまざまなSTEM分野の5人のBLVと5人の視覚科学者にインタビューを行い、ChatGPTとGeminiという2つのAIツールを使ってマルチモーダルな科学文書をクエリする方法について理解した。
本研究は,AI生成によるマルチモーダルクエリに対する応答の適合性に対するフィードバックを含む,既存手法(アクセシビリティ回避策)を含む,マルチモーダルコンテンツに対する科学者のレビュー方法の特徴である。
さらに、曖昧で不完全な画像記述や、より広い範囲でAI出力が不正確であることは、BLVと視覚科学者の両方にAIワークフローを放棄させる可能性があることを発見しています。
今後の研究を支援するため、研究分野における論文のためのAIツールとのインタラクションから、115のクエリとレスポンスのデータセットも提供します。
AIを活用した科学的なQAシステムへの影響について議論し、能力とドメインを越えたアクセスに関する考慮を強調します。
関連論文リスト
- Explainable AI for Blind and Low-Vision Users: Navigating Trust, Modality, and Interpretability in the Agentic Era [0.9741676285072485]
盲目と低視野(BLV)のユーザにとって、アクセス可能な説明の欠如は、AI駆動型補助技術の独立した使用に対する根本的な障壁となっている。
本稿では,ユーザインタビューと現代研究の総合的な分析を通じて,BLVコミュニティのユニークなXAI要件について検討する。
BLVのユーザは会話の説明を高く評価する一方で、AIの失敗に対して“自己認識”を頻繁に経験している、という実証的な証拠がある。
論文 参考訳(メタデータ) (2026-03-31T19:39:52Z) - Research Paradigm of Materials Science Tetrahedra with Artificial Intelligence [7.779425241736052]
我々は、データ駆動型とAI強化型の研究を刺激する2つの新しい研究パラダイムを提案する。
1つは、物質科学のためのAIに焦点を当て、マター・データ・ポテンシャル・アジェント図を考える。
もうひとつは、データ-アーキテクチャ-推論-推論の関係について議論することで、AI研究を実証する。
論文 参考訳(メタデータ) (2026-03-14T04:30:03Z) - Accelerating Scientific Research with Gemini: Case Studies and Common Techniques [105.15622072347811]
大規模言語モデル(LLM)は、科学研究を加速するための新たな道を開いた。
先進的なAIモデルとどのように協力したかを示すケーススタディのコレクションを提示する。
論文 参考訳(メタデータ) (2026-02-03T18:56:17Z) - AI4X Roadmap: Artificial Intelligence for the advancement of scientific pursuit and its future directions [65.44445343399126]
我々は、生物学、化学、気候科学、数学、材料科学、物理学、自動運転研究所、非伝統的コンピューティングにまたがるAI可能な科学を考察する。
多様な信頼性のあるデータの必要性、伝達可能な電子構造と原子間モデル、AIシステムがエンドツーエンドの科学合成に統合される。
ドメイン全体にわたって、大規模な基礎モデル、アクティブラーニング、自動運転車研究所が、予測と検証の間のループを閉じる方法について強調する。
論文 参考訳(メタデータ) (2025-11-26T02:10:28Z) - Advancing AI Research Assistants with Expert-Involved Learning [84.30323604785646]
大規模言語モデル (LLM) と大規模マルチモーダルモデル (LMM) は、生物医学的な発見を促進することを約束するが、その信頼性は未定である。
ARIEL(AI Research Assistant for Expert-in-the-Loop Learning)は,オープンソースの評価・最適化フレームワークである。
LMMは詳細な視覚的推論に苦しむのに対し、最先端のモデルでは流動性はあるが不完全な要約を生成する。
論文 参考訳(メタデータ) (2025-05-03T14:21:48Z) - AI-in-the-loop: The future of biomedical visual analytics applications in the era of AI [3.0942901747200975]
データ分析におけるAIの大規模開発は、将来のデータ視覚化とビジュアル分析をどう形成するか?
ますます強力なAIの文脈における機会、オープンな課題、脅威とは何か?
我々は、バイオメディカルビジュアライゼーションを研究分野として変革するAIの可能性を強調した。
論文 参考訳(メタデータ) (2024-12-20T13:27:24Z) - SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers [43.18330795060871]
SPIQAは、科学研究論文の文脈内で複雑な図形や表を解釈するために設計されたデータセットである。
データセット作成には自動および手動のキュレーションを使用します。
SPIQAは270Kの質問をトレーニング、検証、3つの異なる評価分割に分割する。
論文 参考訳(メタデータ) (2024-07-12T16:37:59Z) - Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI [116.8199519880327]
人工知能(Embodied AI)は、人工知能(AGI)の実現に不可欠である
本調査では,Embodied AIの最近の進歩を包括的に調査する。
論文 参考訳(メタデータ) (2024-07-09T14:14:47Z) - MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding [59.41495657570397]
本稿では,72の科学分野をカバーするNature Communicationsの記事からまとめられた包括的データセットについて述べる。
2つのベンチマークタスク(図のキャプションと複数選択)で19のプロプライエタリモデルとオープンソースモデルを評価し,人手による注釈を行った。
タスク固有データを用いた細調整Qwen2-VL-7Bは、GPT-4oや人間の専門家でさえも、マルチチョイス評価において優れた性能を示した。
論文 参考訳(メタデータ) (2024-07-06T00:40:53Z) - Virtual Reality for Understanding Artificial-Intelligence-driven
Scientific Discovery with an Application in Quantum Optics [1.0858565995100633]
我々は、AI生成ソリューションの理解を深めるために、分析プロセスの一部を没入型バーチャルリアリティ環境に移行する方法を示す。
我々は,抽象グラフの解釈可能な構成を見つけるためのVRの有用性を実証し,量子光学実験を表現する。
論文 参考訳(メタデータ) (2024-02-20T17:48:01Z) - Multimodal Lecture Presentations Dataset: Understanding Multimodality in
Educational Slides [57.86931911522967]
学習内容のマルチモーダル理解における機械学習モデルの能力を検証する。
このデータセットには,180時間以上のビデオと9000時間以上のスライドが,各科目から10人の講師が参加している。
マルチモーダル・トランスフォーマーであるPolyViLTを導入する。
論文 参考訳(メタデータ) (2022-08-17T05:30:18Z) - Empowering Things with Intelligence: A Survey of the Progress,
Challenges, and Opportunities in Artificial Intelligence of Things [98.10037444792444]
AIがIoTをより速く、より賢く、よりグリーンで、より安全にするための力を与える方法を示します。
まず、認識、学習、推論、行動の4つの視点から、IoTのためのAI研究の進歩を示す。
最後に、私たちの世界を深く再形成する可能性が高いAIoTの有望な応用をいくつかまとめる。
論文 参考訳(メタデータ) (2020-11-17T13:14:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。