論文の概要: Beyond Scene Description: Multi-Agent Orchestration for Non-visual Access to Virtual Worlds
- arxiv url: http://arxiv.org/abs/2609.14512v1
- Date: Sun, 13 Sep 2026 13:34:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 12:40:38.832485
- Title: Beyond Scene Description: Multi-Agent Orchestration for Non-visual Access to Virtual Worlds
- Title(参考訳): 仮想世界への非視覚的アクセスのためのマルチエージェントオーケストレーション
- Abstract要約: 盲目で視覚障害者(BVI)のユーザーは、それぞれが1つのタスクを分離して解決する補助ツールを所持する。
本稿では,8つの特殊エージェントに非視覚的アクセスを分散するアーキテクチャであるMetaBlindを提案する。
- 参考スコア(独自算出の注目度): 1.6791044863781395
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Virtual worlds now host classrooms, meetings, conferences, shops, and social venues, and nearly every interaction they expose assumes a user who can scan a three-dimensional scene, follow avatars, and read floating panels. Blind and visually impaired (BVI) users are left with assistive tools that each solve one task in isolation: naming an object, reading text, describing a scene, or planning a route. A live virtual room defeats that model: obstacles, speakers, gestures, chat, slides, and notifications arrive together, and a tool that narrates all of them trades a visual barrier for an auditory one. This paper presents MetaBlind, an architecture that distributes nonvisual access across eight specialized agents, spanning perception, navigation, social and object interaction, communication, safety and trust, memory, and personalization, and that places an Accessibility Orchestrator between those agents and the user. Agents publish candidate information into a shared accessibility context instead of speaking to the user directly. The orchestrator scores each candidate on safety relevance, goal relevance, urgency, confidence, user relevance, and estimated listening load, then releases only the items it judges relevant at that moment through speech, structured audio, or haptic output. We give the selection step a formal statement, specify the orchestration cycle as an algorithm, and define an evaluation protocol against a single-agent assistant. MetaBlind is reported at the design stage, with no prototype measurement or user study, and the protocol states which outcomes would support the design and which would refute it.
- Abstract(参考訳): 仮想世界は現在、教室、会議、会議、店舗、そしてソーシャルな会場をホストしており、彼らが公開しているほとんどすべてのインタラクションは、ユーザーが3次元のシーンをスキャンし、アバターをフォローし、フローティングパネルを読み取ることができることを前提としている。
BVI(Blind and visually impaired)のユーザは、オブジェクトの命名、テキストの読み込み、シーンの記述、ルートの計画など、ひとつのタスクを分離して解決する補助ツールを所持する。
障害、スピーカー、ジェスチャー、チャット、スライド、通知が一緒に到着し、それら全てをナレーションするツールが視覚的障壁と聴覚的障壁を交換する。
本稿では,8つの特殊エージェントに非視覚的アクセスを分散するアーキテクチャであるMetaBlindについて述べる。このアーキテクチャは,知覚,ナビゲーション,社会的・オブジェクトのインタラクション,コミュニケーション,安全と信頼,記憶,パーソナライゼーションにまたがるものであり,アクセシビリティオーケストレータをこれらのエージェントとユーザの間に配置する。
エージェントは、ユーザに直接話しかける代わりに、候補情報を共有アクセシビリティコンテキストにパブリッシュする。
オーケストレータは、各候補に対して、安全関連性、目標関連性、緊急性、信頼性、ユーザ関連性、推定リスニング負荷をスコアし、その時点で判断した項目のみを音声、構造化音声、触覚出力を通じてリリースする。
選択ステップに正式なステートメントを与え、オーケストレーションサイクルをアルゴリズムとして指定し、単一エージェントアシスタントに対する評価プロトコルを定義する。
MetaBlindは、プロトタイプの測定やユーザスタディなしで設計段階で報告され、どの結果が設計をサポートするか、どの結果に反するかをプロトコルが記述している。
関連論文リスト
- Rehearsed Multi-Agent Live Product Demonstrations with Real-Time Voice Question Answering [0.06524460254566902]
Rhetorはマルチエージェントシステムであり、セグメント同期ナレーションとリアルタイム音声質問応答を備えたライブデモをリハーサルする。
アーキテクチャのコントリビューションは、UI探索とソースコード分析を融合した、モーダルな機能表現である。
論文 参考訳(メタデータ) (2026-06-29T13:36:51Z) - ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop [1.4279471205248535]
ProcAgentは、NVIDIA Jetson AGX Orinのリアルタイム適応ガイダンスのための視覚ベースのプロシージャアシスタントである。
ProcAgentは知覚精度,推論,タスクレベルのパフォーマンス,ユーザエクスペリエンスの4つの側面で評価する。
論文 参考訳(メタデータ) (2026-06-09T17:56:28Z) - ShowUI-Aloha: Human-Taught GUI Agent [46.35538753446132]
ShowUI-Alohaは、非構造化され、その内部の人間のスクリーン記録を構造化され、実行可能なタスクに変換する。
学習者はこれらの生の相互作用と周囲の視覚的文脈を意味論的に解釈し、それらを記述的な自然言語キャプションに翻訳する。
解析されたデモを読み、タスク状態を維持し、次のハイレベルアクションプランを動的に定式化するプランナー。
論文 参考訳(メタデータ) (2026-01-12T04:04:20Z) - Creating General User Models from Computer Use [53.59999173952482]
本稿では,コンピュータとのインタラクションを観察することでユーザについて学習する汎用ユーザモデル(GUM)のアーキテクチャを提案する。
GUMは、ユーザ(例えばデバイスのスクリーンショット)の非構造化観察を入力として受け取り、ユーザの知識と好みをキャプチャする信頼度重み付け命題を構築する。
論文 参考訳(メタデータ) (2025-05-16T04:00:31Z) - Collaborative Instance Object Navigation: Leveraging Uncertainty-Awareness to Minimize Human-Agent Dialogues [54.81155589931697]
協調インスタンスオブジェクトナビゲーション(CoIN)は、エージェントがターゲットインスタンスに関する不確実性を積極的に解決する新しいタスク設定である。
未認識者に対するエージェント・ユーザインタラクション(AIUTA)の新たな学習自由化手法を提案する。
まず、オブジェクト検出時に、セルフクエチオナーモデルがエージェント内で自己対話を開始し、完全かつ正確な観察記述を得る。
インタラクショントリガーモジュールは、人間に質問するか、継続するか、ナビゲーションを停止するかを決定する。
論文 参考訳(メタデータ) (2024-12-02T08:16:38Z) - Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers [65.51132104404051]
オブジェクトレベルのシーンと対話するために、オブジェクト識別子とオブジェクト中心表現を導入する。
我々のモデルは、ScanRefer、Multi3DRefer、Scan2Cap、ScanQA、SQA3Dなど、既存のベンチマーク手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2023-12-13T14:27:45Z) - CAVEN: An Embodied Conversational Agent for Efficient Audio-Visual
Navigation in Noisy Environments [41.21509045214965]
CAVENは、エージェントが音声目標にナビゲートするタスクを解決するためのヒューマン/オーラルと対話することのできるフレームワークである。
以上の結果から,我々の全会話的アプローチは,成功率のオーダー・オブ・マグニチュード改善にほぼ寄与していることがわかった。
論文 参考訳(メタデータ) (2023-06-06T22:32:49Z) - VATLM: Visual-Audio-Text Pre-Training with Unified Masked Prediction for
Speech Representation Learning [119.49605266839053]
VATLM (Visual-Audio-Text Language Model) を用いたクロスモーダル表現学習フレームワークを提案する。
提案したVATLMは、モダリティに依存しない情報をモデル化するために、統一されたバックボーンネットワークを使用する。
これら3つのモダリティを1つの共有セマンティック空間に統合するために、VATLMは統一トークンのマスク付き予測タスクで最適化される。
論文 参考訳(メタデータ) (2022-11-21T09:10:10Z) - VCSE: Time-Domain Visual-Contextual Speaker Extraction Network [54.67547526785552]
本稿では,VCSEという2段階の時間領域視覚コンテキスト話者抽出ネットワークを提案する。
第1段階では、視覚的手がかりで対象音声を事前抽出し、基礎となる音声系列を推定する。
第2段階では、事前抽出されたターゲット音声を自己学習した文脈的手がかりで洗練する。
論文 参考訳(メタデータ) (2022-10-09T12:29:38Z) - Unsupervised active speaker detection in media content using cross-modal
information [37.28070242751129]
テレビ番組や映画などのメディアコンテンツにおけるアクティブな話者検出のためのクロスモーダルな教師なしフレームワークを提案する。
音声と顔の話者識別情報を活用し, アクティブな話者検出を音声-顔の割り当てタスクとして定式化する。
最先端の完全教師付き手法に対する競合性能を示す。
論文 参考訳(メタデータ) (2022-09-24T00:51:38Z) - COBE: Contextualized Object Embeddings from Narrated Instructional Video [52.73710465010274]
そこで本稿では,教師ビデオの自動書き起こしからコンテキスト適応型オブジェクト埋め込みを学習するための新しいフレームワークを提案する。
言語の意味的・構成的構造を視覚的検知器を訓練し,オブジェクトとその関連するナレーションの文脈的単語埋め込みを予測する。
実験の結果,検出器は多種多様なコンテキストオブジェクト情報を予測し,少数ショットおよびゼロショット学習の設定において極めて有効であることがわかった。
論文 参考訳(メタデータ) (2020-07-14T19:04:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。