論文の概要: ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop
- arxiv url: http://arxiv.org/abs/2607.24770v1
- Date: Tue, 09 Jun 2026 17:56:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.045614
- Title: ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop
- Title(参考訳): ProcAgent:Human-in-the-Loopによるエッジ上の手続き的タスクガイダンスのためのエージェントフレームワーク
- Abstract要約: ProcAgentは、NVIDIA Jetson AGX Orinのリアルタイム適応ガイダンスのための視覚ベースのプロシージャアシスタントである。
ProcAgentは知覚精度,推論,タスクレベルのパフォーマンス,ユーザエクスペリエンスの4つの側面で評価する。
- 参考スコア(独自算出の注目度): 1.4279471205248535
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Procedural tasks such as furniture assembly and home repair impose substantial cognitive demands because users must interpret instructions, track task progress, reason about spatial state, and recover from errors while performing physical actions. Prior multimodal assistants have shown promise for procedural guidance, but most rely on cloud inference and fixed always-on perception, making them poorly suited to privacy-sensitive, latency-critical domestic settings. We present ProcAgent, a fully on-device, agentic, vision-based procedural assistant for real-time adaptive guidances on a single NVIDIA Jetson AGX Orin. ProcAgent uses a propose-and-verify architecture that combines low-latency continuous perception, a symbolic task graph, on-demand vision-language verification, and an LLM-based interaction agent. The system continuously proposes user progress, invokes expensive visual reasoning only when ambiguity or likely deviation arises, and supports both reactive question answering and proactive intervention with human-in-the- loop confirmation. We evaluate ProcAgent along four dimensions: perception accuracy, reasoning, task-level performance, and user experience. Despite running entirely on-device, the system maintains responsive interaction, resolving text-only queries in approximately 2 seconds and visually grounded queries in approximately 8 seconds. In a user study with 10 participants completing assembly tasks, ProcAgent receives positive ratings for comprehensibility, actionability, and privacy comfort. These results show that adaptive procedural assistance can be achieved entirely on edge hardware without sacrificing usability.
- Abstract(参考訳): 家具組立や住宅修理などの手続き的なタスクは、利用者が指示を解釈し、タスクの進捗を追跡し、空間状態の推論を行い、物理的な動作をしながらエラーから回復する必要があるため、かなりの認知的要求を課す。
従来のマルチモーダルアシスタントは手続き的なガイダンスを約束していましたが、ほとんどはクラウド推論に依存しており、常に認識を固定しているため、プライバシに敏感でレイテンシが重要な家庭環境には適していません。
本稿では,一台のNVIDIA Jetson AGX Orin上でのリアルタイム適応誘導のための,完全にオンデバイスでエージェントベースのプロシージャアシスタントであるProcAgentを紹介する。
ProcAgentは低レイテンシ連続認識、シンボリックタスクグラフ、オンデマンド視覚言語検証、LLMベースのインタラクションエージェントを組み合わせた提案と検証アーキテクチャを使用している。
このシステムは、ユーザの進捗を継続的に提案し、曖昧さや逸脱が生じた場合にのみ高価な視覚的推論を起動し、反応性のある質問応答と、ループ内確認に対する積極的な介入の両方をサポートする。
ProcAgentは知覚精度,推論,タスクレベルのパフォーマンス,ユーザエクスペリエンスの4つの側面で評価する。
完全にデバイス上で実行されるにもかかわらず、システムは応答性を維持し、テキストのみのクエリを約2秒で解決し、視覚的にグラウンド化されたクエリを約8秒で処理する。
組み立てタスクを完了した10人の参加者によるユーザスタディにおいて、ProcAgentは、理解性、行動可能性、プライバシーの快適性に関する肯定的な評価を受ける。
これらの結果から, エッジハードウェア上では, ユーザビリティを犠牲にすることなく, 適応的な手続き支援を実現することが可能であることが示唆された。
関連論文リスト
- From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents [56.187590188698955]
大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-03T12:52:04Z) - SWE-Together: Evaluating Coding Agents in Interactive User Sessions [19.069719245971786]
実際のユーザエージェントコーディングセッションから再構成したマルチターンベンチマークであるSWE-Togetherを紹介する。
11,260のセッションから109のリポジトリレベルのタスクをキュレートし、リカバリ可能なレポジトリステートでセッションを選択します。
我々は、元のユーザの意図を保存し、コーディングエージェントの進捗が必要な時にフィードバックを提供する、リアクティブLLMベースのユーザシミュレータを構築します。
論文 参考訳(メタデータ) (2026-06-29T08:35:15Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - DocOS: Towards Proactive Document-Guided Actions in GUI Agents [54.27655693145045]
textbfDocOSは、完全にインタラクティブな環境で文書誘導問題解決を評価するために設計されたベンチマークである。
実験の結果、エージェントはプロアクティブ検索中に関連情報を確実に見つけるのに苦労し、検索した指示を忠実に正確な行動に移すのに失敗することが判明した。
論文 参考訳(メタデータ) (2026-05-18T08:36:04Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - Proactive Rejection and Grounded Execution: A Dual-Stage Intent Analysis Paradigm for Safe and Efficient AIoT Smart Homes [37.92248202525651]
本稿では,低レベルの物理的実行から高レベルのユーザ意図理解を分離するためのDual-Stage Intent-Aware (DS-IA)フレームワークを提案する。
試験の結果、DS-IAは58.56%(ベースラインを28%以上上回る)のエクサクトマッチ(EM)を達成し、無効命令の拒否率を87.04%に改善した。
論文 参考訳(メタデータ) (2026-03-17T07:38:39Z) - Uncertainty-Aware GUI Agent: Adaptive Perception through Component Recommendation and Human-in-the-Loop Refinement [11.63498742723335]
適応認識によってこれらの問題に対処する不確実性認識エージェントである textbfRecAgent を提案する。
知覚の不確実性を低減するため、RecAgentはコンポーネントレコメンデーションメカニズムを採用し、最も関連性の高いUI要素を特定し、フォーカスする。
決定の不確実性のために、インタラクティブなモジュールを使用して、不明瞭な状況でユーザからのフィードバックをリクエストし、意図を認識した決定を可能にする。
論文 参考訳(メタデータ) (2025-08-06T02:38:02Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - YETI (YET to Intervene) Proactive Interventions by Multimodal AI Agents in Augmented Reality Tasks [16.443149180969776]
Augmented Reality (AR)ヘッドウェアは、日々の手続き的なタスクを解く際のユーザエクスペリエンスを一意に改善することができる。
このようなAR機能は、AIエージェントがユーザーのマルチモーダル機能に関連するアクションを見て耳を傾けるのに役立つ。
一方、AIエージェントのプロアクティビティは、人間が観察されたタスクのミスを検出し、修正するのに役立つ。
論文 参考訳(メタデータ) (2025-01-16T08:06:02Z) - Collaborative Instance Object Navigation: Leveraging Uncertainty-Awareness to Minimize Human-Agent Dialogues [54.81155589931697]
協調インスタンスオブジェクトナビゲーション(CoIN)は、エージェントがターゲットインスタンスに関する不確実性を積極的に解決する新しいタスク設定である。
未認識者に対するエージェント・ユーザインタラクション(AIUTA)の新たな学習自由化手法を提案する。
まず、オブジェクト検出時に、セルフクエチオナーモデルがエージェント内で自己対話を開始し、完全かつ正確な観察記述を得る。
インタラクショントリガーモジュールは、人間に質問するか、継続するか、ナビゲーションを停止するかを決定する。
論文 参考訳(メタデータ) (2024-12-02T08:16:38Z) - PrISM-Observer: Intervention Agent to Help Users Perform Everyday Procedures Sensed using a Smartwatch [43.41204564594764]
PrISM-Observerはスマートウォッチベースのコンテキスト対応リアルタイム介入システムで、エラーを防止して日常的なタスクをサポートする。
情報を探さなければならない従来のシステムとは異なり、エージェントはユーザーの行動を観察し、積極的に介入する。
論文 参考訳(メタデータ) (2024-07-23T18:38:07Z) - Tell Me More! Towards Implicit User Intention Understanding of Language
Model Driven Agents [110.25679611755962]
現在の言語モデル駆動エージェントは、しばしば効果的なユーザ参加のメカニズムを欠いている。
Intention-in-Interaction (IN3) は明示的なクエリを通してユーザの暗黙の意図を検査するための新しいベンチマークである。
私たちは、タスクの曖昧さを積極的に評価し、ユーザの意図を問う強力なモデルであるMistral-Interactを経験的に訓練し、それらを実行可能な目標へと洗練させます。
論文 参考訳(メタデータ) (2024-02-14T14:36:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。