論文の概要: Just A Rather Very Intelligent Spoken Agent
- arxiv url: http://arxiv.org/abs/2607.16610v1
- Date: Sat, 18 Jul 2026 03:10:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.195796
- Title: Just A Rather Very Intelligent Spoken Agent
- Title(参考訳): 知能に満ちたエージェント
- Authors: Chen Chen, Zhehuai Chen,
- Abstract要約: 長期的なAIエージェントはますます有能になってきていますが、ユーザとのインタラクションは驚くほど薄くなっています。
このような仲介者は、ユーザとのリアルタイムな対話をサポートし、労働者を邪魔することなく質問に答え、進捗や混乱を積極的に報告し、有用であればエージェントの実行にユーザーガイダンスを注入する必要がある。
モジュラー参照のJarvisプロトタイプを用いてベンチマークをインスタンス化し、OpenClawで実行される34のテキストのみのWildClawタスクで評価する。
- 参考スコア(独自算出の注目度): 14.486707156197156
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon AI agents are becoming increasingly capable, yet their interaction with users remains surprisingly thin. In most workflows, users give an initial instruction, receive only selective textual updates, and lose a clear sense of what the agent is doing or when to step in. This leaves a missing part in the current agent ecosystem: an always-on Jarvis-style mediator that keeps the agent continuously reachable to the user. Such a mediator should support real-time spoken interaction with the user, answer questions without interrupting the worker, proactively report progress or confusion, and inject user guidance back into the agent's execution when useful. In this work, we introduce JarvisBench, a benchmark for measuring the dual value of mediation in long-horizon agent workflows. JarvisBench contains two complementary tracks: an agent-collaboration track that measures whether mediation improves downstream task completion, and a user-interaction track that measures whether mediation makes ongoing execution more understandable, responsive, and accessible to users. We instantiate the benchmark with a modular reference Jarvis prototype and evaluate it on 34 text-only WildClaw tasks executed in OpenClaw. Preliminary results with GPT-5.5, Claude Opus 4.7, Gemini-based, and GPT-based worker agents suggest that Jarvis-style mediation can provide trace-grounded responses to user questions and improve task performance when sparse user guidance is injected at appropriate moments. The results also show that effectiveness depends strongly on the mediator's LLM brain, highlighting both the promise of this missing middle layer and the need for broader community effort. Demo page https://cchen1436.github.io/jarvis
- Abstract(参考訳): 長期的なAIエージェントはますます有能になってきていますが、ユーザとのインタラクションは驚くほど薄くなっています。
ほとんどのワークフローでは、ユーザーは初期命令を与え、選択されたテキスト更新のみを受け取り、エージェントが何をしているか、いつステップインするかを明確に把握できなくなる。
これは現在のエージェントエコシステムに欠けている部分を残している。常にオンになっているJarvisスタイルのメディエータで、エージェントを継続的にユーザにリーチすることができる。
このような仲介者は、ユーザとのリアルタイムな対話をサポートし、労働者を邪魔することなく質問に答え、進捗や混乱を積極的に報告し、有用であればエージェントの実行にユーザーガイダンスを注入する必要がある。
本稿では,長距離エージェントワークフローにおけるメディエーションの二重値を測定するベンチマークであるJarvisBenchを紹介する。
JarvisBenchには2つの補完トラックがある。メディエーションがダウンストリームタスクの完了を改善するかどうかを測定するエージェントコラボレーショントラックと、メディエーションが実行中の実行をより理解しやすく、応答し、アクセスしやすくするユーザインタラクショントラックだ。
モジュラー参照のJarvisプロトタイプを用いてベンチマークをインスタンス化し、OpenClawで実行される34のテキストのみのWildClawタスクで評価する。
GPT-5.5、Claude Opus 4.7、Geminiベース、およびGPTベースのワーカーエージェントによる予備的な結果から、Jarvisスタイルの仲介は、ユーザの質問に対してトレースされた応答を提供し、適切なタイミングでスパースなユーザーガイダンスが注入された場合のタスクパフォーマンスを向上させることを示唆している。
また,メディアのLLM脳に効果が強く依存していることが示唆され,この中間層が欠落していることと,より広いコミュニティの努力の必要性の両方が強調された。
デモページ https://cchen1436.github.io/jarvis
関連論文リスト
- SWE-Together: Evaluating Coding Agents in Interactive User Sessions [19.069719245971786]
実際のユーザエージェントコーディングセッションから再構成したマルチターンベンチマークであるSWE-Togetherを紹介する。
11,260のセッションから109のリポジトリレベルのタスクをキュレートし、リカバリ可能なレポジトリステートでセッションを選択します。
我々は、元のユーザの意図を保存し、コーディングエージェントの進捗が必要な時にフィードバックを提供する、リアクティブLLMベースのユーザシミュレータを構築します。
論文 参考訳(メタデータ) (2026-06-29T08:35:15Z) - SentinelBench: A Benchmark for Long-Running Monitoring Agents [20.69666656998877]
SentinelBenchは、時間進化モニタリングタスクのためのオープンソースのベンチマークである。
メール、カレンダー、ファイナンス、プロフェッショナルネットワーキング、エンターテイメントなど10の合成ウェブ環境に100のタスクがある。
タスク完了、反応時間、リソース使用量を計測し、応答性とコストのトレードオフを明らかにする。
論文 参考訳(メタデータ) (2026-06-03T18:32:00Z) - Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling [64.40340291543971]
我々は,小さなエッジスケールモデルとのリアルタイムインタラクションを実現するための投機的インタラクションエージェントを提案する。
また、ストリーミング入力と非同期応答を処理するためにモデルを適応させるクロックベースのトレーニング手法を提案する。
このアプローチは、Qwen2.5-3B-InstructとLlama-3.2-3B-Instructモデルを複数のツール呼び出しベンチマークで1.6-2.2$times$ Speedupを提供する。
論文 参考訳(メタデータ) (2026-05-13T11:20:52Z) - GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization (V1.0) [56.81743709880371]
Long-Horizon Large Language Model (LLM) エージェントは、コンテキストによって根本的に制限される。
長い水平性能は、文脈長ではなく、有限の文脈予算内で意思決定関連情報がどれだけ維持されているかによって決定される。
我々は、情報密度とコンテキストの1つの原理に基づいて構築された汎用的自己進化型LLMエージェントシステムであるGenericAgent(GA)を提案する。
論文 参考訳(メタデータ) (2026-04-18T17:59:15Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - ReInAgent: A Context-Aware GUI Agent Enabling Human-in-the-Loop Mobile Task Navigation [26.254354188188177]
ReInAgentは、ヒューマン・イン・ザ・ループのモバイルタスクナビゲーションを可能にする、コンテキスト対応のマルチエージェントフレームワークである。
これは、明確で静的なタスク仮定に依存する既存のアプローチの制限を克服する。
真のユーザの好みとより緊密に一致した結果を生み出すのです。
論文 参考訳(メタデータ) (2025-10-09T09:22:05Z) - UserBench: An Interactive Gym Environment for User-Centric Agents [110.77212949007958]
LLM(Large Language Models)ベースのエージェントは、推論とツールの使用において、目覚ましい進歩を遂げてきたが、ユーザと積極的にコラボレーションする能力はまだ未熟である。
マルチターン、選好駆動インタラクションにおいてエージェントを評価するために設計されたユーザ中心のベンチマークであるUserBenchを紹介する。
論文 参考訳(メタデータ) (2025-07-29T17:34:12Z) - Tell Me More! Towards Implicit User Intention Understanding of Language
Model Driven Agents [110.25679611755962]
現在の言語モデル駆動エージェントは、しばしば効果的なユーザ参加のメカニズムを欠いている。
Intention-in-Interaction (IN3) は明示的なクエリを通してユーザの暗黙の意図を検査するための新しいベンチマークである。
私たちは、タスクの曖昧さを積極的に評価し、ユーザの意図を問う強力なモデルであるMistral-Interactを経験的に訓練し、それらを実行可能な目標へと洗練させます。
論文 参考訳(メタデータ) (2024-02-14T14:36:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。