論文の概要: AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
- arxiv url: http://arxiv.org/abs/2607.15367v1
- Date: Thu, 16 Jul 2026 18:09:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.678574
- Title: AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
- Title(参考訳): AnovaX: LLMプランニング、型付きエクササイズ、適応リカバリを備えたローカルマルチエージェント音声アシスタント
- Abstract要約: AnovaXは、ユーザのコンピュータ上で完全に動作する、ローカルファーストの小さなアシスタントである。
すべてのツールは、独自のリトライポリシーと共有リソースロックを持つ特別なエージェントクラスに対応する。
コンパニオンサーバは、ローカルWiFi上で電話フレンドリーなリモコンを公開する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Desktop voice assistants are still dominated by cloud pipelines that ship raw audio off the machine and expose a fixed set of skills. We describe AnovaX, a small local-first assistant that runs entirely on the user's computer and treats the desktop itself as its action surface. A single Python process wires together a wake-word gate, a speech pipeline, an LLM planner (Gemini) that emits a JSON plan of tool calls, a whitelist-and-denylist safety layer, a multi-agent orchestrator that translates each plan into typed child agents on a bounded thread pool, and an adaptive recovery loop that takes over whenever a core step fails. Every tool corresponds to a specialized agent class (AppAgent, TypingAgent, BrowserAgent and six others) with its own timeout, retry policy, and shared-resource locks. A recursive MetaAgent lets the planner delegate a sub-goal back to itself, capped at two levels of nesting. The recovery loop uses a compact ReAct-style prompt and hides Gemini's latency behind speculative execution of read-only tools. A companion Flask server exposes a phone-friendly remote over the local WiFi, mirrors every agent lifecycle event to the phone in real time, and streams the laptop's screen back over MJPEG so the user can watch remote commands land as they run. The point of the project is less to compete with Siri or Alexa than to show that a legible, few-thousand-line assistant is enough to open apps, type into them, run searches, coordinate concurrent actions, recover from single-step failures, and be driven entirely from a phone in another room -- without the LLM ever touching the keyboard.
- Abstract(参考訳): デスクトップの音声アシスタントは依然として、マシンから生のオーディオを出荷し、一定のスキルセットを公開するクラウドパイプラインに支配されている。
ユーザのコンピュータ上で完全に動作し,デスクトップ自体をアクションサーフェスとして扱う,ローカルファーストの小型アシスタントであるAnovaXについて説明する。
単一のPythonプロセスは、ウェイクワードゲート、音声パイプライン、ツールコールのJSONプランを出力するLMプランナ(Gemini)、ホワイトリストとデニリストのセーフティレイヤ、各プランを有界スレッドプール上の型付けされた子エージェントに変換するマルチエージェントオーケストレータ、コアステップが失敗するたびに実行する適応リカバリループを接続する。
すべてのツールは、独自のタイムアウト、リトライポリシ、共有リソースロックを備えた特別なエージェントクラス(AppAgent、TypingAgent、BrowserAgentなど6つ)に対応する。
再帰的なMetaAgentは、プランナーが2レベルのネストでキャップされたサブゴールを自身に委譲することを可能にする。
リカバリループはコンパクトなReActスタイルのプロンプトを使用しており、読み取り専用ツールの投機的実行に遅れを隠している。
Flaskサーバは、ローカルWiFi上で電話フレンドリーなリモコンを公開し、すべてのエージェントライフサイクルイベントをリアルタイムでスマートフォンにミラーし、ラップトップの画面をMJPEGでストリームすることで、ユーザは実行中にリモートコマンドがランディングされるのを見ることができる。
プロジェクトのポイントは、SiriやAlexaと競合することではなく、正真正銘で数行のアシスタントが、キーボードに触れることなく、アプリを開き、入力し、検索を実行し、同時動作を調整し、シングルステップの障害から回復し、他の部屋の電話から完全に駆動されることを示すことだ。
関連論文リスト
- FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production [55.71860113185132]
本稿では,タスク中心のマルチエージェントフレームワークであるFRAMEWORKERSを紹介した。
Central Directorは、ビデオ生成を動的タスク管理として定式化し、タスクスタックを継続的に編集して、次にどのサブタスクを実行するか、どのサブエージェントを呼び出すかを決定する。
アシスタントは実行層として機能し、選択した各タスクを共有ワークスペースに接地し、必要なアセットとコンテキストを検索し、割り当てられたサブエージェントを呼び出し、結果のアーティファクトを永続化する。
FRAMEWORKERSは、ルーティング精度において強いプランナーよりも優れ、実行時の障害から確実に回復し、目に見えないサブに一般化することを示した。
論文 参考訳(メタデータ) (2026-08-30T14:28:50Z) - AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace [2.650689617442372]
AgentRoomは、並列コーディングエージェントのためのリアルタイム協調編集プロトコルである。
ファイルレベルのクレーム、ステータス、およびCRDTマージされたレイヤ上でMPPツールとしてブロードキャストされる。
CLI-stableモデルの場合、2つのエージェントを持つAgentRoomは、Soloよりも少ないタスクを放棄し、実行時のバリエーションを少なくする。
論文 参考訳(メタデータ) (2026-08-24T18:28:33Z) - TypeGo: An OS Runtime for Embodied Agents [2.9912913279642908]
大規模言語モデル(LLM)は、自然言語からのエンボディエージェントの振る舞いを計画することができる。
我々は、エンボディされたエージェントのためのオペレーティングシステムスタイルのランタイムを論じ、このアイデアを初期のプロトタイプであるTypeGoでインスタンス化する。
論文 参考訳(メタデータ) (2026-07-06T15:47:34Z) - ESAA-Conversational: An Event-Sourced Memory Layer for Continuity, Handoff, and Curation Across Heterogeneous LLM Coding Agents [0.0]
本稿ではイベントソーシングエージェントアーキテクチャ(ESAA)のドメインであるemphA-contextalを提案する。
異種エージェントが直接エージェント対エージェントチャネルを使わずに共有ログを介して協調できることを示し、一方、公開ディストリビューションはプライベートな会話履歴を除外してプライバシを保存する。
570件の開発-ラブイベントによる自己参照ケーススタディでは、異種エージェントが直接エージェント対エージェントチャネルを使わずに共有ログを通じて協力できる一方で、公開ディストリビューションはプライベートな会話履歴を除外してプライバシを保存する。
論文 参考訳(メタデータ) (2026-06-22T01:02:24Z) - Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Agents [0.6345523830122165]
大規模言語モデル(LLM)エージェントは、要求応答アシスタントから長期実行中のソフトウェアアクターへと進化している。
本稿では,LLMエージェントのためのライブラリOSをベースとしたランタイム基板であるAgens libOSを提案する。
論文 参考訳(メタデータ) (2026-06-02T16:53:24Z) - Multi-Agent Computer Use [72.79887808312706]
我々はマルチエージェント・コンピュータ・ユース(MACU)システムの評価・構築に向けて進むべきであると論じる。
本稿では、マネージャモデルがコンピュータ使用タスクを有向非巡回グラフ(DAG)として分解する汎用マルチエージェント構成を提案する。
各イテレーションで、マネージャは並列CUAサブエージェントをディスパッチし、DAGの準備ができているフロンティアでノードを実行する。
論文 参考訳(メタデータ) (2026-06-01T01:29:36Z) - AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning [51.50063777258973]
CVR(Cross-Video Reasoning)は、マルチモーダルインテリジェンスにおいて重要なフロンティアとして登場した。
本稿では,CVRを積極的なエビデンス獲得タスクとして扱うマルチエージェントフレームワークであるAgentCVRを提案する。
論文 参考訳(メタデータ) (2026-05-28T09:09:41Z) - Deterministic Replay for AI Agent Systems [0.0]
大規模な言語モデルを外部ツールやAPIと組み合わせるAIエージェントシステムは本質的に非決定論的である。
既存の可観測性プラットフォームは実行ログをキャプチャするが、独立して実行を再現することはできない。
エージェント実行の決定論的リプレイのための開発者ファーストのCLIフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-30T12:00:45Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reuse [14.413401094877122]
LLMに基づくエージェントの自己進化に関する最近の研究は、主にテキストのプロンプトやリフレクションとして成功した経験を記録している。
本稿では,タスクソリューションを実行可能なサブエージェントコードとして保存する,新たな自己進化パラダイムであるAgentFactoryを提案する。
保存されたサブエージェントは、標準化されたドキュメントを備えた純粋なPythonコードであり、任意のPython対応システム間で移植性を実現する。
論文 参考訳(メタデータ) (2026-03-18T17:58:25Z) - HearthNet: Edge Multi-Agent Orchestration for Smart Homes [5.081228499547384]
HearthNetは、スマートホームのためのエッジマルチエージェントオーケストレーションシステムである。
コンテキスト、実行履歴を外部化し、計画、検証、承認、動作を分離する。
プロトタイプはコモディティエッジハードウェアとAndroidデバイスで動作します。
論文 参考訳(メタデータ) (2026-03-16T15:29:37Z) - LongVideoAgent: Multi-Agent Reasoning with Long Videos [69.28914905197426]
本稿では,主LLMが問題関連セグメントの局所化のために接地エージェントをコーディネートするマルチエージェントフレームワークと,対象とするテキスト観察を抽出する視覚エージェントを提案する。
マスターエージェントは、ステップ制限で計画し、簡潔で正確で効率的なマルチエージェント協調を促進するために強化学習で訓練されている。
テレビQA/TVQA+から集約したエピソードレベルのデータセットであるLongTVQAとLongTVQA+では,マルチエージェントシステムは強力な非エージェントベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-12-23T18:59:49Z) - UFO2: The Desktop AgentOS [60.317812905300336]
UFO2はWindowsデスクトップ用のマルチエージェントAgentOSで、実用的なシステムレベルの自動化に発展している。
我々は、20以上の現実世界のWindowsアプリケーションに対してUFO2を評価し、従来のCUAよりもロバスト性および実行精度を大幅に改善した。
我々の結果は、ディープOSの統合によって、信頼性の高いユーザ指向のデスクトップ自動化へのスケーラブルな道が開けることを示している。
論文 参考訳(メタデータ) (2025-04-20T13:04:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。