論文の概要: Homebot: A Personal AI Agent for Conversational Home Assistance and Automation
- arxiv url: http://arxiv.org/abs/2608.02254v1
- Date: Mon, 03 Aug 2026 14:01:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.5873
- Title: Homebot: A Personal AI Agent for Conversational Home Assistance and Automation
- Title(参考訳): Homebot: 会話型ホームアシストと自動化のためのパーソナルAIエージェント
- Authors: Shengyuan Ye, Yixin Zhang, Han Liang, Liekang Zeng, Jiangsu Du, Mu Yuan,
- Abstract要約: textttHomebotは、会話による家庭支援と自動化のための、ローカルにデプロイ可能なAIエージェントである。
言語モデル応答と登録ツール、タスク固有のスキルを組み合わせた共有ランタイムを通じて、音声およびインスタントメッセージ要求を受け入れる。
- 参考スコア(独自算出の注目度): 28.651717218095015
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: \texttt{Homebot} is a locally deployable AI agent for conversational household assistance and automation. It accepts voice and instant-messaging requests through a shared runtime that combines language-model responses with registered tools and task-specific skills. The design separates common request processing from session ownership: messaging history remains scoped to a channel and chat, whereas voice interaction is bounded by wake-word activation. For hands-free use, \texttt{Homebot} combines local wake-word detection, streaming speech recognition and synthesis, and an explicit dialogue-state protocol for ending, following up, or continuing a conversation. Clear channel, tool, and skill contracts support practical customization for household use.
- Abstract(参考訳): \texttt{Homebot}は、会話による家庭支援と自動化のための、ローカルにデプロイ可能なAIエージェントである。
言語モデル応答と登録ツール、タスク固有のスキルを組み合わせた共有ランタイムを通じて、音声およびインスタントメッセージ要求を受け入れる。
メッセージ履歴はチャネルとチャットの範囲に留まり、ボイスインタラクションはウェイクワードのアクティベーションによって制限される。
ハンズフリーでは、ローカルなウェイクワードの検出、音声認識と合成、会話の終了、フォローアップ、継続のための明示的な対話状態プロトコルを組み合わせる。
クリアチャネル、ツール、およびスキル契約は、家庭での使用のための実用的なカスタマイズをサポートする。
関連論文リスト
- VIBEVOICE-ASR Technical Report [95.57263110940973]
VibeVoice-ASRは、ロングフォームオーディオにおけるコンテキスト断片化とマルチスピーカー複雑性の課題に対処する。
50以上の言語をサポートし、明示的な言語設定を必要としない。
論文 参考訳(メタデータ) (2026-01-26T06:11:51Z) - Cloning a Conversational Voice AI Agent from Call\,Recording Datasets for Telesales [0.0]
通話記録のコーパスから会話音声AIエージェントをクローンする手法を提案する。
我々のシステムは電話で顧客に耳を傾け、合成音声で応答し、トップパフォーマンスの人間エージェントから学んだ構造化されたプレイブックに従う。
本発明のクローン化剤は、導入、製品コミュニケーション、販売ドライブ、異物処理、閉店を含む22の基準で、人為的エージェントに対して評価される。
論文 参考訳(メタデータ) (2025-09-05T07:36:12Z) - X-TURING: Towards an Enhanced and Efficient Turing Test for Long-Term Dialogue Agents [56.64615470513102]
チューリングテストは、自然言語の会話においてAIが人間のような振る舞いを示すかどうかを調べる。
従来の設定では、各参加者は一度に1つのメッセージに制限される。
本稿では,textitburstダイアログパターンを用いて,元のテストを強化するtextbftextscX-Turingを提案する。
論文 参考訳(メタデータ) (2024-08-19T09:57:28Z) - Voice Recognition Robot with Real-Time Surveillance and Automation [0.0]
本稿では,Android アプリケーションを用いて入力音声信号を対応するテキストに変換する音声認識システムを提案する。
テキストメッセージはBluetooth経由で送信され、通信プラットフォームとして機能する。
本稿では,音声認識のリアルタイム監視・自動化への応用を拡張し,障害物検出・回避機構を取り入れた。
論文 参考訳(メタデータ) (2023-12-07T06:31:04Z) - FurChat: An Embodied Conversational Agent using LLMs, Combining Open and
Closed-Domain Dialogue with Facial Expressions [6.710740803770234]
本研究では,アクセプティストとして機能し,表情とともにオープンドメインとクローズドドメインの対話を混合して生成できる具体的会話エージェントを実演する。
このシステムをFurhatロボットにデプロイし、対話中に言語と非言語の両方の手がかりを利用できるようにした。
論文 参考訳(メタデータ) (2023-08-29T11:08:40Z) - CAMEL: Communicative Agents for "Mind" Exploration of Large Language
Model Society [58.04479313658851]
本稿では,コミュニケーションエージェント間の自律的協調を支援するスケーラブルな手法の構築の可能性について検討する。
本稿では,ロールプレイングという新しいコミュニケーションエージェントフレームワークを提案する。
コントリビューションには、新しいコミュニケーティブエージェントフレームワークの導入、マルチエージェントシステムの協調行動や能力を研究するためのスケーラブルなアプローチの提供などが含まれます。
論文 参考訳(メタデータ) (2023-03-31T01:09:00Z) - End-to-end Spoken Conversational Question Answering: Task, Dataset and
Model [92.18621726802726]
音声による質問応答では、システムは関連する音声書き起こしの中に連続したテキストスパンからの質問に答えるように設計されている。
本稿では,複雑な対話フローをモデル化することを目的とした音声対話型質問応答タスク(SCQA)を提案する。
本研究の目的は,音声記録に基づく対話型質問に対処するシステムを構築することであり,情報収集システムによる様々なモダリティからより多くの手がかりを提供する可能性を探ることである。
論文 参考訳(メタデータ) (2022-04-29T17:56:59Z) - Experiences with the Introduction of AI-based Tools for Moderation
Automation of Voice-based Participatory Media Forums [0.5243067689245634]
我々は、空白またはノイズの多い音声をフィルタリングするAIツールを導入し、音声認識を使ってテキストで音声メッセージを書き起こし、自然言語処理技術を使って音声書き起こしからメタデータを抽出する。
本稿では,これらのツールの導入による時間とコスト削減の点から,AIベースの自動化のワークフローへの受容性に対するモデレーターのフィードバックについて述べる。
我々の研究は、いくつかのルーチンタスクの自動化にAIを使用する場合のケーススタディを形成しており、特に、発展途上国における音声技術の使用に関わる他の研究者や実践者には特に関係がある。
論文 参考訳(メタデータ) (2021-08-09T17:50:33Z) - Towards Data Distillation for End-to-end Spoken Conversational Question
Answering [65.124088336738]
音声対話型質問応答タスク(SCQA)を提案する。
SCQAは,音声発話とテキストコーパスから複雑な対話の流れをモデル化することを目的としている。
我々の主な目的は、音声とテキストの両方で会話的な質問に対処するQAシステムを構築することである。
論文 参考訳(メタデータ) (2020-10-18T05:53:39Z) - Multimodal Transformer with Pointer Network for the DSTC8 AVSD Challenge [48.905496060794114]
第8回対話システム技術チャレンジのAVSDトラックへの提出について述べる。
入力ビデオのテキスト機能と非テキスト機能を組み合わせるために,ドット商品の注意を取り入れた。
自動測定では高い性能を達成し, 人的評価では5位, 6位となった。
論文 参考訳(メタデータ) (2020-02-25T06:41:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。