論文の概要: DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
- arxiv url: http://arxiv.org/abs/2609.03423v1
- Date: Thu, 03 Sep 2026 06:28:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.945946
- Title: DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
- Title(参考訳): DuplexSpeechBench-IFEval:フルダブルプレックス音声エージェントによるインシシデントインストラクションの評価
- Abstract要約: 6つのリアルタイム音声システムを用いて, 実時間床の付着度を測定した。
アーキテクチャに依存したトレードオフを見つけます。
GPT-Realtime, Mini-o Duplex, Fun-Audio-Chatはペルソナ一貫性のあるコンテンツに強く固執する。
- 参考スコア(独自算出の注目度): 67.07361089429757
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Full-duplex voice agents must continuously decide when to listen, backchannel, interrupt, handle speech overlaps, take the floor, and yield. Existing benchmarks largely test these behaviors through explicit turn-management instructions, while deployed agents are often configured through roles or personas from which the appropriate conversational behavior must be inferred. We introduce DuplexSpeechBench-IFEval (DSB-IFEval) for evaluating implicit instruction-following in real-time spoken interaction. (DSB-IFEval) comprises 1,038 test cases spanning eight diverse assistant roles and evaluates five conditioning protocols for instruction-following: default behavior, explicit behavioral instructions, persona-implied behavior, combined persona--rule conditioning, and instruction conflict. We measure real-time floor management using a deterministic Instruction Adherence Score (IAS) and persona-consistent content using LLM-judged Persona Adherence Score (PAS). Across six real-time speech systems, we find architecture-dependent trade-offs. Full duplex models like F-Actor and PersonaPlex are more sensitive to whether conversational behavior is stated explicitly or must be inferred from a persona, with adherence dropping by 9.7% and 4.5%, respectively, under persona-only conditioning. In contrast, GPT-Realtime, MiniCPM-o, and Fun-Audio-Chat strongly adhere to persona-consistent content, but their floor behavior does not adapt across explicit and persona-only instructions and remains constrained on several proactive actions. We further find that even if systems reliably follow conflicting directives to their prescribed persona, they still struggle to override them under safety conflict. These results show that inferring the behavior implied by a role, executing it at the appropriate conversational moment, and resolving competing instructions remain distinct challenges for full-duplex voice agents.
- Abstract(参考訳): フル二重音声エージェントは、いつ聞くか、バックチャネル、割り込み、音声重複の処理、床の取り出し、収量を決定する必要がある。
既存のベンチマークは、これらの振る舞いを明示的なターン管理命令を通じてテストするが、デプロイされたエージェントは、適切な会話動作を推論しなければならない役割やペルソナによって構成されることが多い。
本研究では,DuplexSpeechBench-IFEval (DSB-IFEval) を導入し,実時間音声対話における暗黙的な指示追従の評価を行う。
(DSB-IFEval)は、8つのアシスタントロールにまたがる1,038のテストケースで構成され、デフォルト動作、明示的な行動指示、ペルソナ実装された振る舞い、ペルソナとルールの組み合わせ、命令競合の5つの条件付けプロトコルを評価する。
LLM-judged Persona Adherence Score (PAS) を用いて, 決定論的インストラクション・アジェンススコア(IAS)とペルソナ一貫性コンテンツを用いてリアルタイムフロアマネージメントを測定した。
6つのリアルタイム音声システムにまたがって,アーキテクチャに依存したトレードオフを見出す。
F-アクターやペルソナプレックスのようなフルデュプレックスモデルは、対人行動が明示されているか、あるいはペルソナから推論されなければならないかに敏感であり、パーソナのみの条件下でそれぞれ9.7%と4.5%の順応性が低下する。
対照的に、GPT-Realtime、MiniCPM-o、Fun-Audio-Chatはペルソナ一貫性のある内容に強く依存するが、それらのフロアの振る舞いは明示的およびペルソナのみの指示に適応せず、いくつかのプロアクティブな行動に制約されている。
さらに、もしシステムが所定のペルソナに対する矛盾する指示を確実に従っていても、安全上の対立の下ではそれらを覆すのに苦労しているということもわかりました。
これらの結果から,ロールによって示唆される行動の推測,適切な会話瞬間における実行,競合する指示の解決は,フル二重音声エージェントでは相変わらず困難であることが示唆された。
関連論文リスト
- The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In [0.9558392439655014]
大規模言語モデル (LLMs) は、金融、医療、精神保健支援における高額な相互作用をますます仲介する。
プロバイダ側のアライメントは有害なコンテンツをブロックしますが、通信上のデフォルトを安定化します。
通信形態に対するプロバイダ制御の観測可能な指標として,迅速なステアビリティとレグレッション・トゥ・デフォルト(regressive-to-default)が示されている。
論文 参考訳(メタデータ) (2026-06-06T13:36:37Z) - Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions? [28.523326410588492]
これは、会話ポリシーがアプリケーションによって異なる現実世界のデプロイメントにおいて重要なことです。
6つの最先端のフルシステムは、ターンマネジメントに続く命令にかなりのギャップがあることが示される: 最良のモデルは64.4%のみである。
これらの知見は, 管理システム構築における重要な方向性として, 指示追従型ターンマネジメントを確立した。
論文 参考訳(メタデータ) (2026-05-15T03:02:09Z) - PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue [8.78029839113787]
本稿では,対話エージェントの迅速なプロトタイピングと評価を行うための,オープンソースのWebプラットフォームであるPersonaKitを提案する。
我々は,PersonaKitが次世代音声エージェントの複雑な社会言語行動を研究するためのエンドツーエンドのフレームワークを提供することを示す。
論文 参考訳(メタデータ) (2026-05-07T11:00:03Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - Facet-Level Persona Control by Trait-Activated Routing with Contrastive SAE for Role-Playing LLMs [6.715533531385597]
Role-Playing Agents (RPAs) におけるパーソナリティコントロールは、トレーニング不要の手法によって一般的に達成される。
本稿では,Big Five 30-facetモデルに適合する顔レベルの人格制御ベクトルを学習するSparse AutoEncoderフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-22T12:39:02Z) - Persistent Personas? Role-Playing, Instruction Following, and Safety in Extended Interactions [11.415343473837583]
パーソナ指定の大規模言語モデル(LLM)は、教育、医療、社会デマグラフィーシミュレーションなどの領域で使用されている。
本研究では,長期の対話と評価データセットを組み合わせた評価プロトコルを導入し,対話条件付きベンチマークを作成する。
対話の過程でペルソナの忠実度は低下し,特に目標志向の会話では低下することがわかった。
論文 参考訳(メタデータ) (2025-12-14T17:27:02Z) - Learning Steerable Clarification Policies with Collaborative Self-play [67.67872810596839]
不明瞭なクエリを処理するために、AIアシスタントは不確実性を管理するためのポリシーが必要である。
我々は,この不確実性を管理するために,自己再生を用いて評価可能な政策を訓練することを提案する。
このことが、提供されたコストに応じて予測可能な振る舞いを変更する、評価可能なポリシーにつながることを示す。
論文 参考訳(メタデータ) (2025-12-03T18:49:54Z) - One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework [51.50565654314582]
大規模言語モデルは、複数のトピックにまたがる対話を通して、ユーザの指示に従うことができる。
既存のベンチマークは、しばしば一定回数のターンに制限されるため、飽和の影響を受けにくく、ユーザのインタラクティブなエクスペリエンスを考慮できない。
マルチターン命令追従能力を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T14:39:59Z) - Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning [52.07170679746533]
大規模言語モデル(LLM)は、セラピー、教育、社会的役割プレイといったインタラクティブな環境において、人間のユーザをシミュレートするためにますます使われています。
LLM生成対話におけるペルソナの一貫性の評価と改善のための統一的なフレームワークを提案する。
我々は3つの自動メトリクス、即行一貫性、行間一貫性、Q&A一貫性を定義し、異なるタイプのペルソナドリフトをキャプチャし、それぞれが人間のアノテーションに対して検証する。
論文 参考訳(メタデータ) (2025-10-31T19:40:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。