論文の概要: TiCo: Time-Controllable Training for Spoken Dialogue Models
- arxiv url: http://arxiv.org/abs/2603.22267v1
- Date: Mon, 23 Mar 2026 17:51:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.829078
- Title: TiCo: Time-Controllable Training for Spoken Dialogue Models
- Title(参考訳): TiCo:音声対話モデルのための時間制御可能なトレーニング
- Authors: Kai-Wei Chang, Wei-Chih Chen, En-Pei Hu, Hung-yi Lee, James Glass,
- Abstract要約: TiCoは、音声対話モデルにおいて、時間制約のある指示に従うことができ、制御可能な時間で応答を生成する方法である。
少量のデータしか必要とせず、代わりに自己生成と強化学習に依存する質問と回答のペアは必要ない。
実験の結果,TiCoは応答品質を保ちながら持続時間制約への付着性を著しく改善することがわかった。
- 参考スコア(独自算出の注目度): 82.4349748682451
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose TiCo, a simple post-training method for enabling spoken dialogue models (SDMs) to follow time-constrained instructions and generate responses with controllable duration. This capability is valuable for real-world spoken language systems such as voice assistants and interactive agents, where controlling response duration can improve interaction quality. However, despite their strong ability to generate natural spoken responses, existing models lack time awareness and struggle to follow duration-related instructions (e.g., "Please generate a response lasting about 15 seconds"). Through an empirical evaluation of both open-source and commercial SDMs, we show that they frequently fail to satisfy such time-control requirements. TiCo addresses this limitation by enabling models to estimate elapsed speaking time during generation through Spoken Time Markers (STM) (e.g., <10.6 seconds>). These markers help the model maintain awareness of time and adjust the remaining content to meet the target duration. TiCo is simple and efficient: it requires only a small amount of data and no additional question-answer pairs, relying instead on self-generation and reinforcement learning. Experimental results show that TiCo significantly improves adherence to duration constraints while preserving response quality.
- Abstract(参考訳): 音声対話モデル(SDM)が時間制約のある指示に従うことを可能とし、制御可能な時間で応答を生成するための簡単な後学習法であるTiCoを提案する。
この能力は、音声アシスタントや対話エージェントのような現実世界の音声言語システムにとって有用であり、応答時間を制御することで、対話の質を向上させることができる。
しかし、自然な音声応答を生成する能力は強いが、既存のモデルは時間認識に欠け、持続時間に関する指示に従うのに苦労している(例:「約15秒間の応答を生成する」)。
オープンソースおよび商用SDMの実証評価を通じて、このような時間制御要件を満たすことができないことがよく示されている。
TiCoはこの制限に対処し、Spoken Time Markers (STM) (e g , <10.6 seconds>) を通じて生成中の発話時間の経過を推定できるようにする。
これらのマーカーは、モデルが時間に対する認識を維持し、残りのコンテンツを調整するのに役立ちます。
TiCoは単純で効率的で、少量のデータしか必要とせず、代わりに自己生成と強化学習に頼っている。
実験の結果,TiCoは応答品質を保ちながら持続時間制約への付着性を著しく改善することがわかった。
関連論文リスト
- Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents [80.33280979339123]
強化学習(RL)を用いた時間認識メモリ選択ポリシーを学習するフレームワークであるMemory-T1を紹介する。
Time-Dialogベンチマークでは、Memory-T1が7Bモデルを67.0%に引き上げ、オープンソースモデルの新たな最先端パフォーマンスを確立した。
論文 参考訳(メタデータ) (2025-12-23T06:37:29Z) - Game-Time: Evaluating Temporal Dynamics in Spoken Language Models [93.844257719952]
時間的能力を評価するためにGame-Time Benchmarkフレームワークを導入します。
多様なSLMモデルについて評価した結果,性能の相違が明らかとなった。
GameTime Benchmarkは、より時間的に認識された会話型AIに向けた将来の研究を導くための基盤を提供する。
論文 参考訳(メタデータ) (2025-09-30T15:23:39Z) - From What to Respond to When to Respond: Timely Response Generation for Open-domain Dialogue Agents [26.437011114518917]
TimelyChatベンチマークは、適切な時間間隔を予測し、時間条件の応答を生成する言語モデルの能力を評価する。
我々は,時間的コモンセンス知識グラフからラベルのないイベント知識を活用することで,大規模トレーニングデータセットを構築した。
次に、タイムインターバルを積極的に予測し、それらのインターバルに合わせてタイムリーなレスポンスを生成するために設計された対話エージェントであるTimerを訓練する。
論文 参考訳(メタデータ) (2025-06-17T07:56:32Z) - Learning to Reason Over Time: Timeline Self-Reflection for Improved Temporal Reasoning in Language Models [21.579319926212296]
大規模言語モデル(LLM)は、一貫性のあるテキストを生成し、コンテキストを理解し、推論タスクを実行するための強力なツールとして登場した。
彼らは時間的推論に苦しむが、それはイベントシーケンシングや時間的関係、時間的関係などの時間的関連情報を処理する必要がある。
我々は,タイムライン構築と反復的自己回帰を組み合わせた多段階プロセスを通じて,LLMの時間的推論能力を高める新しいフレームワークであるTISERを紹介する。
論文 参考訳(メタデータ) (2025-04-07T16:51:45Z) - Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities [93.09944267871163]
FullDuplexBenchは、重要なインタラクティブな振る舞いを体系的に評価するベンチマークである。
ベンチマークコードを公開することによって、音声対話モデリングの進歩と、より自然で魅力的なSDMの開発を目指しています。
論文 参考訳(メタデータ) (2025-03-06T18:59:16Z) - MTPChat: A Multimodal Time-Aware Persona Dataset for Conversational Agents [23.98067169669452]
MTPChatは、対話とペルソナメモリに言語的、視覚的、時間的要素を統合する、タイムアウェアなペルソナ対話データセットである。
時間的次反応予測(TNRP)と時間的接地記憶予測(TGMP)の2つのタスクを提案する。
本稿では,マルチモーダルストリームを効果的に統合し,時間依存を捕捉する適応時間モジュールを特徴とする革新的なフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-09T13:00:53Z) - Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration [13.713209707407712]
本稿では,TASモデルの前にアライメント器をトレーニングすることにより,正確な時間ラベリングを優先する新しいAligner-Guided Training Paradigmを提案する。
実験の結果,単語誤り率を最大16%向上させることができ,音素・音調アライメントを著しく向上させることができることがわかった。
論文 参考訳(メタデータ) (2024-12-11T05:39:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。