論文の概要: VoiceLongMemEval: Do Assistants Remember How You Sounded?
- arxiv url: http://arxiv.org/abs/2609.00570v2
- Date: Wed, 02 Sep 2026 03:32:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.750034
- Title: VoiceLongMemEval: Do Assistants Remember How You Sounded?
- Title(参考訳): VoiceLongMemEval:アシスタントはあなたの音を覚えているか?
- Authors: Ramit Pahwa, Parivesh Priye, Apoorva Beedu,
- Abstract要約: 現在のベンチマークでは、この対話履歴を、長い地平線上の情報検索、時間的推論、知識更新として評価している。
我々はVoiceLongMemEvalベンチマークを示し、すべての回答は会話のターンに付随するパラ言語的メタデータに依存する。
- 参考スコア(独自算出の注目度): 2.3577368017815696
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With the growing scale of multi-agent architectures and large language models, deployed AI assistants are increasingly tasked with reasoning over long, continuous, multi-session conversation histories. Current benchmarks evaluate this dialogue history as information retrieval over long horizon, temporal reasoning, or knowledge updates, while crucially ignoring the fundamental dynamics of human-agent interaction, i.e. how they said it. To address this gap, we present VoiceLongMemEval (VLME) benchmark, where every answer depends on paralinguistic metadata (emotion labels, prosody descriptors, and voice events) attached to conversational turns, which is otherwise unrecoverable from the words alone. Every item passes a three-stage adversarial gate, ensuring that a strong language model fails when given only the transcript. Evaluating leading frontier and open-weight models reveals a pervasive affect gap; providing text-track paralinguistic metadata yields a 0.09 to 0.38 accuracy boost (0.61 to 0.69 when prompted with evidence hints), while standard ASR pipelines systematically discard this signal. Additionally, audio-native models successfully extract these cues directly from speech (0.354 to 0.412 vs. 0.325 blind). Code and dataset will be made available upon acceptance.
- Abstract(参考訳): マルチエージェントアーキテクチャと大規模言語モデルの増加に伴い、デプロイされたAIアシスタントは、長い、連続的な、マルチセッションの会話履歴を推論するタスクがますます多くなっている。
現在のベンチマークでは、この対話履歴を、長い地平線上の情報検索、時間的推論、知識更新として評価する一方で、人間とエージェントの相互作用の基本的なダイナミクス、すなわち彼らがどのように言ったかを無視している。
このギャップに対処するために、VLME(VoiceLongMemEval)ベンチマーク(VoliceLongMemEval)を提案する。
各項目は3段階の逆ゲートを通し、書き起こしのみを与えられたとき、強い言語モデルが失敗することを保証する。
テキストトラックのパラ言語的メタデータを提供することで、0.09から0.38の精度向上(証拠のヒントで指示された場合0.61から0.69)が得られ、標準のASRパイプラインはこの信号を体系的に破棄する。
さらに、音声ネイティブモデルは、これらのキューを直接音声から抽出することに成功した(0.354から0.412対0.325盲目)。
コードとデータセットは受け入れ次第利用可能になる。
関連論文リスト
- Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction [12.216811577733125]
本稿では,E2E音声対話システムを評価するためのオープンソースのベンチマークであるAudio MultiChallengeを紹介する。
そこで我々は,中発音声の補聴とバックトラックに対する頑健さを検査する新軸音声編集手法を提案する。
47の話者と1,712のインスタンス固有のルーリックとの452の会話を、オーディオネイティブエージェントとヒューマンインザループパイプラインのハイブリッドを通じてキュレートする。
論文 参考訳(メタデータ) (2025-12-16T19:26:44Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - Recent Advances in Speech Language Models: A Survey [45.968078636811356]
音声言語モデル(SpeechLMs)は、テキストから変換することなく音声を生成するエンドツーエンドモデルである。
本稿では,近年のSpeechLM構築手法について概観する。
論文 参考訳(メタデータ) (2024-10-01T21:48:12Z) - Retrieval Augmented End-to-End Spoken Dialog Models [20.896330994089283]
音声信号から直接ダイアログ状態が推測される音声対話アプリケーションにSLMを適用する。
RAG(retrieval-augmented generation)パラダイムにヒントを得て,この弱点を克服する検索拡張SLM(ReSLM)を提案する。
音声MultipleWozタスク(DSTC-11チャレンジ)を用いてReSLMを評価し,この検索によりモデル性能が向上することを確認した。
論文 参考訳(メタデータ) (2024-02-02T18:23:09Z) - SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents [70.08842857515141]
SpokenWOZは音声TODのための大規模音声テキストデータセットである。
SpokenWOZでは、クロスターンスロットと推論スロット検出が新たな課題である。
論文 参考訳(メタデータ) (2023-05-22T13:47:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。