論文の概要: Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation
- arxiv url: http://arxiv.org/abs/2605.09120v1
- Date: Sat, 09 May 2026 19:08:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 14:47:29.146875
- Title: Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation
- Title(参考訳): Reddit2Deezer: リアルタイムの会話型音楽レコメンデーションのためのスケーラブルなデータセット
- Abstract要約: Reddit2Deezerは190kのユニークなスレッドとリーフ・コンパートメントのペアから派生した、現実的なグラウンドのCMRリソースである。
人間の検証は、対話、アイテムグラウンド、およびパラフレーズの品質を確認する。
データセットはhttps://huggingface.co/datasets/McAuley-Lab/Reddit2Deezerで入手できる。
- 参考スコア(独自算出の注目度): 20.716355408387276
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conversational music recommendation (CMR) research currently faces a tradeoff between authentic dialogue corpora that are limited in scale and synthesized corpora that scale up but whose conversations are artificially constructed rather than naturally observed. In this paper, we introduce Reddit2Deezer, a reality-grounded CMR resource derived from 190k unique {thread, leaf-comment} pairs. We release the resource in two versions: a raw version that preserves authenticity, and a paraphrased version that maximizes long-term reproducibility. Each musical entity is linked to a Deezer identifier, which provides straightforward access to audio previews and rich metadata (e.g., genre tags, popularity, BPM), opening the door to future research on content-grounded conversational recommendation. A human validation confirms the quality of the dialogues, item grounding, and paraphrases. The dataset is available at https://huggingface.co/datasets/McAuley-Lab/Reddit2Deezer.
- Abstract(参考訳): 会話音楽レコメンデーション (CMR) 研究は現在、大規模に制限された真の対話コーパスと、規模を拡大するが自然に観察されるのではなく人工的に会話が構築される合成コーパスのトレードオフに直面している。
本稿では, Reddit2Deezerについて紹介する。これは190kのユニークな<thread, leaf-comment>ペアから派生した現実的なCMRリソースである。
リソースを2つのバージョンでリリースします。信頼を保つ生バージョンと、長期的な再現性を最大化する言い換えバージョンです。
各音楽エンティティはDeezer識別子にリンクされ、オーディオプレビューやリッチメタデータ(例えば、ジャンルタグ、人気、BPM)への直接アクセスを提供し、コンテンツ基底の会話レコメンデーションに関する将来の研究への扉を開く。
人間の検証は、対話、アイテムグラウンド、およびパラフレーズの品質を確認する。
データセットはhttps://huggingface.co/datasets/McAuley-Lab/Reddit2Deezerで入手できる。
関連論文リスト
- Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis [12.060274776566223]
聴取深度検出(LDD)の課題について述べる。
我々は,聴取者の映像の微妙な動きの不整合を捉えた動き認識・音声誘導ネットワークMANetを提案する。
我々の研究は、従来の話し中心のパラダイムを超えてディープフェイク検出を再考する必要性を強調している。
論文 参考訳(メタデータ) (2026-04-14T12:20:07Z) - Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling [53.176242285107485]
我々は2人のトークショー交換の70時間14kclipデータセットであるtextbfFace-to-Face with Jimmy Fallon (F2F-JF)を紹介した。
半自動パイプラインは、多人数追跡、音声ダイアリゼーション、軽量な人間の検証を組み合わせて、時間的に整列したホスト/ゲストトラックを抽出する。
論文 参考訳(メタデータ) (2026-03-16T03:50:02Z) - Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models [10.022036983890091]
本稿では,多言語モデル(LLM)とユーザ意図,システム動作,音楽属性を用いたリッチな音楽発見対話のためのデータ生成フレームワークを提案する。
このフレームワークをMario Songデータセットに適用することにより,大規模言語モデルに基づくPseudo Music DialogueデータセットであるLP-MusicDialogを作成する。
評価の結果,人工音声データセットは,既存の小さな対話データセットと競合することがわかった。
論文 参考訳(メタデータ) (2024-11-11T23:40:45Z) - Identifying Speakers in Dialogue Transcripts: A Text-based Approach Using Pretrained Language Models [83.7506131809624]
本稿では,デジタルメディアアーカイブにおけるコンテンツアクセシビリティと検索可能性を高める重要な課題である,対話テキスト中の話者名を識別する手法を提案する。
本稿では,メディアサムコーパスから派生した大規模データセットについて述べる。
本稿では,話者名を正確に属性付けるために,対話中の文脈的手がかりを活用する,話者IDに適したトランスフォーマーモデルを提案する。
論文 参考訳(メタデータ) (2024-07-16T18:03:58Z) - CoVoMix: Advancing Zero-Shot Speech Generation for Human-like Multi-talker Conversations [97.75037148056367]
CoVoMixは、ゼロショット、人間ライク、マルチスピーカー、マルチラウンド対話音声生成のための新しいモデルである。
対話モデリングと生成の有効性を測定するための総合的なメトリクスセットを考案する。
論文 参考訳(メタデータ) (2024-04-10T02:32:58Z) - SalesBot 2.0: A Human-Like Intent-Guided Chit-Chat Dataset [28.257630375747606]
本稿では,大規模言語モデル(LLM)の共通知識を適切なプロンプトによって活用することにより,公開データの改訂版であるSalesBot 2.0を構築することを目的とする。
詳細なアノテーションを備えた新たにリリースされた大規模なデータセットは、トピック間のスムーズな移行を示し、自然性や一貫性の観点からは人間らしくなっている。
論文 参考訳(メタデータ) (2023-08-28T02:48:49Z) - SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents [70.08842857515141]
SpokenWOZは音声TODのための大規模音声テキストデータセットである。
SpokenWOZでは、クロスターンスロットと推論スロット検出が新たな課題である。
論文 参考訳(メタデータ) (2023-05-22T13:47:51Z) - SODA: Million-scale Dialogue Distillation with Social Commonsense
Contextualization [129.1927527781751]
初となる,100万規模の社会対話データセットであるSODAを提示する。
知識グラフから社会的コモンセンス知識を文脈化することにより、社会的相互作用の非常に幅広いスペクトルを蒸留することができる。
人間による評価は、SODAにおける会話は、以前の人間によるデータセットよりも一貫性があり、特異であり、そして(当然のことながら)自然であることを示している。
論文 参考訳(メタデータ) (2022-12-20T17:38:47Z) - Responsive Listening Head Generation: A Benchmark Dataset and Baseline [58.168958284290156]
本研究では、応答型リスニングヘッド生成タスクを、複数の入力に応答する動きと表現を持つ非言語ヘッドの合成として定義する。
音声によるジェスチャーや音声のヘッド生成とは違って,いくつかの研究分野の恩恵を期待して,このタスクにより多くのモーダルを導入する。
論文 参考訳(メタデータ) (2021-12-27T07:18:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。