論文の概要: KoUniTalk: A Lightweight Articulation-Centered Korean-English 3D Talking Face Benchmark
- arxiv url: http://arxiv.org/abs/2609.19840v2
- Date: Sun, 20 Sep 2026 03:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.106968
- Title: KoUniTalk: A Lightweight Articulation-Centered Korean-English 3D Talking Face Benchmark
- Title(参考訳): KoUniTalk: ライトウェイトなアーティキュレーション中心の韓国英語の3Dトーク
- Abstract要約: 高品質な3D会話顔データセットは、大半が英語中心である。
韓国の3D顔の動きデータは、標準の英語データセットと組み合わせることが難しい。
KoUniTalkは、音声駆動型表情調音訓練のためのアイデンティティニュートラルな標準出力空間を提供する。
- 参考スコア(独自算出の注目度): 1.4323566945483497
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality 3D talking face datasets remain largely English-centric, and Korean 3D facial motion data are difficult to combine with standard English benchmarks because of differences in mesh topology, spatial scale, coordinate system, and temporal sampling. We present KoUniTalk, a lightweight articulation-centered Korean-English 3D talking face benchmark that retargets VOCASET and the released Korean speech-based 3D talking face data to a shared mesh topology using deformation transfer. Rather than proposing a new deformation-transfer algorithm or a full-head identity-preserving avatar dataset, KoUniTalk provides an identity-neutral canonical output space for controlled speech-driven facial articulation training and evaluation across English and Korean. The unified template contains 1,176 vertices and focuses on the mouth and adjacent lower- and mid-face regions, reducing the output dimensionality from 15,069 and 72,147 dimensions to 3,528 dimensions, corresponding to 4.27-fold and 20.45-fold reductions compared with VOCASET/FLAME and the original Korean mesh, respectively. To examine whether retargeting preserves speech-relevant motion, we evaluate semantic mouth-landmark trajectories, including mouth opening, mouth width, aperture ratio, and mouth-opening dynamics. Since the official test set of the Korean dataset is not publicly released, we additionally define a subject-disjoint Korean benchmark split. The processed matched benchmark contains 22 speakers, 4,978 sequences, and 642,781 frames, enabling Korean-English cross-dataset evaluation of speech-driven 3D facial animation models in a single compact articulation-template space. Source-reported inventory counts are listed separately from these processed counts.
- Abstract(参考訳): 高品質な3D会話顔データセットは英語中心であり、メッシュトポロジ、空間スケール、座標系、時間サンプリングの違いから、韓国の3D顔の動きデータは標準英語のベンチマークと組み合わせるのが困難である。
変形伝達を用いた共有メッシュトポロジに,VOCASETと韓国語音声ベースの3D音声顔データを再ターゲットとした,軽量な調音中心の韓国語3D音声顔ベンチマークKoUniTalkを提案する。
KoUniTalkは、新しい変形トランスファーアルゴリズムやフルヘッドID保存アバターデータセットを提案するのではなく、音声駆動型顔調音訓練と英語と韓国語による評価のためのアイデンティティニュートラルな標準出力空間を提供する。
一体型テンプレートは1,176個の頂点を有し、口と隣接する下面と中面の領域に焦点を合わせ、出力寸法をVOCASET/FLAMEおよび元の韓国メッシュと比較してそれぞれ4.27倍、20.45倍の3,528次元に縮小する。
本研究は, 口開放, 口幅, 開口率, 口開放ダイナミックスなどの意味的口先軌跡について検討した。
韓国のデータセットの公式なテストセットは公開されていないため、対象が不一致な韓国のベンチマークの分割も定義する。
一致したベンチマークは22の話者、4,978のシーケンス、642,781のフレームを含む。
ソース報告された在庫数は、これらの処理された数から別々にリストされる。
関連論文リスト
- Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs [7.195547595036643]
本稿では,SpeechLM評価のための2つのヒューマンエージェント・ベンチマーク・コンストラクション・フレームワークを提案する。
ソース言語SpkenQAベンチマークをターゲット言語SpkenQAベンチマークに、ターゲット言語ASRコーパスをオーディオ理解ベンチマークに変換する。
これらのフレームワークを用いて,韓国語音声理解のためのKVoiceBenchとKOpenAudioBenchと韓国語音声理解のためのKMMAUの3つのベンチマークを構築し,公開する。
論文 参考訳(メタデータ) (2026-05-27T05:19:38Z) - Simultaneous Speech-to-Speech Translation Without Aligned Data [52.467808474293605]
同時音声翻訳では、ソース音声を対象言語にリアルタイムで翻訳する必要がある。
単語レベルのアライメントを完全に不要にするヒビキゼロを提案する。
Hibiki-Zeroは5つのX-英語タスクの翻訳精度、レイテンシ、音声転送、自然性において最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T17:41:01Z) - Improving Direct Persian-English Speech-to-Speech Translation with Discrete Units and Synthetic Parallel Data [1.3607388598209322]
直接音声音声変換(S2ST)モデルは、ソース言語とターゲット言語で大量の並列音声データを必要とする。
本稿では、ペルシャ語を英語に翻訳する直接S2STシステムと、ペルシャ・英語合成音声生成のためのパイプラインを提案する。
論文 参考訳(メタデータ) (2025-11-16T17:14:23Z) - CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching [31.584937435966253]
我々はCS3-Bench(Code-Switching Speech-to-Speech Benchmark)を提案する。
7つの主流モデルに関する実験は、知識集約的な質問応答の相対的なパフォーマンス低下を66%まで示している。
提案手法は, 知識の精度を25.14%から46.13%に改善し, オープンエンド理解率を64.5%から86.5%に改善し, 第二言語における発音誤りを大幅に低減する。
論文 参考訳(メタデータ) (2025-10-09T07:34:23Z) - MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset [14.026893125215912]
多様な言語の音声から3D音声の頭部を生成する新しいタスクを提案する。
我々は,20言語で420時間以上の会話ビデオからなる,多言語2Dビデオデータセットを新たに収集した。
多言語設定におけるリップシンクの精度を評価するための指標を提案する。
論文 参考訳(メタデータ) (2024-06-20T12:52:46Z) - TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head
Translation [54.155138561698514]
音声から音声への直接翻訳は、自己教師付き学習から得られる離散単位を導入することにより、高品質な結果が得られる。
既存の方法は常にカスケードに依存し、音声とテキストの両方を通して合成し、遅延やカスケードエラーを引き起こす。
本稿では,音声-視覚音声を他の言語で直接音声-視覚音声に翻訳できる,頭部翻訳モデルである textbfTransFace を提案する。
論文 参考訳(メタデータ) (2023-12-23T08:45:57Z) - Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer [53.72998363956454]
個別の自己教師付き表現を用いた音声音声合成(S2ST)は顕著な精度を達成している。
高品質な話者並列データの不足は、翻訳中にスタイル転送を学習する上での課題となる。
我々は、個別の自己教師付き音声表現と音色単位に基づいて、スタイル変換機能を備えたS2STパイプラインを設計する。
論文 参考訳(メタデータ) (2023-09-14T09:52:08Z) - Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging
Features For Elderly And Dysarthric Speech Recognition [55.25565305101314]
調音機能は音響信号歪みに不変であり、音声認識システムにうまく組み込まれている。
本稿では,A2Aモデルにおける24時間TaLコーパスの並列音声・超音波舌画像(UTI)データを利用したクロスドメインおよびクロスランガルA2Aインバージョン手法を提案する。
生成した調音機能を組み込んだ3つのタスクの実験は、ベースラインのTDNNとコンフォーマーASRシステムより一貫して優れていた。
論文 参考訳(メタデータ) (2022-06-15T07:20:28Z) - Direct speech-to-speech translation with discrete units [64.19830539866072]
本稿では、中間テキスト生成に頼ることなく、ある言語から別の言語に音声を変換する直接音声音声翻訳(S2ST)モデルを提案する。
そこで本稿では,ラベルなし音声コーパスから学習した自己教師付き離散表現の予測を提案する。
対象のテキスト書き起こしが利用可能となると、同一の推論パスで2つのモード出力(音声とテキスト)を同時に生成できる、共同音声認識とテキストトレーニングを備えたマルチタスク学習フレームワークを設計する。
論文 参考訳(メタデータ) (2021-07-12T17:40:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。