論文の概要: Using the Mimi codec for metalinguistic representations
- arxiv url: http://arxiv.org/abs/2608.15799v1
- Date: Sun, 16 Aug 2026 15:25:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.427522
- Title: Using the Mimi codec for metalinguistic representations
- Title(参考訳): ミミコーデックを用いた金属的表現
- Authors: Artem Saloev, Erin Pacquetet, Nicolas Ballier,
- Abstract要約: そこで本研究では,Mimiを用いたABX実験において,意味トークンのマッピングを電話実現に利用できないことを示す。
TIMITコーパスの転写にミミ表現を適応させることにより、2048年の意味コードブックマップのトークンIDがクアッドフォン、トリホン、バイフォン、電話、サブホンの実現に役立てられることを示す。
- 参考スコア(独自算出の注目度): 0.9419361276896393
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: In this paper, we focus on the dictionary of 2048 tokens used in Mimi semantic token codebook, the neural codec of the Moshi language model. We show that the ABX experiment carried out with Mimi fails to capture the mapping of the semantic tokens to phone realisations. By realigning Mimi representations to the TIMIT corpus transcriptions, we show that the 2048 tokens IDs of the semantic codebook map to quadphone, triphone, biphone, phone and subphone realisations.
- Abstract(参考訳): 本稿では,モシ語モデルのニューラルコーデックであるミミ意味トークンコードブックで使用される2048個のトークンの辞書に着目した。
そこで本研究では,Mimiを用いたABX実験において,意味トークンのマッピングを電話実現に利用できないことを示す。
TIMITコーパスの転写にミミ表現を適応させることにより、2048年の意味コードブックマップのトークンIDがクアッドフォン、トリホン、バイフォン、電話、サブホンの実現に役立てられることを示す。
関連論文リスト
- Phone Segmentation and Recognition through Phonological Activation Mapping [76.99244720091627]
携帯電話のセグメンテーションと認識は本質的に関連するタスクであるが、現代のアプローチは通常それらを個別にモデル化する。
我々は、音声構造が自己教師型音声モデル(S3M)の表現にすでに潜んでいることを論じる。
我々は,各S3M表現フレームを発声やナジーナリティなどの音韻的特徴活性化のベクトルにマッピングするSPAM(Phonological Activation Mapping)を利用する。
論文 参考訳(メタデータ) (2026-07-10T01:05:30Z) - Understanding How MLLMs Describe Artworks Using Token Activation Maps [10.258013191657643]
マルチモーダル大言語モデルでは、顕著な流布のあるアートワークを記述しているが、そのアウトプットの背後にある視覚的理由はまだ不透明である。
本研究では,各トークンに対して,そのトークンに特有の視覚的証拠を事前コンテキスト干渉から分離するヒートマップを生成するToken Activation Map (TAM)を用いてこれを研究する。
TAMを複数の期間とジャンルにまたがるキュレートされた絵画に適用し、共通視覚オブジェクト、スタイル記述子、メタデータ、図形トークン、感情表現の5つの意味的に異なるトークンカテゴリのグラウンドディングパターンを分析する。
MLLMがアートワークやアーティストを識別しようと試み、タイトル予測よりも高い精度でアーティストの帰属を達成していることを示す。
論文 参考訳(メタデータ) (2026-06-26T10:42:43Z) - Recognizing Co-Speech Gestures in-the-Wild [52.804383193630166]
GRW(Gesture Recognition in the Wild)データセットは156,688本のビデオクリップを手動でアノテートする。
GRWは、物理的行動、空間記述子、抽象概念の非常に多様な150ワードの分類である。
我々はGRWを利用してビデオモデルを訓練し、ジェスチャーを意味的か否かを分類し、(b)共同音声のジェスチャーに対応する単語を認識し、(c)ジェスチャーを時間的に局所化する。
論文 参考訳(メタデータ) (2026-05-29T17:55:17Z) - Speech Codec Probing from Semantic and Phonetic Perspectives [49.01048570474675]
音声トークン化器は,マルチモーダルシステムにおいて,音声を大言語モデル (LLM) に接続するために必須である。
新たな証拠は、音声表現において「意味」と呼ばれるものは、テキスト由来の意味論と一致しないことを示している。
論文 参考訳(メタデータ) (2026-03-11T03:32:25Z) - Transcribe, Translate, or Transliterate: An Investigation of Intermediate Representations in Spoken Language Models [68.69744941948986]
音声を大言語モデル(LM)と統合する音声言語モデル(SLM)は、音声エンコーダの出力をデコーダ LM に理解可能な表現にマッピングするモダリティアダプタ(MA)に依存している。
ここでは、3つのSLM(SALMONN, Qwen2-Audio, Phi-4-Multimodal-Instruct)におけるMA出力表現について検討する。
MA表現に最も近いデコーダLMトークンを見つけることで、MA表現の2つの戦略を明らかにする。
論文 参考訳(メタデータ) (2025-10-02T21:19:40Z) - Tokenize Anything via Prompting [65.93061853439512]
我々は,任意のものを同時にセグメンテーションし,認識し,キャプションすることができる統一的,迅速なモデルを提案する。
我々は、50億のパラメータを持つ事前学習されたCLIPモデルから、巨大なセグメンテーションマスク、eg、SA-1Bマスク、セマンティックプリミティブを持つ一般化可能なモデルをトレーニングする。
我々は,このモデルが汎用領域コンテキストを符号化できる汎用領域レベルの画像トークン化器であると考えている。
論文 参考訳(メタデータ) (2023-12-14T17:01:02Z) - Homophone Disambiguation Reveals Patterns of Context Mixing in Speech
Transformers [12.44366147179659]
そこで本研究では,テキストモデルのための"context-mixing"の尺度を,音声言語のモデルに適用し,適用する方法について検討する。
このようなケーススタディに理想的な言語現象であるフランス語のホモフォニーを同定する。
その結果,エンコーダのみのモデルにおける表現は,これらのキューを効果的に組み込んで正しい転写を識別するのに対し,エンコーダ-デコーダモデルのエンコーダは,主にデコーダモジュールへのコンテキスト依存を捕捉するタスクを緩和することがわかった。
論文 参考訳(メタデータ) (2023-10-15T19:24:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。