論文の概要: Can LLM Agents Identify Spoken Dialects like a Linguist?
- arxiv url: http://arxiv.org/abs/2603.29541v1
- Date: Tue, 31 Mar 2026 10:24:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:03.544884
- Title: Can LLM Agents Identify Spoken Dialects like a Linguist?
- Title(参考訳): LLMエージェントは言語学者のように音声を識別できるのか?
- Authors: Tobias Bystrich, Lukas Hamm, Maria Hassan, Lea Fischbach, Lucie Flek, Akbar Karimi,
- Abstract要約: 本稿では,方言理解のエージェントとしての大規模言語モデル(LLM)の能力と,方言分類におけるHuBERTなどのモデルに匹敵する性能を示すことができるかを検討する。
提案手法では,ASRシステムで生成した音声の書き起こしを,方言の特徴地図や母音履歴,規則などの言語資源と組み合わせる。
- 参考スコア(独自算出の注目度): 9.242671426685725
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Due to the scarcity of labeled dialectal speech, audio dialect classification is a challenging task for most languages, including Swiss German. In this work, we explore the ability of large language models (LLMs) as agents in understanding the dialects and whether they can show comparable performance to models such as HuBERT in dialect classification. In addition, we provide an LLM baseline and a human linguist one. Our approach uses phonetic transcriptions produced by ASR systems and combines them with linguistic resources such as dialect feature maps, vowel history, and rules. Our findings indicate that, when linguistic information is provided, the LLM predictions improve. The human baseline shows that automatically generated transcriptions can be beneficial for such classifications, but also presents opportunities for improvement.
- Abstract(参考訳): ラベル付き方言音声が不足しているため、スイスドイツ語を含むほとんどの言語において、音声方言分類は難しい課題である。
本研究では,方言理解のエージェントとしての大規模言語モデル(LLM)の能力と,方言分類におけるHuBERTなどのモデルに匹敵する性能を示すことができるかを検討する。
また,LLMベースラインと人間の言語学ベースラインも提供する。
提案手法では,ASRシステムで生成した音声の書き起こしを,方言の特徴地図,母音履歴,規則などの言語資源と組み合わせる。
以上の結果から,言語情報の提供によってLLM予測が向上することが示唆された。
ヒトのベースラインは、自動生成された転写がこのような分類に有用であるだけでなく、改善の機会も示している。
関連論文リスト
- Tracing Multilingual Representations in LLMs with Cross-Layer Transcoders [51.380449540006985]
大規模言語モデル(LLM)は多くの言語を処理できるが、どのようにして内部的にこの多様性を表現しているのかは不明だ。
言語固有のデコーディングと多言語表現を共有できるのでしょうか?
層間トランスコーダ(CLT)と属性グラフを用いて内部メカニズムを解析する。
論文 参考訳(メタデータ) (2025-11-13T22:51:06Z) - Make Every Letter Count: Building Dialect Variation Dictionaries from Monolingual Corpora [38.54622638611305]
我々はバイエルン語をケーススタディとして用い,Large Language Models(LLMs)の語彙的方言理解能力について検討する。
単言語データのみから方言変化辞書を生成するための新しいアノテーションフレームワークであるDiaLemmaを使用している。
我々は、9つの最先端のLLMがバイエルン語を、方言の翻訳、動詞の変種、あるいは与えられたドイツの補題の無関係な形式として、いかにうまく判断できるかを評価する。
論文 参考訳(メタデータ) (2025-09-22T14:49:08Z) - In-context Language Learning for Endangered Languages in Speech Recognition [15.294500162002345]
In-context Learning (ICL) を用いて,大規模言語モデル (LLM) が未知の低リソース言語を学習できるかどうかを検討する。
ICLは、これらの言語に特化して訓練された専用言語モデルに匹敵する、あるいは超越したASR性能を実現することができることを示す。
論文 参考訳(メタデータ) (2025-05-26T18:38:59Z) - Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically [58.019484208091534]
事前訓練された言語モデル(LM)における言語間アライメントは、テキストベースのLMの効率的な転送を可能にしている。
テキストに基づく言語間アライメントの発見と手法が音声に適用されるかどうかについては、未解決のままである。
論文 参考訳(メタデータ) (2025-05-26T07:21:20Z) - Converging to a Lingua Franca: Evolution of Linguistic Regions and Semantics Alignment in Multilingual Large Language Models [11.423589362950812]
大規模言語モデル(LLM)は、特に多言語文脈において顕著な性能を示した。
近年の研究では、LLMは、ある言語で学んだスキルを他の言語に伝達することができることが示唆されているが、この能力の背後にある内部メカニズムはいまだ不明である。
本稿では,LLMの内部動作に関する知見を提供し,言語間能力の向上のための基盤を提供する。
論文 参考訳(メタデータ) (2024-10-15T15:49:15Z) - PhonologyBench: Evaluating Phonological Skills of Large Language Models [57.80997670335227]
音声学は、音声の構造と発音規則の研究であり、Large Language Model (LLM) 研究において批判的であるが、しばしば見落とされがちな要素である。
LLMの音韻的スキルを明示的にテストするための3つの診断タスクからなる新しいベンチマークであるPhonologyBenchを提案する。
我々は,Rhyme Word GenerationとSyllable countingにおいて,人間と比較した場合,それぞれ17%と45%の有意なギャップを観察した。
論文 参考訳(メタデータ) (2024-04-03T04:53:14Z) - How do Large Language Models Handle Multilingualism? [81.15060972112563]
本研究では,大規模言語モデル(LLM)が多言語モデルをどのように扱うかを検討する。
LLMはまずクエリを理解し、タスク解決のために多言語入力を英語に変換する。
中間層では、英語を思考に用い、自己意識とフィードフォワード構造を持つ多言語知識を取り入れている。
論文 参考訳(メタデータ) (2024-02-29T02:55:26Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。