論文の概要: Language Carries the Expert's Impression: Instrument-Anchored LLM Judges Transfer Counseling-Quality Assessment and Beat In-Domain Training
- arxiv url: http://arxiv.org/abs/2610.08055v1
- Date: Tue, 06 Oct 2026 09:53:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.922132
- Title: Language Carries the Expert's Impression: Instrument-Anchored LLM Judges Transfer Counseling-Quality Assessment and Beat In-Domain Training
- Title(参考訳): 専門家の印象を言葉で表現する: 器用アンコール式LLM審査員のコウンスリング・クオリティ・アセスメントとビート・イン・ドメイン・トレーニング
- Abstract要約: シミュレーションカウンセリングの3つのコーパスにまたがる専門的総合印象予測のクロスドメイン移行について検討した。
1つのコーパスがスピーカーごとのオーディオを失い、16%のダイアリゼーションされたセグメントが間違ったスピーカーを持ち、修理費用は0.07ドルだ。
- 参考スコア(独自算出の注目度): 10.208132378248994
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic assessment of communication quality in dyadic counseling conversations is bottlenecked by data: expert-rated corpora are small and expensive to grow. We study cross-domain transfer of expert overall-impression prediction across three German corpora of simulated counseling (two general-practice medical, one school-related parent-teacher; $n=195$ expert-rated sessions, one corpus after scale equating). Training on the other domains beats training in-domain: leave-one-domain-out transfer reaches nested Spearman $ρ= 0.54$ against $\le 0.48$ within the target domain, a paired session-level gap of $+0.15$ that holds at $+0.12$ when the training-set sizes are matched, so it is not simply data volume. The decisive features are session-level construct scores from small open-weight LLMs reading the two-speaker transcript, with the constructs largely derived from the experts' rating instruments: the instrument-derived battery lifts a single judge from $0.32$ to $0.41$ over generic dialogue qualities, judges from three model families ensemble to $0.51$ language-only, and a nonverbal-dyadic block adds $+0.03$ more, not separable from noise at this sample size. We also price the recording setup: one corpus lost its per-speaker audio, 16% of its diarised segments carry the wrong speaker, and repair is worth $+0.07$ there. At practically attainable corpus sizes, the expert's overall impression is carried by what is said, and by other communication programs' data more than by one's own.
- Abstract(参考訳): ダイアドカウンセリング会話におけるコミュニケーション品質の自動評価は、データによってボトルネックとなる。
シミュレーション・カウンセリングの3つのコーパス(2つの一般実践医療、1つの学校関連親教育者、$n=195$エキスパート評価セッション、1つのスケール・エクアリング後のコーパス)における専門的印象予測のクロスドメイン移行について検討した。
Spearman $ρ= 0.54$ against $\le 0.48$ against $\le 0.48$, with a paired session-level gap of $+0.15$ that hold at $+0.12$ if the training-set sizes were matched, it is not data volume。
楽器由来のバッテリは1つの判定を0.32ドルから0.41ドルに引き上げ、一般的な対話の質は3つのモデルファミリーの判断を0.51ドルまで引き上げ、非バーバル・ダイアドブロックは0.03ドル以上追加し、このサンプルサイズではノイズとは分離できない。
1つのコーパスがスピーカーごとのオーディオを失い、16%のダイアリゼーションされたセグメントが間違ったスピーカーを持ち、修理費用は0.07ドルだ。
実際に達成可能なコーパスサイズでは、専門家の全体的な印象は、言われたこと、そして他のコミュニケーションプログラムのデータによって、自分自身よりも多く行われる。
関連論文リスト
- TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection [55.35119005976305]
テレコム詐欺スクリプトは急速に進化し、日常的なサービス会話に似たように設計されている。
ベンチマークは、以前に確立されたテストセットを上書きすることなく、新しく観察された詐欺パターンを組み込まなければならない。
本稿では,Mixed-Tree Anti-Fraud Generation Pipelineで構築したTeleAntiFraud 2.0について述べる。
論文 参考訳(メタデータ) (2026-09-16T14:41:11Z) - How Far Do Foundation Models Transfer to Infant Signals? A Cross-Dataset Transfer Audit with a Unified Need Ontology [0.0]
公立の乳幼児の涙コーパスは小さく、ラベルと互換性がなく、ほぼ常に一度に1つのコーパスを評価している。
統合された5クラス要求オントロジーと共有タスク定式化の下で、4つの凍結エンコーダと手作りベースラインを探索する。
オントロジー、マッピングコード、監査パイプラインをリリースし、互換性のないCry corporaを使用可能な共同トレーニングリソースにします。
論文 参考訳(メタデータ) (2026-08-10T01:22:32Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts [44.42036618863284]
本稿では,自然言語テキストの自動評価のためのフレームワークを提案する。
大規模言語モデル (LLM) は各ルーブリックな質問によって促され、潜在的な応答に対する分布を生成する。
LLMの予測は、人間の判断とうまく一致しないことが多い。
LLM-Rubricは、判断特化パラメータと判断非依存パラメータの両方を含む小さなフィードフォワードニューラルネットワークをトレーニングすることで、これを達成している。
論文 参考訳(メタデータ) (2024-12-31T04:57:01Z) - CALLS: Japanese Empathetic Dialogue Speech Corpus of Complaint Handling
and Attentive Listening in Customer Center [41.46571444928867]
本稿では,顧客センターでの通話を共感的音声対話の新たな領域とみなす日本語コーパスCALLSを紹介する。
既存のSTUDIESコーパスは、教師と学校の学生の間の共感的な対話のみをカバーしている。
情緒的対話音声合成(EDSS)の適用範囲を拡大するため,STUDIES教師と同じ女性話者を含むコーパスを設計した。
論文 参考訳(メタデータ) (2023-05-23T06:04:50Z) - Re$^3$Dial: Retrieve, Reorganize and Rescale Dialogue Corpus for
Long-Turn Open-Domain Dialogue Pre-training [90.3412708846419]
既存の事前学習コーパスのほとんどの対話は、3回未満の対話を含む。
数十億ドル規模のロングターン対話を自動的に構築するRetrieve, Reorganize, Rescale framework (Re$3$Dial)を提案する。
上記のプロセスを繰り返すことで、Re$3$Dialはコヒーレントなロングターン対話をもたらすことができる。
論文 参考訳(メタデータ) (2023-05-04T07:28:23Z) - GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of
Transcribed Audio [88.20960848885575]
GigaSpeechは英語の多分野音声認識コーパスで、教師あり訓練に適した高品質なラベル付きオーディオが1万時間ある。
約4万時間の音声が、まずオーディオブック、ポッドキャスト、YouTubeから収集され、読み書きと自発的な話し方の両方をカバーする。
システムトレーニングのために、GigaSpeechは10h, 250h, 1000h, 2500h, 10000hの5つのサブセットを提供する。
論文 参考訳(メタデータ) (2021-06-13T04:09:16Z) - Many-Speakers Single Channel Speech Separation with Optimal Permutation
Training [91.22679787578438]
我々は、$O(C3)$時間の複雑さで訓練するためにハンガリーのアルゴリズムを使用する置換不変トレーニングを提示します。
私たちのアプローチは、最大$ 20$スピーカーを分離し、大きな$ C$の以前の結果を幅広いマージンで改善します。
論文 参考訳(メタデータ) (2021-04-18T20:56:12Z) - Emergent Communication Pretraining for Few-Shot Machine Translation [66.48990742411033]
我々は、参照ゲームからの創発的コミュニケーションを介してニューラルネットワークを事前訓練する。
私たちの重要な前提は、実世界の環境の粗悪な近似として、画像に基づくコミュニケーションを基盤にすることで、帰納的に自然言語学習のモデルに偏りが生じる、ということです。
論文 参考訳(メタデータ) (2020-11-02T10:57:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。