論文の概要: Detection of Self-Introductions in Legislative Testimony
- arxiv url: http://arxiv.org/abs/2608.07891v1
- Date: Sat, 08 Aug 2026 03:38:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.550293
- Title: Detection of Self-Introductions in Legislative Testimony
- Title(参考訳): 法的証言における自己導入の検出
- Authors: Sofija Dimitrijevic, Pallavi Das, Kasey Liu, Foaad Khosmood,
- Abstract要約: 本稿では,機械学習を用いた立法委員会証言における自己導入検出パイプラインを提案する。
我々は、5つの州議会セッションにまたがる145万発の発話からトレーニングデータセットを構築した。
XGBoost は F1 スコア 0.9747 で最高のパフォーマンスを達成し、総誤差は最小である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Self-introductions are common in legislative committee testimonies. Successfully detecting them and extracting the speaker's name is enormously helpful in the task of speaker identification in the context of government meetings. In this paper, we present a pipeline for detection of self-introductions in legislative committee testimony using machine learning. We construct a training dataset from 1.54 million utterances spanning five state legislative sessions, apply a name-matching heuristic to generate automatic labels, and train three classifiers: a decision tree, random forest, and XGBoost to find self-introductions and extract the speaker's name. We construct a feature set combining bag-of-words, positional context, structural signals, introductory phrase indicators, and discourse context features. Among the three classifiers, XGBoost achieves the best performance with an F1 score of 0.9747 and the fewest total errors; adding fine-tuned BERT probability features improves this further. As an extension, we score the full candidate dataset with a fine-tuned BERT classifier and add BERT probability outputs as features. This BERT-augmented XGBoost model improves F1 from 0.9747 to 0.9782 and reduces total test errors from 241 to 207. The primary gain over the decision tree baseline (F1 0.9323) is driven by discourse context features and the boosting ensemble strategy; BERT provides a modest complementary signal. Analysis of false positives reveals that a minority are genuine self-introductions mislabeled due to name inconsistencies in the source data, indicating that measured metrics modestly understate true performance.
- Abstract(参考訳): 自己導入は立法委員会の証言でよく見られる。
官庁会議における話者識別作業において, 話者を検知し, 話者名を抽出することは, 極めて有用である。
本稿では,機械学習を用いた立法委員会証言における自己導入検出パイプラインを提案する。
我々は、5つの州議会セッションにまたがる145万の発話からトレーニングデータセットを構築し、自動ラベルを生成するために名前マッチングヒューリスティックを適用し、決定木、ランダムフォレスト、XGBoostという3つの分類器を訓練し、自己紹介を見つけ、話者名を抽出する。
単語の袋、位置的文脈、構造的信号、導入語句指示器、会話文脈特徴を組み合わせた特徴セットを構築する。
3つの分類器のうち、XGBoost は F1 スコア 0.9747 と最小の総誤差で最高の性能を達成している。
拡張として、細調整されたBERT分類器を用いて完全な候補データセットをスコアし、BERT確率出力を特徴として追加する。
このBERT拡張XGBoostモデルはF1を0.9747から0.9782に改善し、テスト全体のエラーを241から207に削減する。
決定ツリーベースライン(F1 0.9323)に対する主要な利得は、談話コンテキストの特徴とブースティングアンサンブル戦略によって駆動される。
偽陽性の分析では、少数派はソースデータに名前の不整合により誤記された真の自己導入であることが明らかとなり、測定値が適度に真のパフォーマンスを下記している。
関連論文リスト
- Validation-Stage Combinatorial Fusion Analysis for Imbalanced Credit-Card Fraud Detection [8.713333739961403]
本稿では, Combinatorial Fusion Analysis (CFA) がIEEE-CIS Fraud Detectionベンチマークに価値を付加できるかどうかを検討する。
CFA は AUC-ROC のソフト投票と一致し、AUPRC と F1 を改善し、この設定では勾配の積み重ねを上回ります。
論文 参考訳(メタデータ) (2026-06-09T04:14:59Z) - A Semi-Supervised Framework for Speech Confidence Detection using Whisper [3.3994598883947496]
本稿では,Whisperエンコーダの深いセマンティック埋め込みを解釈可能な音響特徴ベクトルと融合する半教師付きハイブリッドフレームワークを提案する。
地盤の真理データへの依存を軽減するため,不確実性に配慮した擬似ラベル戦略を導入する。
実験の結果,提案手法はマクロF1スコアが0.751であり,自己教師付きベースラインよりも優れていた。
論文 参考訳(メタデータ) (2026-05-12T16:50:54Z) - Binary Token-Level Classification with DeBERTa for All-Type MWE Identification: A Lightweight Approach with Linguistic Enhancement [1.8429656136522097]
本稿では,バイナリトークンレベルの分類,言語的特徴の統合,データ拡張を組み合わせた,MWE識別のための包括的アプローチを提案する。
我々のDeBERTa-v3大規模モデルは、CoAMデータセット上で69.8%のF1を達成し、このデータセットで最高の結果(Qwen-72B, 57.8% F1)を12ポイント上回り、パラメータは165倍少ない。
論文 参考訳(メタデータ) (2026-01-27T08:42:54Z) - Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness [61.45587642780908]
画像テキスト基礎モデルのパラメータ効率向上のための3段階のアプローチを提案する。
本手法は, マイノリティ標本同定とロバストトレーニングアルゴリズムの2つの重要な要素を改良する。
我々の理論分析は,PPAが少数群の識別を向上し,バランスの取れたグループエラーを最小限に抑えるためにベイズが最適であることを示している。
論文 参考訳(メタデータ) (2025-03-12T15:46:12Z) - Multitask Fine-Tuning and Generative Adversarial Learning for Improved Auxiliary Classification [0.0]
3つの下流タスクをマルチタスクで微調整するための新しいBERTアーキテクチャを実装した。
我々のモデルであるMultitask BERTは、レイヤ共有とトリプルトアーキテクチャ、カスタム文ペアトークン化、損失ペアリング、勾配手術を取り入れています。
また、BERTに生成逆学習を適用し、潜在空間から写像して偽の埋め込みを生成する条件付きジェネレータモデルを構築した。
論文 参考訳(メタデータ) (2024-08-11T20:05:54Z) - Co-training for Low Resource Scientific Natural Language Inference [65.37685198688538]
遠隔教師付きラベルに分類器のトレーニング力学に基づいて重みを割り当てる新しいコトレーニング手法を提案する。
予測された信頼度に対する任意のしきい値に基づいてサンプルをフィルタリングするのではなく、重要重みを割り当てることにより、自動ラベル付きデータの使用を最大化する。
提案手法は、遠隔監視ベースラインに対するマクロF1の1.5%の改善と、他の強力なSSLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2024-06-20T18:35:47Z) - M-Tuning: Prompt Tuning with Mitigated Label Bias in Open-Set Scenarios [58.617025733655005]
緩和ラベルバイアス(M-Tuning)を用いた視覚言語プロンプトチューニング手法を提案する。
これはWordNetからのオープンワードを導入し、クローズドセットラベルワードのみからもっと多くのプロンプトテキストを形成する単語の範囲を広げ、シミュレートされたオープンセットシナリオでプロンプトをチューニングする。
提案手法は,様々なスケールのデータセット上で最高の性能を達成し,広範囲にわたるアブレーション研究もその有効性を検証した。
論文 参考訳(メタデータ) (2023-03-09T09:05:47Z) - Co-training an Unsupervised Constituency Parser with Weak Supervision [33.63314110665062]
本稿では,あるノードが文中の特定のスパンを支配しているかどうかを識別するために,ブートストラップ分類器に依存する教師なし解析手法を提案する。
両者の相互作用が両者の精度の向上に役立ち、その結果、効果的に解析できることが示される。
論文 参考訳(メタデータ) (2021-10-05T18:45:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。