論文の概要: Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse
- arxiv url: http://arxiv.org/abs/2607.10846v1
- Date: Sun, 12 Jul 2026 17:15:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.552904
- Title: Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse
- Title(参考訳): LLMに基づく公開談話のスタンス解析における不安定性源の定量化
- Authors: Bo Chen,
- Abstract要約: 不安定性の2つの異なる源は、パイプラインが同じ入力から異なる出力を生成する際に生じる。
5つのドメインから41のパブリックフィギュアを対象とする256のYouTubeインタビューを用いて、2つの話者ダイアリゼーションパイプラインと2つの測定方法を比較した。
プレプロセスパイプラインの感度は、限られたビデオサンプルを持つ話者に集中していることがわかった。
- 参考スコア(独自算出の注目度): 4.093009863847175
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computational social science increasingly relies on automated preprocessing pipelines -- speaker diarization, ASR transcript cleaning, sentence segmentation -- to convert raw media into analyzable text. When these pipelines produce different outputs from the same input, two distinct sources of instability can arise: the preprocessing pipeline itself (diarization method, segmentation rules) and the downstream measurement instrument (LLM annotation vs.\ keyword lexicon). Using 256 YouTube interviews across 41 public figures from five domains, we compare two speaker-diarization pipelines and two measurement methods, all targeting the coupling between affective valence and epistemic modality. We find that (1) preprocessing pipeline sensitivity is concentrated in speakers with limited video samples (N $\leq 5$); for the four best-sampled speakers (N $\geq 16$), the mean absolute pipeline-induced change in $r(\text{neg}, \text{emph})$ is only $0.13$; (2) cross-method disagreement is larger and more systematic -- the LLM and keyword-lexicon methods assign opposite coupling directions to several well-sampled speakers, even within the same preprocessing pipeline; and (3) aggregate valence proportions are highly stable ($|Δp(\text{neg})| < 6$pp) regardless of pipeline or method, masking both sources of instability. The contribution is a diagnostic framework that separates pipeline effects from measurement effects: researchers studying cross-dimensional relationships in interview data should verify that their conclusions are robust to both sources of variation, with particular attention to measurement method choice.
- Abstract(参考訳): 計算社会科学は、生メディアを分析可能なテキストに変換するために、自動前処理パイプライン(話者ダイアリゼーション、ASR転写のクリーニング、文のセグメンテーション)にますます依存している。
これらのパイプラインが同一入力から異なる出力を生成すると、前処理パイプライン自体(ダイアリゼーションメソッド、セグメンテーションルール)と下流計測器(LLMアノテーション対)という2つの異なる不安定なソースが発生する。
lexicon (複数形 lexicons)
5つのドメインから41の公開人物を対象に256のYouTubeインタビューを行い、2つの話者ダイアリゼーションパイプラインと2つの測定方法を比較した。
1)プレプロセスパイプラインの感度は,ビデオサンプルが限定された話者(N$\leq 5$),4つのベストサンプリング話者(N$\geq 16$)に対して,$r(\text{neg}, \text{emph})$の平均絶対的なパイプライン誘起変化はわずか0.13$, (2) クロスメソッドの不一致はより大きく,体系的である。
このコントリビューションは、パイプライン効果と測定効果を分離する診断フレームワークである。インタビューデータにおけるクロス次元関係を研究する研究者は、それぞれの結論が、測定方法の選択に特に注意を払って、両方の要因に対して堅牢であることを検証する必要がある。
関連論文リスト
- Position: AI for Science Should Treat Measurement-to-Dataset Pipelines as Inference Components [2.439525434311725]
間接観察に依存する領域において、学習者は多段階計測、再構成、前処理パイプラインによって生成された微分表現を観察する。
「この凍結レンズから生じる3つの故障モードを特定します。」
私たちはAI4Scienceコミュニティに、ドメイン固有のComputable Observation Frameworkを通じて、パイプラインに計算可能な推論オブジェクトを作成するよう呼びかけています。
論文 参考訳(メタデータ) (2026-05-23T12:50:00Z) - PARM: Pipeline-Adapted Reward Model [60.769414637325326]
リワードモデル(RM)は、大規模言語モデル(LLM)を人間の好みと整合させることの中心であり、高度な復号化戦略を推進している。
これまでの作業はシングルステップ生成に重点を置いていたが、現実のアプリケーションはますますマルチステージパイプラインを採用するようになっている。
我々は、最適化のためのコード生成を通じてこれを調査し、報酬モデルを定式化とソリューション段階の両方に統合するパイプラインを構築する。
論文 参考訳(メタデータ) (2026-04-20T14:29:08Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - A Dialectic Pipeline for Improving LLM Robustness [0.0]
ドメイン固有のデータの微調整や、別のテキスト化されたホック検証器の訓練といった手法は、計算資源を必要とする。
本稿では,LLMの一般化能力を保ちながら,自己対話による解の質を向上する弁証的パイプラインを提案する。
提案した弁証法パイプラインは,標準モデル解の有意なマージンによって性能を向上できることがわかった。
論文 参考訳(メタデータ) (2026-01-28T14:42:49Z) - DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation [24.086354908256293]
textbfDVDは、温度サンプリングによって誘導される局所的な出力分布をモデル化する単一サンプル検出器である。
我々は,Omni-MATH と SuperGPQA の2つの領域にわたる変異汚染の最初のベンチマークを構築した。
textbfDVDは、パープレキシティベース、Min-$k$%++、編集距離(CDD)、埋め込み類似性ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-01-08T12:48:40Z) - FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation [1.6174863821322776]
我々は、RAGパイプライン全体を評価するために設計されたベンチマークを導入する。
パイプラインの摂食能力を評価するために設計された93の質問のデータセットを提示する。
クローズドソースパイプラインは、正確性と幻覚の指標の両方で、オープンソースパイプラインを著しく上回ります。
論文 参考訳(メタデータ) (2025-10-10T02:51:47Z) - Sound Event Classification in an Industrial Environment: Pipe Leakage
Detection Use Case [3.9414768019101682]
産業環境におけるパイプ漏れ検出のための多段階機械学習パイプラインを提案する。
提案されたパイプラインは複数のステップを適用し、それぞれが環境の課題に対処する。
その結果, 精度99%, F1スコア0.93, 0.9の優れた結果が得られた。
論文 参考訳(メタデータ) (2022-05-05T15:26:22Z) - Single-channel speech separation using Soft-minimum Permutation
Invariant Training [60.99112031408449]
教師付き音声分離における長寿命問題は、それぞれの分離された音声信号の正しいラベルを見つけることである。
Permutation Invariant Training (PIT) はラベルあいまいさ問題に対処する上で有望な解決策であることが示されている。
そこで本研究では,PITの不効率に対処する確率的最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2021-11-16T17:25:05Z) - Bridging the Gap Between Clean Data Training and Real-World Inference
for Spoken Language Understanding [76.89426311082927]
既存のモデルはクリーンデータに基づいてトレーニングされ、クリーンデータトレーニングと現実世界の推論の間にtextitgapが発生する。
本稿では,良質なサンプルと低品質のサンプルの両方が類似ベクトル空間に埋め込まれた領域適応法を提案する。
広く使用されているデータセット、スニップス、および大規模な社内データセット(1000万のトレーニング例)に関する実験では、この方法は実世界の(騒々しい)コーパスのベースラインモデルを上回るだけでなく、堅牢性、すなわち、騒々しい環境下で高品質の結果を生み出すことを実証しています。
論文 参考訳(メタデータ) (2021-04-13T17:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。