論文の概要: When Does a Laugh Begin? Structured Annotator Disagreement in Temporal Laughter Localization
- arxiv url: http://arxiv.org/abs/2609.06646v2
- Date: Wed, 09 Sep 2026 10:59:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.288539
- Title: When Does a Laugh Begin? Structured Annotator Disagreement in Temporal Laughter Localization
- Title(参考訳): 遅延はいつ起こるか : 時間的娘の局所化における構造的アノテーションの診断
- Authors: Eyal Hanania, Daniel Arkushin, Naveh Ayal, Jonathan Benvenisti, Amos Bercovich, Elie Zemmour, Sahar Froim,
- Abstract要約: 注釈者は、笑いの境界と微妙なチャックルにいつも反対する。
この不一致は、ランダムノイズではなく、構造化されていることを示す。
本稿では,全アノテータ分布に対する予測値を評価する不一致校正評価を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Annotators routinely disagree on laughter boundaries and subtle chuckles, yet temporal laughter localization typically evaluates against a single reference annotation. We show that this disagreement is structured rather than random noise. Re-annotating the SMILE-Temporal benchmark (672 videos, 1,683 events) with 3-5 annotators per video (alpha = 0.757), we find systematic patterns: disagreement is 1.73 times larger at offsets than onsets, far more common for chuckles than full laughs (77% vs. 20%), and predictable from event attributes (AUC = 0.831). Evaluating against a single annotator breaks down under this structure: system scores shift by 0.246 F1 depending on the chosen ground truth, correctly ranking systems only 69.7% of the time (vs. 80% against all annotators). We propose a disagreement-calibrated evaluation that scores predictions against the full annotator distribution using conformally calibrated tolerance bands (wider at offsets, 0.727s, than onsets, 0.5s). The per-annotator annotations and analysis code are available at https://github.com/WSCSports/MTLLFM-temporal-laughter-localization.
- Abstract(参考訳): 注釈者は、笑いの境界と微妙なチャックルにいつも反対するが、時間的笑いの局所化は通常、単一の参照アノテーションに対して評価する。
この不一致は、ランダムノイズではなく、構造化されていることを示す。
SMILE-Temporalベンチマーク(672の動画、1,683のイベント)にビデオあたり3,5のアノテーション(alpha = 0.757)で注釈を付けると、体系的なパターンが見つかる。
システムスコアは、選択された真実によって0.246 F1にシフトし、正しくランク付けされたシステムは69.7%(全アノテータに対して80%)に過ぎなかった。
そこで本研究では,アノテータの完全分布に対して,アノテータの完全分布に対する予測を正則に校正したトレランスバンド(オフセットでは0.727,オンセットでは0.5)を用いて評価する不一致校正評価法を提案する。
アノテーションごとのアノテーションと分析コードはhttps://github.com/WSCSports/MTLLFM-temporal-laughter-localizationで公開されている。
関連論文リスト
- Beyond Lexical Metrics: Sentence-Embedding Detection of Reviewer Habituation in AI Code Review [2.9152186617858304]
我々は11,429件のレビューと10,104件のAIによる人間によるインラインコメントを比較した。
審査員の早期の承認率は30.5%から後期の36.6%に上昇した。
語彙多様性、シャノンエントロピー、技術的特異性、建設的行動可能性の4つの手作り言語的特徴は、露光の奇形全体で単調な減少を示さない。
論文 参考訳(メタデータ) (2026-09-05T18:15:18Z) - Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization Analysis [0.0]
ラテン音場正書法で書かれたクルド方言の音声認識を評価する。
原文のアラビア文字仮説は111.70%のWERと100.92%のCERであり、正確な単語一致はゼロである。
ラテン語の文字化では102.36%のWERと57.89%のCERが与えられ、参照を縮小した正書法に折り畳むと97.85%と51.20%となる。
論文 参考訳(メタデータ) (2026-08-17T10:31:30Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes [0.0]
大規模言語モデル(LLM)システムは、ピアレビューを支援するためにますます提案されている。
ほとんどの評価は、システムが割り当てる数値スコアの妥当性ではなく、機械生成レビューテキストの散文を判断する。
提案した原稿を読み取って5つの0-100品質ディメンションと重み付き総合スコアを出力するAIPRを検証する。
論文 参考訳(メタデータ) (2026-06-14T16:13:15Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - ORCA: Open-ended Response Correctness Assessment for Audio Question Answering [41.72231074041232]
本研究では,予測精度と不確実性の両方を予測するために,ベータ分布を用いた人的判断の変動をモデル化するフレームワークORCAを提案する。
我々は15のLALMから11,721のアノテーションを収集し,0.82(クリッペンドルフのα)のアノテータ間契約を達成した。
論文 参考訳(メタデータ) (2025-11-28T14:41:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。