論文の概要: TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos
- arxiv url: http://arxiv.org/abs/2607.16635v1
- Date: Sat, 18 Jul 2026 04:37:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.212646
- Title: TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos
- Title(参考訳): TellTale: ビデオにおけるマルチインスタンスLoRAテキストエンコーダとZero-Shot LLMジャッジ
- Abstract要約: TellTaleは、インタビュービデオにおけるアンビバレンス/ヘシタシー(A/H)認識に対するテキストのみのアプローチである。
TellTaleは書き起こしのみに依存し、3つの確率ストリームを結合する。
主催者による152本の動画のプライベートテストセットで、TellTaleはMacro-F1の0.7364、平均精度0.7940を達成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present TellTale, a text-only approach to ambivalence/hesitancy (A/H) recognition in interview videos, evaluated on the BAH dataset as part of the 3rd A/H Video Recognition Challenge (11th ABAW Workshop, ECCV 2026). Although the dataset provides video, audio, facial crops, and transcripts, TellTale relies on the transcript alone and combines three probability streams. Two text encoders, multilingual-e5-large and mDeBERTa-v3-base, are fine-tuned with parameter-efficient LoRA adapters under a multiple-instance learning (MIL) objective, in which transcript chunks are scored individually and pooled with a smooth maximum so that only the video-level label is needed for supervision. The third stream requires no training: a quantized 14B instruction LLM is prompted, zero-shot, to rate each transcript for A/H. The three probabilities are combined by a weighted average and a single decision threshold, both selected on participant-grouped cross-validated predictions. On the organizer-scored private test set of 152 videos from unseen participants, TellTale achieves a Macro-F1 of 0.7364 and an average precision of 0.7940, compared with 0.2827 Macro-F1 for the official vision-based baseline.
- Abstract(参考訳): 本稿では,第3回A/Hビデオ認識チャレンジ(第11回ABAWワークショップ,ECCV 2026)の一環として,BAHデータセット上で評価を行った。
このデータセットは、ビデオ、オーディオ、顔の作物、および文字起こしを提供するが、TellTaleはトランスクリプトのみに依存し、3つの確率ストリームを組み合わせる。
マルチ言語-e5-largeとmDeBERTa-v3-baseの2つのテキストエンコーダは、MIL(Multiple-instance Learning)目標の下でパラメータ効率のよいLoRAアダプタで微調整される。
第3のストリームはトレーニングを必要とせず、量子化された14B命令 LLM は、A/H の各々の書き起こしを評価するために、ゼロショットで誘導される。
3つの確率は、重み付き平均と1つの決定しきい値で結合される。
未確認の参加者による152本のビデオのオーガナイザによるプライベートテストセットでは、TellTaleはMacro-F1が0.7364、平均精度が0.7940に達し、公式のビジョンベースのベースラインは0.2827 Macro-F1である。
関連論文リスト
- Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion [1.6950215926321557]
本稿では,ECCV 2026におけるABAW11チャレンジのために開発されたビデオにおけるAmbivalence/Hesitancy(A/H)認識のためのフレームワークを提案する。
提案手法は,BAHデータセットから抽出したテキスト,音響,視覚のモダリティを融合する。
このモデルは検証セット上で textbf0.7394 のマクロ F1 を達成する。
論文 参考訳(メタデータ) (2026-07-17T09:23:36Z) - Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data [49.717366362764956]
大規模ビデオ言語モデル(VLM)に基づくテキスト間検索(TVR)手法は、簡単なテキストクエリで記述することで、興味のあるイベントを検索する可能性がある。
本稿では,最初のカメラトラップTVベンチマークであるPrompting-MammAlpsを紹介し,細粒度で解釈可能なTVR法を提案する。
具体的には、視覚変換器を訓練し、時間的動作のローカライゼーションを行い、その出力を構造化されたテキストに変換し、各ビデオを記述する。
エスロジにインスパイアされたクエリは,LLM(Large-Language Model)ベースのエージェントによって処理される
論文 参考訳(メタデータ) (2026-07-10T18:09:41Z) - The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation [65.24213788883016]
本報告では,第5回PVUW MeViS-Text Challengeの優勝ソリューションについて述べる。
私たちは、強力なマルチモーダルな大規模言語モデルとSAM3を組み合わせた、完全にトレーニング不要なパイプラインを構築しています。
我々の手法はPVUW 2026 MeViS-Textテストセットで第1位であり、最終スコアは0.909064、J&Fスコアは0.7897026である。
論文 参考訳(メタデータ) (2026-04-01T02:42:30Z) - Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos [39.22382828678062]
我々は,三次整合性信号の粒度を明示的にモデル化し,公開する検出器MAGIC3を提案する。
MAGIC3は、事前抽出された特徴により、FakeSVとFakeTTのVLM以外の最強のベースラインを一貫して上回っている。
VLMレベルの精度に適合しながら、2段のシステムでは18-27倍のスループットと93%のVRAM節約を実現し、コストパフォーマンスのトレードオフが強かった。
論文 参考訳(メタデータ) (2026-03-16T08:58:02Z) - Exploring Automated Recognition of Instructional Activity and Discourse from Multimodal Classroom Data [8.014320244550243]
本研究は,マルチモーダル・インストラクショナル・アクティビティと談話認識に着目した,授業記録のAIによる分析について考察する。
164時間のビデオと68のレッスン書き起こしの高密度な注釈付きデータセットを使用して、並列なモダリティ固有のパイプラインを設計する。
微調整されたモデルはプロンプトベースのアプローチを一貫して上回り、マクロF1スコアはビデオで0.577、書き起こしで0.460である。
論文 参考訳(メタデータ) (2025-11-26T11:57:22Z) - Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization [6.057968525653529]
本稿では,ルーリック誘導型,擬似ラベル付き,即時駆動型ゼロショットビデオ要約フレームワークを提案する。
人間のアノテーションの小さなサブセットは、高信頼の擬似ラベルに変換される。
推論中、境界シーンはそれぞれの記述に基づいて独立してスコアされる。
論文 参考訳(メタデータ) (2025-10-20T12:54:32Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding [63.075626670943116]
本稿では,映像情報とテキスト情報の相乗効果を向上するための最先端フレームワークであるVaQuitAを紹介する。
データレベルでは、フレームを均一にサンプリングする代わりに、CLIPスコアランキングでガイドされるサンプリング手法を実装している。
機能レベルでは、Visual-Query Transformerと一緒にトレーニング可能なVideo Perceiverを統合します。
論文 参考訳(メタデータ) (2023-12-04T19:48:02Z) - Perception Test: A Diagnostic Benchmark for Multimodal Video Models [78.64546291816117]
本稿では,事前学習したマルチモーダルモデルの知覚と推論能力を評価するために,新しいマルチモーダルビデオベンチマークを提案する。
知覚テストは、スキル(記憶、抽象化、物理学、セマンティックス)と、ビデオ、オーディオ、テキストモダリティ間の推論(記述的、説明的、予測的、反ファクト的)のタイプに焦点を当てている。
このベンチマークは、ゼロショット/少数ショットまたは限定的な微調整方式で、転送機能の事前訓練されたモデルを探索する。
論文 参考訳(メタデータ) (2023-05-23T07:54:37Z) - Video Understanding as Machine Translation [53.59298393079866]
我々は、単一の統合フレームワークを用いて、様々なダウンストリームビデオ理解タスクに取り組む。
映像分類(EPIC-Kitchens)、質問応答(TVQA)、キャプション(TVC, YouCook2, MSR-VTT)など、いくつかのダウンストリームタスクにおいて、現状よりもパフォーマンスの向上が報告されている。
論文 参考訳(メタデータ) (2020-06-12T14:07:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。