論文の概要: BanClickThumb: A Multimodal Dataset and Transformer Fusion Benchmarks for Clickbait Detection in Bengali YouTube Videos
- arxiv url: http://arxiv.org/abs/2607.17182v1
- Date: Sun, 19 Jul 2026 10:42:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.388193
- Title: BanClickThumb: A Multimodal Dataset and Transformer Fusion Benchmarks for Clickbait Detection in Bengali YouTube Videos
- Title(参考訳): BanClickThumb: ベンガルのYouTubeビデオにおけるクリックベイト検出のためのマルチモーダルデータセットとトランスフォーマーフュージョンベンチマーク
- Abstract要約: BanClickThumbは、5つのコンテンツドメインから7,147のBengali YouTubeサムネイルタイトルペアを収集したデータセットである。
このデータセットを用いて、テキストのみ、画像のみ、マルチモーダルアプローチをベンチマークする。
ベンガル・クリックベイト検出におけるマルチモーダル・フュージョンの有用性が示唆された。
- 参考スコア(独自算出の注目度): 0.25199066832791533
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Clickbait, where video titles and thumbnails exaggerate or misrepresent content, reduces user trust, wastes attention, and promotes misinformation on video-sharing platforms. Detecting Bengali clickbait remains challenging because publicly available multimodal datasets are limited. To address this gap, we introduce BanClickThumb, a curated dataset of 7,147 Bengali YouTube thumbnail-title pairs from five content domains, annotated by ten annotators with high agreement (Cohen's Kappa: 0.83-0.93). Using this dataset, we benchmark text-only, image-only, and multimodal approaches. Among unimodal models, BanClickTextFormer (XLM-RoBERTa) achieves 0.82 accuracy, while BanClickImageFormer (SwiftFormer) reaches 0.68. Our proposed multimodal model, BanClickFusionFormer, combines ViT and XLM-RoBERTa through intermediate fusion and achieves the best accuracy of 0.84. Error analysis shows that dense thumbnail text, figurative language, and culturally specific slang remain challenging. Our findings demonstrate the effectiveness of multimodal fusion for Bengali clickbait detection and provide a publicly available benchmark to support future research on low-resource multimodal content analysis.
- Abstract(参考訳): Clickbaitは、ビデオタイトルやサムネイルがコンテンツの誇張や誤表現をし、ユーザの信頼を減らし、注意を無駄にし、ビデオ共有プラットフォーム上の誤情報を促進する。
公開されているマルチモーダルデータセットが制限されているため、Bengaliのクリックベイトの検出は依然として難しい。
このギャップに対処するために、BanClickThumbを紹介します。これは、5つのコンテンツドメインから7,147のBengali YouTubeサムネイルタイトルペアのキュレートされたデータセットで、アノテータ10名によるアノテータ(Cohen's Kappa: 0.83-0.93)です。
このデータセットを用いて、テキストのみ、画像のみ、マルチモーダルアプローチをベンチマークする。
ユニモーダルモデルの中で、BanClickTextFormer(XLM-RoBERTa)は0.82の精度で、BanClickImageFormer(SwiftFormer)は0.68に達する。
提案するマルチモーダルモデルであるBanClickFusionFormerは、中間核融合によりViTとXLM-RoBERTaを結合し、0.84の精度を実現する。
誤り分析は、密集したサムネイルテキスト、比喩的言語、文化的に固有のスラングが依然として困難であることを示している。
本研究は,ベンガルクリックベイト検出におけるマルチモーダル融合の有効性を実証し,低リソースマルチモーダルコンテンツ分析の今後の研究を支援するためのベンチマークを提供する。
関連論文リスト
- LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training [71.18006624888662]
マルチモーダル学習のための大規模オープンビデオデータセットであるLAION-BVDを提案する。
CommonCrawlから収集された1.3Bプラットフォーム固有のビデオURLを含んでいる。
総視聴時間は1000万時間で、8000万のビデオをダウンロードします。
論文 参考訳(メタデータ) (2026-08-25T17:34:19Z) - Retrieval Augmented Enhanced Dual Co-Attention Framework for Target Aware Multimodal Bengali Hateful Meme Detection [1.1172382217477128]
ソーシャルメディア上の憎しみのあるコンテンツは、有害な物語を伝えるために画像とテキストを組み合わせたマルチモーダルなミームとしてますます現れている。
これらの問題に対処するため、ベンガルのMultimodal Aggressionデータセット(MIMOSA)から意味的に整合したサンプルを用いて、Bengali Hateful Memesデータセットを拡張した。
本稿では,視覚エンコーダ (CLIP, DINOv2) と多言語テキストエンコーダ (XGLM, XLM-R) を重み付きアテンションプールにより統合し,ロバストなクロスモーダル表現を学習する拡張デュアルコアテンションフレームワーク (xDORA) を提案する。
論文 参考訳(メタデータ) (2026-02-22T14:48:25Z) - Towards Explainable Bilingual Multimodal Misinformation Detection and Localization [64.37162720126194]
BiMiは、地域レベルのローカライゼーション、言語間および言語間整合性検出、誤情報解析のための自然言語説明を共同で行うフレームワークである。
BiMiBenchは、実際のニュース画像とサブタイトルを体系的に編集するベンチマークである。
BiMiは、分類精度が+8.9で、ローカライゼーション精度が+15.9で、BERTScoreを+2.5で上回る。
論文 参考訳(メタデータ) (2025-06-28T15:43:06Z) - BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding [51.49345400300556]
大規模ビデオ言語モデル (VLM) は様々なビデオ理解タスクにおいて有望な進歩を示した。
均一なフレームサンプリングのような伝統的なアプローチは、必然的に無関係なコンテンツにリソースを割り当てる。
本稿では,フレーム選択戦略の総合的研究を通じて,付加的なトレーニングを伴わずに大規模VLMをブーストする方法であるBOLTを紹介する。
論文 参考訳(メタデータ) (2025-03-27T13:18:40Z) - BaitBuster-Bangla: A Comprehensive Dataset for Clickbait Detection in
Bangla with Multi-Feature and Multi-Modal Analysis [0.51795041186793]
本研究では,253,070個のデータポイントからなる大規模マルチモーダルなBangla YouTubeクリックベイトデータセットを提案する。
データセットには、メタデータ、一次コンテンツ、エンゲージメント統計、個々のビデオのラベルに分類される18の多様な機能が含まれている。
論文 参考訳(メタデータ) (2023-10-13T13:25:16Z) - BigVideo: A Large-scale Video Subtitle Translation Dataset for
Multimodal Machine Translation [50.22200540985927]
本稿では,大規模ビデオ字幕翻訳データセットであるBigVideoについて述べる。
BigVideoは10倍以上の大きさで、450万の文対と9,981時間のビデオで構成されている。
テキストやビデオ間で共有される共通意味をモデル化するために,クロスモーダルエンコーダにコントラスト学習手法を導入する。
論文 参考訳(メタデータ) (2023-05-23T08:53:36Z) - AutoShot: A Short Video Dataset and State-of-the-Art Shot Boundary
Detection [70.99025467739715]
我々はSHOTという新しい公開ショートビデオsHot bOundary deTectionデータセットをリリースする。
SHOTは、853の完全なショートビデオと11,606のショットアノテーションで構成され、2,716の高品質なショット境界アノテーションが200のテストビデオに含まれている。
提案手法はAutoShotと呼ばれ,従来の最先端手法よりもF1スコアが高い。
論文 参考訳(メタデータ) (2023-04-12T19:01:21Z) - Multimodal Hate Speech Detection from Bengali Memes and Texts [0.6709991492637819]
本稿では,マルチモーダルなベンガルミームとテキストからのヘイトスピーチ検出について述べる。
我々は、ヘイトスピーチ検出のためのテキスト情報と視覚情報を分析するために、複数のニューラルネットワークを訓練する。
本研究は,ベンガル語におけるヘイトスピーチ検出にはミームが適度に有用であることが示唆する。
論文 参考訳(メタデータ) (2022-04-19T11:15:25Z) - GAME-ON: Graph Attention Network based Multimodal Fusion for Fake News Detection [6.037721620350107]
我々は,マルチモーダルフェイクニュース検出のためのより堅牢なデータ表現を学習するための,グラフニューラルネットワークに基づくエンドツーエンドトレーニング可能なフレームワークであるGAME-ONを提案する。
当社のモデルはTwitter上で平均11%向上し、Weiboでは2.6%のマージンで競争力を維持する一方で、最も優れた最先端ベースラインよりも65%少ないパラメータを使用する。
論文 参考訳(メタデータ) (2022-02-25T03:27:37Z) - OCSampler: Compressing Videos to One Clip with Single-step Sampling [82.0417131211353]
本稿では,OCSampler というフレームワークを提案する。
我々の基本的な動機は、効率的なビデオ認識タスクは、フレームをシーケンシャルに拾うのではなく、シーケンス全体を一度に処理することにある。
論文 参考訳(メタデータ) (2022-01-12T09:50:38Z) - Clickbait Headline Detection in Indonesian News Sites using Multilingual
Bidirectional Encoder Representations from Transformers (M-BERT) [0.0]
埋め込み層として機能する事前学習言語モデルM−BERTを備えたニューラルネットワークと、100ノード隠蔽層とを組み合わせて、クリックベイト見出しを検出する。
トレーニングデータセットとして合計6632の見出しで、分類器は非常によく機能した。
インドネシア語テキスト分類タスクにおける多言語BERTの使用がテストされ、さらなる拡張が可能となった。
論文 参考訳(メタデータ) (2021-02-02T14:13:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。