論文の概要: Paying for Too Many Tokens? Valid and Cost-Efficient Multimodal LLM Annotation with Simple Heuristics
- arxiv url: http://arxiv.org/abs/2610.00809v1
- Date: Wed, 30 Sep 2026 22:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.800056
- Title: Paying for Too Many Tokens? Valid and Cost-Efficient Multimodal LLM Annotation with Simple Heuristics
- Title(参考訳): あまりにも多くのトークンに対する支払い : 単純ヒューリスティックスを用いた多モードLDMアノテーションの有効性とコスト効率
- Abstract要約: VLM(Vision-Language Models)は、ビデオアノテーションの大規模化を可能にするが、コストは急速に増大する。
コスト削減のために、研究者はフレームのサンプリング、動画を画像グリッドに圧縮する、あるいは単一のモダリティのみを使用するといったサブセットに頼っている。
我々は,2つの計算社会科学(CSS)課題(感情とトピック分類)について,ショートフォームビデオを用いてこれらの推論を評価する。
- 参考スコア(独自算出の注目度): 3.716965622352967
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) enable video annotation at scale, but costs accumulate quickly: processing a typical 60-second short-form video at one frame per second requires millions of tokens. To reduce costs, researchers rely on heuristics such as sampling a subset of frames, compressing videos into image grids, or using only a single modality. However, it remains unclear which heuristics save cost, and whether they preserve the downstream conclusions these annotations enable. To address this gap, we conduct a systematic evaluation of these heuristics using short-form videos, on two computational social science (CSS) tasks: sentiment and topic classification. We evaluate each configuration along three axes the literature typically treats separately: classification accuracy, validity of downstream inference, and per-video token cost. First, we find that accuracy and validity diverge: the highest-accuracy configuration can produce wrong conclusions. Second, modality value is not guaranteed: text alone can yield strong performance, indicating that adding modalities can add cost without adding signal. Finally, we find that cost can be decoupled from video length when annotating short-form videos: a single $2\times8$ image grid built via simple shot-transition detection approaches full-video understanding ($κ$ within~.05), at $\sim 15\%$ of the token cost. Based on these findings, we derive guidelines that can enable cost-aware VLM annotation in CSS.
- Abstract(参考訳): VLM(Vision-Language Models)は、ビデオアノテーションの大規模化を可能にするが、コストは急速に増大する。
コストを削減するために、研究者は、フレームのサブセットをサンプリングしたり、動画を画像グリッドに圧縮したり、単一のモダリティだけを使用するといったヒューリスティックな手法に頼っている。
しかし、どのヒューリスティックがコストを節約し、これらのアノテーションがダウンストリームの結論を維持できるかどうかは不明だ。
このギャップに対処するために、我々は2つの計算社会科学(CSS)課題である感情とトピック分類に基づいて、短いビデオを用いてこれらのヒューリスティックスを体系的に評価する。
文献が扱う3つの軸に沿って,分類精度,下流推定の妥当性,ビデオ単位のトークンコストの3つについて,それぞれの構成を評価する。
まず、精度と妥当性はばらつき、最も高精度な構成は間違った結論を導き出すことができる。
第二に、モダリティの値は保証されない: テキストだけでは、強力なパフォーマンスをもたらすことができ、モダリティの追加は、信号を追加することなくコストを加算できることを示している。
最後に、短いフォーマットの動画に注釈をつける場合、コストはビデオの長さから切り離すことができる。単純なショット・トランジション検出アプローチ(κ$ 〜.05)で構築されたイメージグリッドは、トークンのコストの 15 % に対して$\sim である。
これらの知見に基づき、CSSにおけるコスト対応VLMアノテーションを有効にするためのガイドラインを導出する。
関連論文リスト
- Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs [2.1665689529884697]
ビデオ理解はビデオ大言語モデル(VideoLLMs)へと急速に進化した
キャプション、質問応答、検索、時間的グラウンドにおける彼らの強いパフォーマンスは、フレーム数とコンテキストの長さで増大する計算とメモリコストである。
この調査では、パラメータ数、入力毎のFLOP、レイテンシ、メモリ、およびビジュアルおよびオーディオトークン数の具体的な削減を報告した、視覚的およびオーディオ的ビデオLLMの推論効率メカニズムについて取り上げる。
論文 参考訳(メタデータ) (2026-09-09T15:50:39Z) - Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions [75.23170605943457]
textbfmodelは、メモリ統合から推論制御を分離するフレームワークである。
emphActive Thinking Decision Maker (ATDM)は、決定プロセスの外部化を行う透明な推論コントローラである。
emphHierarchical Progressive Semantic Integration (HPSI)モジュールは効率的なメモリシステムとして機能する。
論文 参考訳(メタデータ) (2026-04-20T16:15:33Z) - EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation [80.13014959623452]
EVATokは、$textbfE$fficient $textbfV$ideo $textbfA$daptive $textbfTok$enizersを生成するフレームワークである。
EVATok は UCF-101 上でより優れた再構成と最先端のクラス・ビデオ生成を実現する。
論文 参考訳(メタデータ) (2026-03-12T17:59:59Z) - CoPE-VideoLM: Codec Primitives For Efficient Video Language Models [56.76440182038839]
ビデオ言語モデル(Video Language Models, ビデオ言語モデル)は、ビデオの時間的ダイナミクスを理解するためのAIシステムである。
現在の方法では、マクロレベルのイベントとマイクロレベルの詳細の両方を見逃すことができるサンプリングを使用する。
多くのフレームに対して高価なフルイメージエンコーディングを必要とせず、ビデオ冗長性と疎結合性を符号化するビデオプリミティブを活用することを提案する。
論文 参考訳(メタデータ) (2026-02-13T18:57:31Z) - Test-Time Temporal Sampling for Efficient MLLM Video Understanding [26.144261085897863]
Test-Time Temporal Sampling (T3S) は、MLLMが効率よくかつ効果的に長編ビデオを処理できるトレーニングフリーのプラグアンドプレイ推論ラッパーである。
我々の手法は推論時に完全に動作し、モデル修正や微調整は不要であり、幅広い事前訓練されたMLLMと互換性がある。
論文 参考訳(メタデータ) (2025-11-22T06:59:21Z) - VQToken: Neural Discrete Token Representation Learning for Extreme Token Reduction in Video Large Language Models [35.38573641029626]
最小限の離散トークンを用いてビデオ全体を表現することを目的としたExtreme Short Token Reductionという新しいタスクを紹介した。
Extreme Short Token Reductionタスクでは、私たちのVQTokenはシーケンスをオリジナルの長さのわずか0.07パーセントまで圧縮し、NextQA-MCベンチマークでは0.6%の精度しか達成していません。
論文 参考訳(メタデータ) (2025-03-21T09:46:31Z) - VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers [23.541896057977745]
VideoScanは、リアルタイムビデオインタラクションのための効率的な視覚言語モデル(VLM)推論フレームワークである。
VideoScanでは、各フレームを表すために単一のセマンティックキャリアトークンを使用している。
論文 参考訳(メタデータ) (2025-03-12T13:30:40Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - NSNet: Non-saliency Suppression Sampler for Efficient Video Recognition [89.84188594758588]
非定常フレームの応答を抑制するために, NSNet(Non-Sliency Suppression Network)を提案する。
NSNetは最先端の精度効率トレードオフを実現し、最先端の手法よりもはるかに高速な2.44.3xの実用的な推論速度を示す。
論文 参考訳(メタデータ) (2022-07-21T09:41:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。