論文の概要: Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines
- arxiv url: http://arxiv.org/abs/2606.25838v1
- Date: Wed, 24 Jun 2026 13:51:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.352502
- Title: Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines
- Title(参考訳): 埋め込み前のエッジ - ビジョンランゲージパイプラインのための信頼を意識したBlurゲート
- Abstract要約: MagikaDocumentFromPixelは、1つのイメージを1つのCPUコアで約7ミリ秒でシャープ、ぼやけた、あるいは不確実なものとして分類する。
ラプラシア語で書かれた補助的な入力チャネルは、古典的なぼけが依存しているスペクトル証拠に直接アクセスする。
最後のレシピであるMobileNetV3-Large with the EPM with 384x384 at paired GoPro Large frames, evaluate with 5-scale test-time augmentation with F1 = 0.9803 (AUC 0.9989) with a 17 MB ONNX artifact。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Production vision pipelines silently degrade on blurry input, wasting compute on downstream OCR, retrieval, and vision-language model (VLM) calls that cannot recover a usable output. We present MagikaDocumentFromPixel, a lightweight, CPU-friendly image quality gate that classifies a single image as sharp, blurred, or uncertain in roughly 7 ms on a single CPU core. The contributions are (i) a recipe selected from a 46-configuration, 8-sweep empirical search that isolates input resolution as the dominant lever and shows architecture capacity only pays off at >= 384 px; (ii) a confidence-aware routing formalism grounded in classical selective prediction; (iii) the Edge Prior Module (EPM), a Laplacian-magnitude auxiliary input channel that gives the network direct access to the spectral evidence that classical blur heuristics rely on and that lifts test F1 by +1.3 points in a matched-env comparison; and (iv) an observation that the gate is one instance of a recurring design pattern that appears independently in Magika content-type detection, risk-controlled OCR with VLMs, and DocVLM. The final recipe MobileNetV3-Large with the EPM trained at 384x384 on paired GoPro Large frames, evaluated with 5-scale test-time augmentation reaches F1 = 0.9803 (AUC 0.9989) with a 17 MB ONNX artifact, improving over our fixed-scale baseline on the same hardware (F1 = 0.9672) by +1.31 points. We are explicit about limitations: results are on a single motion-blur distribution, numbers are from a single seed, and calibration is qualitative rather than measured.
- Abstract(参考訳): 生産用ビジョンパイプラインは、ぼやけた入力、下流のOCRでの計算の浪費、検索、使用可能な出力を回復できない視覚言語モデル(VLM)コールで静かに劣化する。
MagikaDocumentFromPixelは軽量でCPUフレンドリーな画像品質ゲートで、1つのイメージを1つのCPUコアで約7ミリ秒でシャープ、ぼやけた、あるいは不確実なものとして分類する。
貢献
i) 入力解像度を支配的なレバーとして分離し,アーキテクチャ容量が >=384 px であることを示す,46 構成 8-sweep な経験探索から選択されたレシピ
(二 古典的選択予測に基づく信頼に敏感な経路形式
3 エッジ優先モジュール(EPM)は、古典的ぼかしヒューリスティックスが依存しており、マッチしたエンヴ比較においてテストF1を+1.3ポイント上げているというスペクトル証拠に直接アクセスするラプラシアン級補助入力チャネルである。
四 ゲートは、マギカ内容型検出、VLMによるリスク制御OCR、DocVLMに独立して現れる繰り返し設計パターンの一例である。
最後のレシピであるMobileNetV3-Large with the EPM with 384x384 on paired GoPro Large frames, evaluate with 5-scale test-time augmentation with F1 = 0.9803 (AUC 0.9989) with a 17 MB ONNX artifact, improve over our fixed-scale baseline on the same hardware (F1 = 0.9672) by +1.31 points。
結果は単一の動き-色分布であり、数字は単一のシードからであり、キャリブレーションは測定ではなく質的である。
関連論文リスト
- Federated Binary Gating with Server-Side Vision-Language Inference for Surveillance Anomaly Classification [0.24629531282150874]
サーバ側ゼロショットVLM推論とCNNゲートを組み合わせたハイブリッド2段アーキテクチャを提案する。
我々は,UCF-Crimeを5つの粗いメタクラスに分類し,実際の3ノードヘテロジニアス展開においてフェデレーションステージを実装した。
論文 参考訳(メタデータ) (2026-09-07T12:14:57Z) - Mind the Rift: Cross-Scale Coupling Mismatch for AI-Generated Video Detection [10.264738258468254]
クロススケールカップリングミスマッチは新しい法医学的信号である。
自然ビデオでは、マクロレベルの時間的ダイナミクスとマイクロレベルの残留パターンは、統合されたイメージング物理パイプラインによって本質的に結合される。
しかし、この共同分布を明示的に保持していないトレーニング目的を持つAIジェネレータは、この結合を体系的に違反する。
このようなミスマッチの検出は、両方のスケールで独立して情報を抽出する必要があるため、難しい。
論文 参考訳(メタデータ) (2026-09-01T05:23:48Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model [60.85752511708308]
本稿では,リアルタイムマルチモーダル理解とインタラクションのための効率的なストリーミング基盤モデルであるMage-VLを提案する。
その中核として、我々のカスタムトークンであるMage-ViTは、動的エントロピーリッチな領域を選択的に符号化することで、一様フレームサンプリングを置き換える。
我々は、キャプションとAI駆動のパフォーマンス診断のためのプロンプトコード共同最適化を含むAI4AIデータパイプラインを確立する。
論文 参考訳(メタデータ) (2026-07-27T17:59:53Z) - Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion [1.6950215926321557]
本稿では,ECCV 2026におけるABAW11チャレンジのために開発されたビデオにおけるAmbivalence/Hesitancy(A/H)認識のためのフレームワークを提案する。
提案手法は,BAHデータセットから抽出したテキスト,音響,視覚のモダリティを融合する。
このモデルは検証セット上で textbf0.7394 のマクロ F1 を達成する。
論文 参考訳(メタデータ) (2026-07-17T09:23:36Z) - Disagreement-Based Cross-Model Routing for Implicit Video Question Answering [0.0]
我々はImplicitQAベンチマークを用いて,複数選択のビデオ質問応答について検討した。
このベンチマークでは、単一のフロンティアビデオLLMが、その精度の天井付近ですでに動作している。
ラベルやトレーニングを必要とせず、純粋な推論時間である、不一致に基づくクロスモデルルーティングを提案する。
論文 参考訳(メタデータ) (2026-05-31T05:56:27Z) - Detect Before You Leap: Mirage Detection in Vision-Language Models [2.6212127510234797]
視覚言語モデル(VLM)は、必要な視覚的証拠が欠落している、空白である、あるいは疑問に無関係である場合でも、自信ある視覚的答えを生み出すことができる。
プレリリースミラージュ検出について検討し、画像探索ペアが与えられた場合、VLMが応答するかどうかを判定する。
本稿では,CLIP ViT-H/14ビジョンエンコーダのレイヤ間でパッチトケン表現を探索するモデル非依存手法であるテクストコンディション・レイヤワイド・インテリアアライメント(TC-LIA)を提案する。
論文 参考訳(メタデータ) (2026-05-29T23:51:35Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - D3R-Net: Dual-Domain Denoising Reconstruction Network for Robust Industrial Anomaly Detection [0.0]
非教師付き異常検出(UAD)は、現代の製造において、自動視覚検査の鍵となる要素である。
本稿では、D3R-Netについて紹介する。D3R-Netは、自己教師型「癒し」タスクと周波数認識正規化を結合したデュアルドメイン・デノベーション・コンストラクションフレームワークである。
空間平均二乗誤差に加えて、周波数領域の整合性を促進するFast Fourier Transform (FFT) 等級損失を用いる。
論文 参考訳(メタデータ) (2026-01-27T23:21:59Z) - CoV: Chain-of-View Prompting for Spatial Reasoning [64.77921266428824]
CoV(Chain-of-View)は、視覚言語モデルをアクティブな視点推論子に変換する。
我々はOpenEQA上でのCoVの評価を行い、Qwen3-VL-Flashで最大13.62%向上したLLM-Matchで平均+11.56%改善した。
論文 参考訳(メタデータ) (2026-01-08T17:59:42Z) - LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning [73.90466023069125]
ビデオクリップに適応的にズームイン可能なモデルであるLOVE-R1を提案する。
モデルはまず、密度の高いサンプルフレームが提供されるが、小さな解像度で提供される。
空間的詳細が必要な場合、大きなフレーム解像度で興味のあるクリップを拡大することができる。
論文 参考訳(メタデータ) (2025-09-29T13:43:55Z) - Self-Distilled Masked Auto-Encoders are Efficient Video Anomaly
Detectors [117.61449210940955]
ビデオフレームレベルで適用された軽量マスク付きオートエンコーダ(AE)に基づく効率的な異常事象検出モデルを提案する。
動き勾配に基づく重みトークンへのアプローチを導入し、静的背景シーンから前景オブジェクトへ焦点を移す。
トレーニングビデオの強化のために合成異常事象を生成し,マスク付きAEモデルを用いてオリジナルのフレームを共同で再構築する。
論文 参考訳(メタデータ) (2023-06-21T06:18:05Z) - VideoFlow: Exploiting Temporal Cues for Multi-frame Optical Flow
Estimation [61.660040308290796]
VideoFlowはビデオのための新しい光フロー推定フレームワークである。
まず、TRiフレーム光フロー(TROF)モジュールを提案し、3フレーム方式で中央フレームの双方向光フローを推定する。
反復流量推定精細化により、個々のTROFに融合した情報をMOPを介して全シーケンスに伝播することができる。
論文 参考訳(メタデータ) (2023-03-15T03:14:30Z) - U-Flow: A U-shaped Normalizing Flow for Anomaly Detection with Unsupervised Threshold [0.40964539027092906]
画像中の異常セグメンテーションのための一級自己教師方式を提案する。
現代の機械学習アプローチと、より古典的な統計的検出理論の恩恵を受けている。
提案手法は、すべてのメトリクスとすべてのデータセットに対して最先端の結果を生成する。
論文 参考訳(メタデータ) (2022-11-22T15:43:19Z) - Pruning Self-attentions into Convolutional Layers in Single Path [89.55361659622305]
ビジョントランスフォーマー(ViT)は、様々なコンピュータビジョンタスクに対して印象的なパフォーマンスを実現している。
トレーニング済みのViTを効率よく自動圧縮するSPViT(Single-Path Vision Transformer pruning)を提案する。
われわれのSPViTはDeiT-Bで52.0%のFLOPをトリミングできる。
論文 参考訳(メタデータ) (2021-11-23T11:35:54Z) - FOVEA: Foveated Image Magnification for Autonomous Navigation [53.69803081925454]
入力キャンバスを小さく保ちながら、ある領域を弾性的に拡大する注意的アプローチを提案する。
提案手法は,高速R-CNNより高速かつ微調整の少ない検出APを高速化する。
Argoverse-HD と BDD100K の自律走行データセットでは,提案手法が標準の高速 R-CNN を超越した検出APを微調整なしで促進することを示す。
論文 参考訳(メタデータ) (2021-08-27T03:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。