論文の概要: LightAIR: Lightweight Action Inversion and Riemannian Rectification for Text-based Person Anomaly Search
- arxiv url: http://arxiv.org/abs/2608.09152v1
- Date: Mon, 10 Aug 2026 05:59:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.098956
- Title: LightAIR: Lightweight Action Inversion and Riemannian Rectification for Text-based Person Anomaly Search
- Title(参考訳): LightAIR: テキストベースの人物異常検索のための軽量アクションインバージョンとリーマン整形
- Abstract要約: 本稿では,人物異常検索のための軽量な動作反転補正ネットワーク(LightAIR)を提案する。
広く使用されているTPASとTIPRデータセットの実験では、LightAIRが既存の最先端メソッドを大幅に上回っていることが示されている。
- 参考スコア(独自算出の注目度): 47.5045602470916
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Traditional Text-based Person Search (TPS) is typically limited to matching static appearance attributes, severely neglecting dynamic action information. The Text-based Person Anomaly Search (TPAS) task bridges this gap, requiring models to locate micro-level specific abnormal behaviors while matching macro-level appearance of pedestrians. However, current TPAS methods face fundamental limitations: external explicit pose estimators are fragile in unconstrained surveillance scenarios, and implicit learning encounters visual decoupling failure under pixel-level entanglement, causing dominant appearance information to easily swallow and contaminate subtle action features. Furthermore, performing contrastive optimization on hard negative samples (``same appearance, different actions'') in conventional Euclidean spaces induces severe shortcut learning. To address these, we propose the Lightweight Action Inversion and Riemannian rectification network (LightAIR). First, it introduces textual semantic priors as anchors via a lightweight action inversion operator to extract pure action features, thereby overcoming visual-inherent coupling. Subsequently, it employs orthogonal null-space projection to constrain appearance features within the orthogonal complement space of action features, guaranteeing strict forward decoupling. Finally, we designed a gradient rectification module that computes the Riemannian gradient to constrain the backpropagation trajectory, forcing the gradient flow to update strictly along the tangent space that preserves decoupling properties, thereby cutting off harmful shortcuts. Extensive experiments on the widely used TPAS and TIPR datasets demonstrate that LightAIR significantly outperforms existing state-of-the-art methods. Codes are available at https://github.com/rainy-london/LightAIR
- Abstract(参考訳): 従来のテキストベースのペルソナサーチ(TPS)は、通常静的な外観属性のマッチングに限られており、動的アクション情報を著しく無視する。
テキストベースのPerson Anomaly Search(TPAS)タスクはこのギャップを埋め、歩行者のマクロレベルの外観にマッチしながら、マイクロレベルの特定の異常行動を見つける必要がある。
しかし、現在のTPAS法は基本的な制限に直面している: 外見的ポーズ推定器は制約のない監視シナリオでは脆弱であり、暗黙的な学習は画素レベルの絡み合いの下で視覚的疎結合の失敗に遭遇し、支配的な外観情報が容易に吸収され、微妙な動作特徴が汚染される。
さらに、従来のユークリッド空間における強陰性サンプル(`same appearance, different action'')のコントラスト最適化により、厳しいショートカット学習がもたらされる。
そこで本研究では,ライトウェイト・アクション・インバージョン(Lightweight Action Inversion and Riemannian rectification Network)を提案する。
まず、軽量なアクション反転演算子を介してテキストセマンティクスをアンカーとして導入し、純粋なアクション特徴を抽出し、視覚的・一貫性のある結合を克服する。
その後、直交のヌル空間投影を用いて、直交の補空間内の外観特徴を制約し、厳密な前方分離を保証する。
最後に,バックプロパゲーション軌道を制約するためにリーマン勾配を計算する勾配修正モジュールを設計し,デカップリング特性を保ったタンジェント空間に沿って勾配流を厳密に更新し,有害なショートカットを切断する。
広く使われているTPASとTIPRデータセットに関する大規模な実験は、LightAIRが既存の最先端の手法を大幅に上回っていることを示している。
コードはhttps://github.com/rainy-london/LightAIRで入手できる。
関連論文リスト
- Proximity-CLIP: Text-Guided Semantic Proximity Learning for Zero-Shot Anomaly Detection [7.184018933441995]
ビジョン言語モデルはゼロショット異常検出(ZSAD)に有望なアプローチを提供する
通常のテキストと異常なテキストのプロトタイプは、高いセマンティックオーバーラップを示す。
Proximity-CLIPは視覚的適応を誘導するために意味的マージンを視覚的に校正するフレームワークである。
論文 参考訳(メタデータ) (2026-09-07T08:48:27Z) - ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images [51.53960096934913]
リモートセンシングビジュアルグラウンドティング(RSVG)は、自由形式の自然言語記述を用いて、高解像度のRS画像中の特定の物体を特定することを目的としている。
マルチモーダル大言語モデル(MLLM)の最近の進歩は、そのようなオープン語彙RSVGに大きな可能性を示している。
Inemplar-driven Calibrated Refinement (ExACT)を提案する。
論文 参考訳(メタデータ) (2026-06-27T13:50:39Z) - Need We Teach Foundation Models What is a Generative Image? Gradient-Free Generative Artifact Detection via Analytic Spectral Adaptation [3.881211374324378]
勾配ベースの更新による生成成果物の検出に基礎モデルを適用することで、本質的な表現が損なわれる。
本稿では,二分分類から外分布(OOD)異常測定問題への検出を緩和する勾配のない手法を提案する。
論文 参考訳(メタデータ) (2026-06-03T13:04:23Z) - ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both [55.182037225013836]
ATLASは、単一の独立した「ワード」を機能トークンと呼び、エージェント操作と潜在視覚推論ユニットの両方として機能するフレームワークである。
ATLASは、明確な解釈可能性を維持しながら、挑戦的なベンチマークで優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-14T17:59:55Z) - Exploring the Limits of End-to-End Feature-Affinity Propagation for Single-Point Supervised Infrared Small Target Detection [6.7126559398433665]
単一点制御赤外線小ターゲット検出(IRSTD)は、高密度アノテーションのコストを大幅に削減する。
現在のSOTA(State-of-the-art)手法は、マスクの監督を明示的でオフラインな擬似ラベル構成によって回収することにより、高精度を実現する。
最小限の代替策として、オンラインのポイント・ツー・マスク・イン・バッチ、ポイント・アンカレド・フィーチャー・アフィニティ・プロパゲーションを通じて、ポイント・ツー・マスクをオンラインに生成する手法について検討する。
論文 参考訳(メタデータ) (2026-05-01T15:08:46Z) - ORSIFlow: Saliency-Guided Rectified Flow for Optical Remote Sensing Salient Object Detection [16.437554336020757]
光リモートセンシング画像塩物検出(ORSI-SOD)は、複雑な背景、低コントラスト、不規則な物体形状、オブジェクトスケールの大きなバリエーションのため、依然として困難である。
本稿では,ORSI-SOD を決定論的潜在フロー生成問題として再定義する ORSIFlow を提案する。
本研究では,大域的意味識別のための有意特徴判別器と,正確な境界修正のための有意特徴検定器を設計する。
論文 参考訳(メタデータ) (2026-03-30T15:33:26Z) - Towards Controllable Low-Light Image Enhancement: A Continuous Multi-illumination Dataset and Efficient State Space Framework [2.977173671229414]
Light100 がサポートする総合的なフレームワークである Controllable Low-light Enhancement (CLE) を導入する。
輝度制御と色度との矛盾を解決するため、ノイズ分離型監視戦略を採用する。
提案手法は,実世界のマルチイルミネーション代替品として,競争性能とロバストな制御性を実現する。
論文 参考訳(メタデータ) (2026-03-26T10:40:08Z) - Benchmarking Visual Feature Representations for LiDAR-Inertial-Visual Odometry Under Challenging Conditions [11.85572971097983]
本稿では,直接測光手法と記述子に基づく特徴マッチングを統合するハイブリッド手法を提案する。
実験の結果,提案手法は従来のスパース法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2026-03-19T07:56:49Z) - Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation [51.743225614196774]
マルチモーダル大言語モデル (MLLM) は視覚言語推論において顕著な進歩を遂げている。
彼らは幻覚に弱いままであり、そこで生成されたコンテンツは視覚的証拠から逸脱する。
近年の視覚強調法では、復号時に視覚トークンを補強することでこの問題に対処しようとしている。
本稿では,MLLMのトレーニングフリーフレームワークであるAdaptive Visual Reinforcement (AIR)を提案する。
論文 参考訳(メタデータ) (2026-02-27T14:18:51Z) - Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection [52.5174167737992]
ビデオ異常検出(VAD)は、ビデオ内の異常事象を特定することを目的としている。
本稿では,MLLMに基づくVADを受動的に読み上げから内部表現を積極的に操り,修正するSteerVADを提案する。
本手法は、トレーニングデータの1%しか必要としないチューニングフリーアプローチにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-27T13:48:50Z) - Visual Prompt Tuning in Null Space for Continual Learning [51.96411454304625]
既存のプロンプトチューニング手法は、継続学習(CL)における印象的な性能を示す。
本稿では,従来のタスクの特徴に代表される部分空間に直交する方向のプロンプトを調整し,各タスクを学習することを目的とする。
実際には、即時勾配予測を実装するために、実効的なヌル空間に基づく近似解が提案されている。
論文 参考訳(メタデータ) (2024-06-09T05:57:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。