論文の概要: TrajMind: Chaining Role-Specialized LoRAs for Fast-and-Slow Collective Trajectory Anomaly Diagnosis
- arxiv url: http://arxiv.org/abs/2609.02540v1
- Date: Wed, 02 Sep 2026 12:51:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.335775
- Title: TrajMind: Chaining Role-Specialized LoRAs for Fast-and-Slow Collective Trajectory Anomaly Diagnosis
- Title(参考訳): TrajMind: 高速・低速集団軌道異常診断のための連鎖型役割特化LoRA
- Authors: Jiahao Wu, Zhenqun Yang, Chen Jason Zhang, Qing Li,
- Abstract要約: TrajMindは、3つのロール特化LoRAアダプタを1つのフリーズされたビジョン言語バックボーンに切り替える、高速かつスローのフレームワークである。
その遅いパス、textitTrajMind$_textslow$、チェーンキャンバスベースの型付け、シリアライズされた軌道上の型条件付きローカライゼーション、実行可能な検証、構造化されたエビデンスベースの診断。
- 参考スコア(独自算出の注目度): 11.783455321039503
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diagnosing collective anomalies from urban trajectories is increasingly important for traffic governance, as it reveals what happened, who was involved, and where and when the event occurred. Existing detectors efficiently produce scores or labels, whereas vision--language pipelines provide richer semantics; neither couples verifiable diagnosis with low-latency monitoring. The central challenge is to recognize collective patterns and recover exact event details from the source trajectories without running the full diagnostic pipeline for every monitored window. We therefore separate always-on screening from on-demand diagnosis: screening raises alerts, while diagnosis releases only source-verified what--who--where--when records. We present TrajMind, a fast-and-slow framework that switches three role-specialized LoRA adapters over one frozen vision--language backbone. Its slow path, \textit{TrajMind$_{\text{slow}}$}, chains canvas-based typing, type-conditioned localization over serialized trajectories, and executable verification, yielding structured, evidence-backed diagnoses. Additionally, the fast path, \textit{TrajMind$_{\text{fast}}$}, screens each window in a single text-only pass, delivering efficient structured alerts. Extensive experiments show that, TrajMind$_{\mathrm{slow}}$ outperforms the strongest baselines by at least $15.3$ percentage points in anomaly typing and $13.8$ percentage points in localization. These gains persist under cross-city transfer, and TrajMind$_{\mathrm{fast}}$ reduces latency by $41.1\%$ and maintains binary balanced accuracy of at least $93.5\%$. Together, TrajMind delivers accurate, evidence-backed diagnoses across cities and efficient front-line monitoring.
- Abstract(参考訳): 都市軌跡から集合的な異常を診断することは、交通管理にとってますます重要になっている。
既存の検出器はスコアやラベルを効率よく生成するが、視覚言語パイプラインはよりリッチなセマンティクスを提供する。
中心的な課題は、監視対象のウィンドウ毎に完全な診断パイプラインを実行することなく、集合パターンを認識し、ソーストラジェクトリから正確なイベント詳細を復元することだ。
そこで私たちは、常時オンのスクリーニングとオンデマンドの診断を分離します。
TrajMindは3つのロール特化LoRAアダプタを1つのフリーズビジョン-言語バックボーンに切り替える高速かつスローのフレームワークである。
その遅いパスは、textit{TrajMind$_{\text{slow}}$}、チェーンキャンバスベースの型付け、シリアライズされたトラジェクトリ上の型条件付きローカライゼーション、実行可能検証、構造化されたエビデンスベースの診断である。
さらに、高速パスである \textit{TrajMind$_{\text{fast}}$} は、各ウィンドウを単一のテキストのみのパスで表示し、効率的な構造化されたアラートを提供する。
TrajMind$_{\mathrm{slow}}$は、異常タイピングにおいて少なくとも15.3$ポイント、ローカライゼーションにおいて13.8$ポイントで最強のベースラインを上回っている。
TrajMind$_{\mathrm{fast}}$はレイテンシを41.1\%$に削減し、少なくとも93.5\%$のバイナリバランス精度を維持する。
TrajMindは、都市全体にわたる正確でエビデンスに支えられた診断と、効率的なフロントライン監視を提供する。
関連論文リスト
- Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers [4.008486665405814]
ロングホライゾンエージェントのトレースは、実行を監視している人間のオブザーバとエージェント自体の両方のコンシューマをオーバーホールする。
我々は、ライブトレースモデル、追加のみのイベント台帳を型付けされた実行状態に段階的に折り畳み、両方のコンシューマに対して評価する。
LLMリーダをプロキシとして評価したオブザーバ側では、コンパイルされたビューは、約14倍、15倍少ない入力トークンを使用して、質問に回答する。
論文 参考訳(メタデータ) (2026-09-01T16:03:54Z) - TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference [47.62941623025392]
本稿では,非侵入的でログ対応なLLM推論フレームワークであるTELLERについて紹介する。
TELLERはモデルバイナリを変更することなく、NVTX/CUPTIトレースとサービスログを収集する。
リクエスト毎のコールチェーンツリーを再構築し、ログ行と対応する実行ステップをアライメントする。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションとマルチモーダルな根起因モデルを組み合わせる。
論文 参考訳(メタデータ) (2026-08-03T09:39:11Z) - Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems [47.66236392009794]
LLM(Large Language Model)ベースのエージェントは、様々な複雑な対話的タスクにおいて、例外的なパフォーマンスを示す。
textitTrajectory Graph Copilot は LLM エージェントの副操縦士' として機能する新しいフレームワークで,実行前に潜在的な動作エラーを診断する。
論文 参考訳(メタデータ) (2026-07-29T20:14:43Z) - Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence [45.78409219344429]
マルチモーダル大言語モデル (MLLM) は, 臨床VQAと放射線学報告の生成に強い期待を示すが, 推測時幻覚は信頼性を損なう。
本稿では,両面のエビデンス注入による幻覚を系統的に緩和する,総合的かつトレーニング不要なエビデンス注入フレームワークを提案する。
textttLLaVA-1.5-7B, texttLLaVA-Med-1.5-7B, texttQwen3-VL-8B/32B, textttInternVL を用いた2つのタスクと5つのデータセットの系統的評価を行った。
論文 参考訳(メタデータ) (2026-06-30T08:07:25Z) - TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories [61.51984029109709]
グラフベースのフレームワークであるTraceGraphを紹介した。
各タスクに対して、TraceGraphは、モデルIDが導入される前に、プールされたロールアウトから観測可能なアクション・オブザーブレーション状態のグラフを構築する。
次に、結果インフォームされた生産的なコアとトラップリージョンをオーバーレイし、各ロールアウトを3つのイベント – アクセス、トラップ露出、修復 – で要約する。
論文 参考訳(メタデータ) (2026-05-29T13:40:31Z) - $D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing [63.49501120848927]
大規模言語モデル(D-LLM)の安全性監視はほとんど未検討である。
D-LLMの2レベル安全モニタであるD2$-Monitorを提案する。
D2$-Monitorは、常にオンのモニターとして軽量プローブを採用して、ヒューズレーションを共同で見積もり、ベース分類を実行する。
論文 参考訳(メタデータ) (2026-05-25T14:22:21Z) - Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance [16.566888073449714]
ラジオロジーレポート生成(RRG)のための視覚言語モデル(VLM)は、ボリュームスキャンから長めの胸部CTレポートを生成することができる。
既存の方法は2つの重要な制限に直面している: (i) トレーニングの監督は、しばしば粗くなり、きめ細かい属性や病理の場所を明示的に調整することなく、CTのボリューム全体を完全な自由テキストのレポートと整列する。
本稿では,フリーテキストレポートから微細なキューを蒸留し,レポート生成をガイドするプラグイン・アンド・プレイフレームワークであるPrompt Dropout (DCP-PD) を用いたemphDiscrimi Cue-Promptingを提案する。
論文 参考訳(メタデータ) (2026-04-12T03:25:41Z) - IDGraphs: Intrusion Detection and Analysis Using Stream Compositing [8.0129134921247]
IDGraphsは侵入検知のためのインタラクティブな可視化システムである。
実ネットワークルータデータセットにIDGraphを適用すると,総トラフィック1.16TBのフローレベルレコードが179Mになる。
システムは様々な攻撃や異常を検出し解析する。
論文 参考訳(メタデータ) (2025-06-26T16:08:20Z) - Deep Omni-supervised Learning for Rib Fracture Detection from Chest
Radiology Images [41.62893318123283]
ディープラーニング(DL)に基づくリブ骨折検出は、死亡を予防し、患者の予後を改善する上で重要な役割を担っている。
DLベースのオブジェクト検出モデルは、大量のバウンディングボックスアノテーションを必要とします。
医用データの注釈付けは時間がかかり専門知識が要求されるため、大量の細かい注釈を得られることは極めて不可能である。
我々は,ORF-Netv2という新しいオブジェクト検出ネットワークを提案する。
論文 参考訳(メタデータ) (2023-06-23T05:36:03Z) - SADet: Learning An Efficient and Accurate Pedestrian Detector [68.66857832440897]
本稿では,一段検出器の検出パイプラインに対する一連の最適化手法を提案する。
効率的な歩行者検出のための単発アンカーベース検出器(SADet)を形成する。
構造的には単純だが、VGA解像度の画像に対して最先端の結果と20ドルFPSのリアルタイム速度を示す。
論文 参考訳(メタデータ) (2020-07-26T12:32:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。