論文の概要: Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray
- arxiv url: http://arxiv.org/abs/2606.25701v2
- Date: Mon, 29 Jun 2026 08:40:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.049108
- Title: Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray
- Title(参考訳): Falcon: X線における合成推論のための関数型アセンブリと言語
- Authors: Yonathan Michael, Mohamad Alansari, Natnael Takele, Andreas Henschel, Naoufel Werghi,
- Abstract要約: 安全クリティカルなX線バッグスクリーニングでは、空間的に分散したコンポーネントの機能的互換性から脅威が発生することが多い。
我々は、この設定を、リスクを接地地域の関係性としてモデル化したEmphcompositional threat reasoningとして定式化する。
セグメンテーションを意識した領域機能を構造化された安全状態に抽象化するマルチモーダルフレームワークである textbfFalcon を導入する。
- 参考スコア(独自算出の注目度): 10.471852313473642
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conventional vision-language models are largely object-centric, focusing on detecting and describing individual entities. In safety-critical X-ray baggage screening, however, threat often emerges not from a single object but from the functional compatibility of spatially dispersed components, such as batteries, detonators, and explosive charges. We formalize this setting as \emph{compositional threat reasoning}, where risk is modeled as a relational property of grounded regions rather than an independent detection outcome. We introduce \textbf{Falcon}, a multimodal framework that abstracts segmentation-aware region features into a structured safety state capturing component presence, pairwise functional compatibility, and scene-level risk. This structured representation is injected into the language model as an explicit intermediate interface, encouraging relationally consistent and safety-aware reasoning. To evaluate this problem, we present \textbf{Falcon-X}, a benchmark that unifies dense grounding with structured supervision over component completeness and risk inference in cluttered X-ray imagery. Experiments show that while existing multimodal models adapt to appearance, they struggle with compositional safety reasoning. Falcon improves functional grounding and produces more coherent threat assessments, establishing compositional safety reasoning as a distinct evaluation paradigm for multimodal systems.
- Abstract(参考訳): 従来の視覚言語モデルは、主にオブジェクト中心であり、個々の実体を検出し記述することに焦点を当てている。
しかしながら、安全クリティカルなX線バッグスクリーニングでは、脅威は単一の物体ではなく、電池、起爆装置、爆発物などの空間的に分散したコンポーネントの機能的互換性から生じることが多い。
ここではリスクを独立検出結果ではなく接地領域のリレーショナル特性としてモデル化する。
セグメンテーションを意識した領域の機能を構造化された安全状態に抽象化するマルチモーダルフレームワークである \textbf{Falcon} を紹介した。
この構造化表現は言語モデルに明示的な中間インターフェースとして注入され、リレーショナルな一貫性と安全性を意識した推論を促進する。
この問題を評価するために, 散乱X線画像におけるコンポーネントの完全性やリスク推論に対する構造的監督と密接な接地を統一するベンチマークである, textbf{Falcon-X}を提案する。
実験により、既存のマルチモーダルモデルは外観に適応するが、構成安全推論に苦しむことが示された。
ファルコンは機能的接地を改善し、よりコヒーレントな脅威評価を生み出し、構成的安全性推論をマルチモーダルシステムの明確な評価パラダイムとして確立した。
関連論文リスト
- Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning [67.67774742200626]
空間知能は、視覚的な観察から幾何学的および物理的構造を推論する能力を指すもので、大きな言語モデルにとって重要な課題である。
テキスト推論と視覚的想像力を組み合わせた統合型マルチモーダル生成フレームワークを提案する。
本フレームワークでは,高レベルなセマンティックプランニングのためのテキストチェーンと,幾何感応的な状態変換と整合性保存のための視覚的想像力を用いて,分割・対数戦略を採用している。
論文 参考訳(メタデータ) (2026-04-19T11:21:59Z) - CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation [13.435126546417516]
提案するフレームワークであるCounterSceneは, 閉ループ生成型BEV世界モデルと, 構造的対実的推論を併用したフレームワークである。
もし因果的に重要なエージェントが違った振る舞いをしたとしたら?
論文 参考訳(メタデータ) (2026-03-22T07:44:16Z) - State-Dependent Safety Failures in Multi-Turn Language Model Interaction [70.52906620450847]
我々は、状態空間の観点から安全性障害を研究し、多くのマルチターン障害が構造化状態の進化から生じることを示す。
本稿では,対話履歴を状態遷移演算子として扱う状態指向診断フレームワークSTARを紹介する。
静的な評価の下で頑健なように見えるシステムは、構造化されたマルチターン相互作用の下で、迅速かつ再現可能な安全破壊を受けることができる。
論文 参考訳(メタデータ) (2026-03-15T12:13:01Z) - CroBIM-U: Uncertainty-Driven Referring Remote Sensing Image Segmentation [8.834663340762562]
リモートセンシング画像セグメンテーションの参照は、複雑なオーバーヘッド画像内に自然言語で記述された特定のターゲットをローカライズすることを目的としている。
既存の手法では、画像全体にわたって均一な融合と精錬戦略を用いるのが一般的である。
本稿では,適応推論のオーケストレーションに先立って,画素単位の参照不確実性マップを空間として明示的に活用する,テキストbfuncertainty-guidedフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-07T01:02:39Z) - DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy [20.581841892290672]
RISを認知と認知という2つの重要な構成要素に分解する新しいフレームワークであるDeRISを提案する。
以上の結果から,従来のモデルでは知覚障害ではなく,マルチモーダル認知能力が不十分であることが示唆された。
本稿では,ターゲット存在判定に関連する長期分布問題に対処するため,単純な非参照型サンプル変換データ拡張を提案する。
論文 参考訳(メタデータ) (2025-07-02T14:14:35Z) - Benchmarking the Spatial Robustness of DNNs via Natural and Adversarial Localized Corruptions [49.546479320670464]
本稿では,セグメンテーションモデルの空間的ロバスト性を評価するための特別な指標を紹介する。
本稿では,モデルロバスト性をより深く理解する手法として,地域対応型マルチアタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック・アタック分析を提案する。
その結果、モデルがこれらの2種類の脅威に異なる反応を示すことが明らかとなった。
論文 参考訳(メタデータ) (2025-04-02T11:37:39Z) - Exploiting Multi-Object Relationships for Detecting Adversarial Attacks
in Complex Scenes [51.65308857232767]
ディープニューラルネットワーク(DNN)をデプロイするビジョンシステムは、敵の例に弱いことが知られている。
近年の研究では、入力データの固有成分のチェックは、敵攻撃を検出するための有望な方法であることが示された。
言語モデルを用いてコンテキスト整合性チェックを行う新しい手法を開発した。
論文 参考訳(メタデータ) (2021-08-19T00:52:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。