論文の概要: From Scene Graphs to Answers: Selective Neuro-Symbolic Reasoning for Autonomous Driving
- arxiv url: http://arxiv.org/abs/2609.32645v1
- Date: Sat, 26 Sep 2026 14:05:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 21:41:37.976947
- Title: From Scene Graphs to Answers: Selective Neuro-Symbolic Reasoning for Autonomous Driving
- Title(参考訳): シーングラフから回答へ:自律運転のための選択的ニューロシンボリック推論
- Abstract要約: 本稿では,クエリの性質に応じてアロケートするクエリ適応型ニューロシンボリック推論フレームワークを提案する。
我々は,5,916のNuScenes-QA質問に対して,オーラクル・パーセプション・セッティングの下で,NuScenes v1.0-miniの全10シーンについて,フレームワークの評価を行った。
- 参考スコア(独自算出の注目度): 6.768981779797406
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous-driving question answering requires reasoning over structured scene information, yet existing vision-language approaches largely delegate heterogeneous reasoning operations to a single neural inference process. We argue that this uniform strategy overlooks a fundamental distinction: some queries admit exact symbolic solutions, while others require semantic interpretation. We introduce a query-adaptive neuro-symbolic reasoning framework that explicitly allocates computation according to the nature of the query. At its core is a hierarchical Spatiotemporal Scene Graph (STSG) that separates persistent object identities from frame-specific states and represents spatial relations and temporal transitions as explicit directed structures. Given a query, a symbolic executor first attempts to resolve it through exact graph operations; only when symbolic execution abstains is an LLM invoked for semantic reasoning. For these unresolved queries, query-conditioned graph retrieval and evidence filtering preserve relation direction, temporal locality, and object semantics, providing the LLM with compact and verified task-relevant evidence. This design shifts the role of the LLM from a universal reasoning engine to a targeted semantic reasoner, while allowing deterministic computation to be handled exactly and efficiently. We evaluate the framework on 5,916 NuScenes-QA questions across all ten scenes of nuScenes v1.0-mini under an oracle-perception setting. The complete system achieves 80.63 percent overall accuracy with GPT-5.4-mini, improving over the corresponding LLM-only configuration by 5.48 percentage points; with DeepSeek-V4-Flash, the improvement reaches 6.64 points. The largest gains occur on counting questions, with improvements of 10.20 and 12.61 points, respectively. These results show that selective reasoning improves both accuracy and inference efficiency.
- Abstract(参考訳): 自律的な質問応答は、構造化されたシーン情報に対する推論を必要とするが、既存の視覚言語アプローチは、主に異種推論操作を単一の神経推論プロセスに委譲する。
この一様戦略は基本的な区別を覆しており、いくつかのクエリは正確なシンボリック解を認め、他のクエリは意味論的解釈を必要とする。
本稿では,クエリの性質に応じて計算を明示的に割り当てる,クエリ適応型ニューロシンボリック推論フレームワークを提案する。
中心となるのは階層的時空間グラフ(STSG)で、永続的なオブジェクトのアイデンティティをフレーム固有の状態から切り離し、空間的関係と時間的遷移を明示的な有向構造として表現する。
クエリが与えられた場合、シンボリックエグゼキュータは、まず正確なグラフ操作によってそれを解決しようと試みる。
これらの未解決クエリに対して、クエリ条件付きグラフ検索とエビデンスフィルタリングは関係方向、時間的局所性、オブジェクト意味を保存し、LLMにコンパクトで検証されたタスク関連エビデンスを提供する。
この設計は、LLMの役割を普遍的な推論エンジンから目的のセマンティック推論エンジンにシフトさせ、決定論的計算を正確に効率的に処理できるようにする。
我々は,5,916のNuScenes-QA質問に対して,オーラクル・パーセプション・セッティングの下で,NuScenes v1.0-miniの全10シーンについて,フレームワークの評価を行った。
GPT-5.4-miniで80.63パーセントの精度を達成し、対応するLCMのみの構成を5.48ポイント改善した。
質問数が最も多く、それぞれ10.20点と12.61点の改善がある。
これらの結果から,選択推論は精度と推論効率を両立させることがわかった。
関連論文リスト
- NeSy-RAG: Neuro-Symbolic RAG for Explainable Question Answering [2.7322203948509767]
NeSy-RAGはモジュール型ニューロシンボリックRAGフレームワークで、取得したテキストチャンクから帰属可能なPrologモジュールを合成する。
本稿では,欠落したユーザの事実を識別するシンボリック・ナレッジ・ギャップ検出機構を提案する。
ShARCベンチマークでは、NeSy-RAGは61.1%の精度を達成し、同じモデルのRAGベースラインを42.8%の精度で上回っている。
論文 参考訳(メタデータ) (2026-08-06T17:16:28Z) - TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models [0.0]
TACIT Benchmarkは、6つの推論領域にわたる10のタスクからなるプログラム的なビジュアル推論ベンチマークである。
このベンチマークでは、モデルが決定論的コンピュータビジョンパイプラインを通じて検証されたソリューションイメージを生成する必要がある生成トラックと、構造的に妥当なニアミストラクタを備えた5方向の多重選択を提供する識別トラックの2トラック評価が提供されている。
論文 参考訳(メタデータ) (2026-02-27T11:45:26Z) - Arbor: A Framework for Reliable Navigation of Critical Conversation Flows [0.19573380763700712]
本稿では,決定木ナビゲーションを専門的なノードレベルのタスクに分解するフレームワークであるArborを紹介する。
Abortは平均ターン精度を29.4ポイント改善し、ターン毎のレイテンシを57.1%削減し、ターン毎のコストを平均14.4倍削減する。
論文 参考訳(メタデータ) (2026-02-16T11:09:02Z) - CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction [50.67483317563736]
本稿では,段階的に考察し,必要な情報を検索し,結果を生成し,自己評価を行い,結果を洗練するシステムを提案する。
CoT-Segは、思考の連鎖推論と自己補正を組み合わせることで、推論セグメンテーションを再考する、トレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2026-01-24T11:41:54Z) - TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework [62.66056331998838]
TeaRAGは、検索内容と推論ステップの両方を圧縮できるトークン効率のエージェントRAGフレームワークである。
報奨関数は,過剰な推論ステップをペナルティ化しながら,知識マッチング機構によって知識満足度を評価する。
論文 参考訳(メタデータ) (2025-11-07T16:08:34Z) - A Unified Reasoning Framework for Holistic Zero-Shot Video Anomaly Analysis [64.42659342276117]
ビデオの異常な研究のほとんどは、フレームワイド検出で停止し、なぜイベントが異常なのかについての洞察はほとんど得られない。
近年の動画の局所化と映像の異常理解手法は、説明可能性を改善するが、データに依存し、タスク固有のままである。
本稿では,時間的検出,空間的局所化,テキスト的説明のギャップを埋める統一的推論フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-02T14:49:08Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Implicit Reasoning in Large Language Models: A Comprehensive Survey [67.53966514728383]
大規模言語モデル(LLM)は、幅広いタスクにまたがる強力な一般化を実証している。
最近の研究は、暗黙の推論に拍車をかけた、明示的な思考の連鎖から注意を向けている。
本調査では,表現形式から計算戦略へ焦点を移し,実行パラダイムを中心とした分類を紹介した。
論文 参考訳(メタデータ) (2025-09-02T14:16:02Z) - ThoughtProbe: Classifier-Guided Thought Space Exploration Leveraging LLM Intrinsic Reasoning [20.082244529609707]
単純な線形分類器が LLM のアクティベーション空間における固有推論能力を効果的に検出できることを発見した。
木構造応答空間を戦略的に探索する分類器誘導探索フレームワークを提案する。
実験結果から,本フレームワークの包括的探索は妥当な推論連鎖だけでなく,有効に同定できることが示唆された。
論文 参考訳(メタデータ) (2025-04-09T07:37:27Z) - Sentiment Analysis through LLM Negotiations [58.67939611291001]
感情分析の標準的なパラダイムは、単一のLCMに依存して、その決定を1ラウンドで行うことである。
本稿では,感情分析のためのマルチLLMネゴシエーションフレームワークを提案する。
論文 参考訳(メタデータ) (2023-11-03T12:35:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。