論文の概要: VeriScene: Reconstructing Crime Scenes from Legal Evidence via World-Model Agent
- arxiv url: http://arxiv.org/abs/2609.08342v1
- Date: Tue, 08 Sep 2026 07:14:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 16:48:35.975748
- Title: VeriScene: Reconstructing Crime Scenes from Legal Evidence via World-Model Agent
- Title(参考訳): VeriScene:World-Model Agentによる法的な証拠から犯罪現場を再構築する
- Abstract要約: 本稿では,世界モデルを編成するエージェントであるVeriSceneについて述べる。
犯罪現場は、法医学的な写真や様々な信頼性の証人による証言から再構築されている。
7つの物理的に駆動されるケースタイプにわたる25の犯罪シナリオのベンチマークにおいて、VeriSceneは0.9014のエビデンスカバレッジと0.7217の事実整合性を達成した。
- 参考スコア(独自算出の注目度): 26.527908044452758
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models take multimodal inputs like text, photos, and diagrams to generate dynamic scenes in accordance with the laws of physics, thus opening a compelling application: fusing multimodal legal evidence to re-create a crime scene and re-enact how an offence could have been committed. However, feeding the raw, unorganized evidence into a world model fails in forensic use: it silently drops evidence, glosses over contradictory testimony, and produces motion that violates the evidentiary record. This paper presents VeriScene, an agent that orchestrates the world model: it reconstructs crime scenes from forensic photographs and witness statements of varying reliability, keeping every claim traceable to evidence and every motion physically plausible. VeriScene iteratively fuses the evidence into a cited narrative under an auditing loop, verifies the hypothesized dynamics via probe rollouts in the world model with corrective constraint injection, and renders the offence as a re-enactment video from a fused keyframe. On a benchmark of 25 crime scenarios across 7 physically-driven case types (139 forensic-style photographs and 65 statements with planted unreliability), VeriScene attains 0.9014 evidence coverage and 0.7217 factual consistency (0-1 scale) on the 20 test scenes, outperforming an end-to-end multimodal-LLM baseline by 20.35% in factual consistency and 34.88% in temporal coherence, while generalizing across four LLM orchestration backends at USD 1.82 per scene.
- Abstract(参考訳): 世界モデルは、物理の法則に従って動的シーンを生成するために、テキスト、写真、ダイアグラムなどのマルチモーダルなインプットを取り入れている。
しかし、生の無秩序な証拠を世界モデルに流すことは法医学的使用に失敗し、証拠を静かに落とし、矛盾する証言を軽視し、証拠記録に違反する動作を発生させる。
本論文は,世界モデルを編成するエージェントであるVeriSceneについて述べる。犯罪現場を犯罪写真から再構築し,証拠に追従可能なすべてのクレームと物理的に検証可能なすべてのクレームを保持する。
VeriSceneは、証拠を監査ループの下で引用された物語に反復的に融合し、修正的制約注入で世界モデルのプローブロールアウトを介して仮説化されたダイナミクスを検証する。
7つの物理的に駆動されたケースタイプ(139枚の法医学的な写真と65のステートメント)にわたる25の犯罪シナリオのベンチマークにおいて、VeriSceneは20のテストシーンで0.9014の証拠と0.7217の事実整合性(0-1スケール)を達成し、実際の一貫性が20.35%、時間コヒーレンスが34.88%、シーン当たりのUSD 1.82で4つのLLMオーケストレーションバックエンドをまたいで一般化した。
関連論文リスト
- VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection [30.634696315154383]
本稿では,知覚と意味的推論の協調的特殊化を可能にするマルチエージェントフレームワークであるSafeGuardを提案する。
新しいAI生成ビデオ検出ベンチマークであるSafeVidを導入し、身体的妥当性、構造的整合性、社会的行動の合理性を評価する。
論文 参考訳(メタデータ) (2026-07-03T08:03:35Z) - Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion [20.58307772592017]
3万枚の画像を含む合成災害検出のためのベンチマークデータセットであるForged Calamityを紹介した。
微調整およびゼロショット設定による実験は、現在の法医学的アプローチにおける一貫した弱点を明らかにしている。
これらの知見は、持続的な一般化ギャップと、ドメインおよびモデルに依存しない検出方法の緊急の必要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2026-06-17T00:08:35Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach [0.0]
本稿では,法医学的分析におけるヘイトと脅威検出のためのケース駆動型マルチモーダルアプローチを提案する。
提案フレームワークは,埋め込みテキストと関連するコンテキストテキストと画像のみのエビデンスとを区別し,テキストエビデンスの存在と情報源を明確に決定する。
証拠の可用性を推論することで、アプローチは法医学的な意思決定を反映し、明らかなトレーサビリティを改善し、不正なモダリティの仮定を避ける。
論文 参考訳(メタデータ) (2026-04-08T21:50:02Z) - INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs [69.11382230669491]
ビデオ証拠(忠実さ)または検証可能な世界知識(事実性)のどちらかに矛盾する結果である幻覚
textscINFACTは、4つのモードでモデルを評価する。
14の代表的なビデオ-LLMの実験では、高ベースモード精度が誘導モードの信頼性に確実に変換されないことが明らかになった。
論文 参考訳(メタデータ) (2026-03-12T03:03:16Z) - Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition [12.054081112688074]
VLM(Vision-Language Models)は、視覚的コンテンツを解釈する能力を示しているが、安全クリティカルなシナリオにおける信頼性はまだ十分に調査されていない。
本稿では,200枚の合成画像(100対)と50枚の実世界の画像(25対)からなる診断ベンチマークVERIを紹介する。
各緊急シーンは、人間の検証によって視覚的に似ているが安全なものとペアリングされる。
論文 参考訳(メタデータ) (2025-05-21T10:57:40Z) - Fact-Saboteurs: A Taxonomy of Evidence Manipulation Attacks against
Fact-Verification Systems [80.3811072650087]
証拠のクレームサレントスニペットを微調整し,多様かつクレームアラインな証拠を生成することが可能であることを示す。
この攻撃は、主張のポストホックな修正に対しても堅牢である。
これらの攻撃は、インスペクタブルとヒューマン・イン・ザ・ループの使用シナリオに有害な影響を及ぼす可能性がある。
論文 参考訳(メタデータ) (2022-09-07T13:39:24Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。