論文の概要: VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement
- arxiv url: http://arxiv.org/abs/2609.03153v1
- Date: Wed, 02 Sep 2026 20:36:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.85722
- Title: VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement
- Title(参考訳): VeriPhy:世界モデル評価とリファインメントのためのエージェント物理推論
- Authors: Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Gutiérrez, Jiuxiang Gu,
- Abstract要約: テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
- 参考スコア(独自算出の注目度): 57.86962208273888
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual fluency in generated video does not imply physical reliability, and a scalar quality score alone is incapable of indicating the obligation a clip violates or the moment it fails. We present VeriPhy, an auditable physical-verification system in which a text-only planner compiles the prompt into typed physical obligations and a statically validated execution plan before any frame is observed. During execution, observations gate and scope only declared calls to frozen low-level experts (e.g., segmentation and tracking, counting, eleven typed physical measurements over the resulting tracks, depth, OCR, and audio-event detection). Each action returns a provenance-carrying evidence record whose payload, when usable, is either a typed measurement or an explicitly tagged learned state. Typed resolvers and fixed composition map usable records to a three-valued state (supported, contradicted, or unknown, surfaced as plausible, implausible, or abstain) with full provenance, so that every verdict is traceable to the evidence that produced it. We anchor evaluation in a 1,500-clip corpus of human-annotated flaw records that localize real generation failures in prompt reference, space, and time. On a 149-clip core carrying 304 such records, VeriPhy accounts for 228, against 164 for a published question-decomposition evaluator given the same clips and the same claims. Recall alone does not separate it from prompting the same backbone monolithically, which reaches 222; what separates them is that each decision retains its evidence record and provenance, making the traces auditable one verdict at a time and usable as the interface through which a critic verdict could be written back into generation.
- Abstract(参考訳): 生成されたビデオの視覚的流感は、物理的信頼性を示唆するものではなく、スカラー品質スコアだけでは、クリップが違反する義務や失敗の瞬間を示すことができない。
テキストのみのプランナが、任意のフレームを観測する前に、そのプロンプトをタイプされた物理義務にコンパイルする監査可能な物理的検証システムであるVeriPhyと、静的に検証された実行計画を提案する。
実行中、観測ゲートとスコープは、凍結した低レベルの専門家(例えば、セグメンテーションとトラッキング、カウント、結果のトラック、深さ、OCR、オーディオイベント検出)への呼び出しのみを宣言した。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
タイプドレゾルバと固定された合成地図は、3つの値のある状態(支持、矛盾、不明、表面上、完全な証明で表される)に記録することができるので、すべての評決は、それを作った証拠に辿り着くことができる。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
304個のレコードを持つ149個のクリップコア上で、VeriPhyは228を、同じクリップと同じクレームを与えられた質問分解評価器の164に対して164と説明している。
リコールだけでは、同じバックボーンをモノリシックに促すことから分離せず、222に到達し、それぞれの決定がエビデンスの記録と証明を保持しており、トレースが一度に1つの判定を監査可能とし、批判的判断が世代に書き戻せるインターフェースとして使用できるようにする。
関連論文リスト
- Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes [0.0]
本研究では,大規模言語モデルの自叙伝を,主観的基礎構造コーパスに対して初めて定量的に評価した。
366日間の「ページ・アズ・デイ」で1対1の物語を収録した本が、会話型LLMで起草された。
毎日、独立した検証コーパスに対して逸話の場面で監査された。
論文 参考訳(メタデータ) (2026-08-23T20:10:50Z) - From Traceability to Justifiability: Accountability Structures in Agentic Software Engineering [0.0]
公開資料のみから、AIレコードがクレームを表現できるかどうか、宣言された場所を保持できるかどうかを測定する。
188個の二重グレード細胞で、デフォルトレコードが行動システムのコンテンツアイデンティティを出力するプラットフォームは見つからなかった。
計器は、パイプラインが発行した排気のみからの保証深度を計算し、宣言された深さと比較する。
論文 参考訳(メタデータ) (2026-08-21T16:45:00Z) - Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation [0.0]
10,200行の実行行を180のモデルバウンドリクエスト,45のセマンティックリクエスト,15の観測可能な刺激にトレースすることで,保存されたキャンペーンを監査する。
我々は、7リンクの積分チェインと、スコープ境界の終端積分linterをコントリビュートする。
論文 参考訳(メタデータ) (2026-08-13T06:44:40Z) - The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents [0.0]
本稿では,ポストホックではなく構造的検証を行うためのエージェント機器を提案する。
組織ごとの書き込みエラー、レンダリングサイズ、あるいは塩漬けのカナリアエチョフロアが破られた場合、実行はすべて無効になる。
長期のエージェントが苦しむたびに、クリーンでシングル変数の結果が報告される。
論文 参考訳(メタデータ) (2026-08-04T15:10:37Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments [0.0]
TRACE (Typed Reasoning And Commitment Evidence) は、推論トレースを記録するためのタイプ付きバージョン付きスキーマである。
論文は3つのレイヤで、推論は言語モデルにはない、と論じている。
レコード消費者契約は、レコードが保証するものと、その見返りに消費者が尊重すべきものを記述する。
論文 参考訳(メタデータ) (2026-07-14T08:08:21Z) - WILDTRACE: Benchmarking Natural Evidence Trails in Long-Context Reasoning [63.9071746889252]
長い文書に複雑な質問を答えるには、ソース自体が遠くの通路に自然に分散する証拠を統合する必要がある。
この情報源と内部の証拠の統合は、現実世界の長期文書分析の中心であるが、既存のベンチマークはそのほとんどを横取りしている。
WILDTRACEは, 自然発生の214個の長形音源に対する481個のタスクのベンチマークである。
論文 参考訳(メタデータ) (2026-07-10T12:09:21Z) - Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting [44.70980205167796]
AI評価結果は大規模に作成されるが、リーダーボード、モデルカード、ベンチマーク論文、会社のブログ間で矛盾なく報告されている。
最近の取り組みでは、分離されたコンポーネントに対処するが、3つのギャップを残している: それらは評価ライフサイクルの狭いスライスのみをカバーし、単一の解釈可能なレコードに構成しない。
EvalCardsは、ベンチマークメタデータ、評価実行データ、モデルメタデータを統一されたレコードに構成する運用レポート層である。
論文 参考訳(メタデータ) (2026-06-08T17:55:02Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。