論文の概要: Checked Program Recovery from Execution Video: A Sound Oracle for Untrusted Generators
- arxiv url: http://arxiv.org/abs/2607.00635v1
- Date: Wed, 01 Jul 2026 08:48:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.816245
- Title: Checked Program Recovery from Execution Video: A Sound Oracle for Untrusted Generators
- Title(参考訳): 実行ビデオによるチェック済みプログラムのリカバリ:信頼できない発電機のためのOracleのサウンド
- Abstract要約: 本研究では,その実行記録からScratchプログラムの実行を回復する具体的環境で,このようなリカバリを実現する方法について検討する。
記録はプログラムが何を行うかを示すが、そのコードはないため、ソースを復元することはできず、適切なターゲットはカメラが知る限り同じ振る舞いをするプログラムである。
静的チェッカーは、参照に対するレンズ等価性を証明し、部分順序独立を認める証明書を発行し、間違ったプログラムを決して受け入れない。
- 参考スコア(独自算出の注目度): 2.054408744752205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A growing class of tools recovers a program from observations of its behavior using an untrusted generator, a neural model or a search, that proposes candidates with no correctness guarantee. We study how to make such recovery trustworthy, in the concrete setting of recovering a runnable Scratch program from a recording of its execution. The recording shows what the program does but never its code; many programs produce the same video, so the source cannot be recovered, and the right target is a program that behaves the same as far as the camera can tell, made precise with a lens. The core is a two-tier validation oracle with a deliberate verdict asymmetry. A static checker proves lens-equivalence to a reference and issues a certificate that, granting the partial-order independence quotient adequate, never accepts a wrong program; a renderer can only refute or witness finite agreement, never certify. Around it, Vid2Prog reads each sprite's motion, visibility, and timing from the video and a known-asset manifest and synthesizes a candidate source-free; a closed loop renders and runs recovery again for ground truth. Under the exact lens the oracle makes no false accept on 246 labeled differing pairs, including an adversarial battery built to trap its concurrency quotient; on inputs outside the vocabulary and on real projects it abstains or refutes, accepting none we test. In-vocabulary recoveries reproduce their source frame for frame and 80% earn a static certificate, while whole real projects, mostly outside the vocabulary, recover at 14%, a vocabulary-bound rate the system never inflates with a wrong answer. A frontier vision-language model recovers none of the matched programs single-shot, which oracle-in-the-loop repair lifts only to a few while the structured pipeline recovers all, the gap a sound checker makes for an untrusted generator.
- Abstract(参考訳): 成長するツールのクラスは、信頼できないジェネレータ、ニューラルモデル、サーチを使用してプログラムの振る舞いの観察からプログラムを回復する。
本研究では,その実行記録からランナブルなScratchプログラムを回収する具体的環境で,そのようなリカバリを信頼できるものにする方法について検討する。
多くのプログラムは、同じビデオを生成するので、ソースは復元できない。そして正しいターゲットは、カメラが知る限り、正確にレンズで振る舞うプログラムである。
コアは2層検証オラクルであり、意図的な予測非対称性を持つ。
静的チェッカーは、参照に対するレンズ等価性を証明し、部分順序独立割当を適切に付与し、間違ったプログラムを決して受け入れない証明書を発行する。
Vid2Progはビデオから各スプライトの動き、可視性、タイミングを読み出し、既知のアセットのマニフェストを読み出し、候補となるソースフリーを合成する。
正確なレンズの下では、オラクルは246個の異なるペアに偽の受け入れをしない。例えば、その並行商をトラップするために作られた対向電池は、語彙外の入力や実際のプロジェクトでは無視または反証し、テストしない。
インボキャブラリリリカバリはフレームのソースフレームを再現し、80%が静的な認証を取得し、一方、大部分は語彙外である実際のプロジェクト全体が14%のリカバリを実現している。
フロンティアのヴィジュアル言語モデルは、一致したプログラムの1ショットを復元せず、オラクル・イン・ザ・ループの修理は、構造的なパイプラインが全てを回復している間にわずか数回だけリフティングするが、サウンドチェッカーが信頼できないジェネレータのためにギャップを埋める。
関連論文リスト
- PhysWeep: Does a Video Generator Realize the Physics You Ask For? [0.8594140167290097]
各サンプルは確実に間違った定数にロックされ、正確には確率スコアが構造的に盲目である。
PhysWeepは、固定されたラベルのない監査でそれを閉じ、冷凍発電機をブラックボックスとして扱う。
論文 参考訳(メタデータ) (2026-09-05T17:52:46Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Asymmetric Phase Coding Video Watermarking [4.564848621539382]
共有秘密を除去するトレーニング不要なビデオ透かしを提示する。
シグナーはクロマ面の位相スペクトルに完全なEd25519シグネチャを埋め込む。
1000個の未計算の現実世界のクリップでは、システムは99.3%のコーパスの認証署名を出荷し、1000回の試行で間違った公開鍵をゼロ回受け取っている。
論文 参考訳(メタデータ) (2026-08-29T11:53:25Z) - Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs [69.52853771994451]
我々はLLaDA 2.0の復号軌道を解析し、繰り返し拡散信頼トラップを同定する。
本稿では,拡散復号化を進化過程とみなす訓練不要なテスト時間スケーリングフレームワークである進化復号法を提案する。
論文 参考訳(メタデータ) (2026-08-01T11:48:25Z) - When Binaries Talk Back: Representation-Confusion Attacks on LLM-Assisted Reverse Engineering [0.0]
バイナリは、データをある起源からの命令やレコードのように、独立したエビデンスのように見せることができる。
我々は、逆エンジニアリング(RARE)における融合攻撃(Confusion Attacks in Reverse Engineering)と呼ぶ。
RAREはこれらの障害を測定する。
Ghidra, r2pipe, angrを16のプログラムに実装する。
論文 参考訳(メタデータ) (2026-07-14T08:38:10Z) - DemoBridge: A Simulation-in-the-Loop Toolkit for Single-View Human Demonstration Retargeting [49.70827726228219]
このツールキットは、人間の手による実演のシングルビューRGBステレオ記録を、物理で検証可能なロボットアーム軌道に変換する。
DemoBridgeの中核は、衝突を意識した単一のプランナーである。
物理シミュレーターはループ内で動作し、生成した各フェーズを検証し、障害時にバックトラックするので、与えられたように再生できないデモは破棄されるのではなく、再計画される。
論文 参考訳(メタデータ) (2026-07-10T15:31:04Z) - Can Code Specify a System Precisely Enough to Formally Verify It? [0.0]
本報告では,業務用レストラン・ポイント・オブ・セールシステムの支払ワークフローを実運用ソフトウェアで評価する。
コアプロトコルは、正確に定義された障害モデルの下で手作りのラインアクティベートされたモデルに対して正しい。
生産用サンドボックスの1つのプローブは、全リカバリはしごを到達不能にする応答形状のばらつきを露呈した。
論文 参考訳(メタデータ) (2026-07-06T13:39:00Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - SchedCheck: Schedule-Robustness Analysis for Event-Driven Block Programs [2.054408744752205]
Scratchのようなブロックベースの言語は、初心者がスプライトやスクリプトからインタラクティブなプログラムを組み立てることを可能にする。
これらのプログラムは実行順序に依存したスケジュールに敏感な動作を含むことを示す。
我々は、Scratch仮想マシンが実現可能なスケジュール空間を、初期実行可能ターゲットオーダーの置換として定式化する。
論文 参考訳(メタデータ) (2026-07-01T08:41:53Z) - Falsification, Not Exposure: An Internally Preregistered Placebo-Controlled Decomposition of Self-Repair Feedback in Frozen Small Code Models [0.0]
本研究では、ブラインドサンプリングベースラインに対してフィードバックパケットを分解するプラセボ制御装置を構築する。
この体制では、ファルシフィケーションは語彙や自己批判としてではなく、外部の実行可能な反例と比較するのに役立つ。
論文 参考訳(メタデータ) (2026-06-30T11:26:14Z) - Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One [0.0]
言語モデルのメモリは、メモリを全く持たないよりも悪い場合がある。
間違った結論を維持しながら、その背後にある作業を捨てるメモリは、確実な答えとして古い値を出力する。
論文 参考訳(メタデータ) (2026-06-24T06:24:53Z) - Encoder-Decoder Manifold Alignment for Idempotent Generation [51.959208893243776]
この失敗の主な理由は、エンコーダとデコーダによって学習された多様体間の幾何学的ミスマッチである。
我々は、エンコーダとデコーダに同じ基礎となるデータ多様体の一貫性のある表現を学習させ、このギャップを明示的に埋める新しいトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-21T02:14:37Z) - No Accidental Software Agent First Canonical Code for Human Code Entropy Reduction and 30 to 500 times Lower Frontier Model Requirements [0.0]
本稿では,日常的な製品ソフトウェアを標準的行動プロファイルに書き換えるエビデンスキャリング基板を提案する。
除去可能な事故は、残余の新規性、証拠、ガバナンス、リスク、将来のオプション性が支配されるまで減少する。
Qwen2.5-Coder-14BのQLoRA実験は、64,088の標準軌道が学習可能であり、試験された禁止言語マーカーを抑えることを示した。
論文 参考訳(メタデータ) (2026-06-12T11:35:54Z) - R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking [73.0537447183962]
本稿では、Reasoning-guided Recalling and Re rankを中心に構築されたゼロショット合成ビデオ検索パイプラインを提案する。
モデルは、編集を適用した後、期待されるターゲットビデオを記述する推論トレースを生成する。
この課題に対処する上で,本手法の有効性を実証した。
論文 参考訳(メタデータ) (2026-05-31T09:20:53Z) - A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration [0.0]
生産言語モデルシステムは、労働者エージェントの目に見えないオーケストレーションにまたがってそれを拡大する要求に答える。
これは、単一のワーカーが見ることができない欠陥のクラスに何をもたらすか尋ねる。
1人の開発者から5世代にわたる10のシステムと、異なるアライメントパラダイムからの5つのプロバイダのみです。
論文 参考訳(メタデータ) (2026-05-25T05:09:48Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Learning from Self-Sampled Correct and Partially-Correct Programs [96.66452896657991]
そこで本研究では,モデルが学習中にサンプリングを行い,自己サンプリングされた完全正当プログラムと部分正当プログラムの両方から学習することを提案する。
自己サンプリング型プログラムと部分修正型プログラムを併用することで,学習とサンプリングプロセスのガイドに役立てることができることを示す。
提案手法は,MLEを用いた単一の参照プログラムからの学習と比較して,パス@kの性能を3.1%から12.3%向上させる。
論文 参考訳(メタデータ) (2022-05-28T03:31:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。