論文の概要: Post-Edit Re-Verification in Simulator-Backed Engineering Agents: A Controlled Comparison of Verification-Cadence Guidance
- arxiv url: http://arxiv.org/abs/2608.28147v1
- Date: Fri, 28 Aug 2026 10:11:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.268922
- Title: Post-Edit Re-Verification in Simulator-Backed Engineering Agents: A Controlled Comparison of Verification-Cadence Guidance
- Title(参考訳): シミュレータ支援型エンジニアリングエージェントの編集後再検証:検証頻度誘導の制御された比較
- Abstract要約: 外部シミュレータと相互作用するエンジニアリングエージェントは、設計の修正を調整し、修正された状態のエンジニアリングエビデンスを再取得する必要があるかもしれない。
検証関連状態/ファクトが一定に保たれている間、明示的な検証ケイデンスガイダンスが省略されている場合、最初の編集後再検証が変更されるかどうかを問う。
- 参考スコア(独自算出の注目度): 6.06894197301829
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Engineering agents that interact with external simulators may need to coordinate design modification with reacquisition of engineering evidence for the modified state. We ask whether first post-edit re-verification changes when explicit verification-cadence guidance is retained versus omitted while verification-relevant state/facts are held constant. Cadence-Guided (CG) retained an instruction to request a new simulation after a substantive modification, whereas Cadence-Omitted (CO) removed that instruction; neither condition used a hard gate. The study therefore measures instruction-conditioned post-edit verification-policy adherence rather than spontaneous recognition that prior evidence has become stale. Using DWSIM as the simulator backend and continuous valve-pressure adjustment, five Alibaba/Qwen models were evaluated on eight synthetic cases; each model-case-condition combination was executed three times via live API calls, yielding 120 evaluation slots per condition. Re-verification was observed in 94/120 CG slots versus 32/120 CO slots; cadence violations occurred in 26/120 versus 87/120; and bounded final success was reached in 95/120 versus 35/120. qwen3.5-35b-a3b showed minimal re-verification (1/24 in CG and 0/24 in CO) and no final success in either condition. Within this bounded protocol, explicit post-edit verification-cadence guidance was associated with more re-verification, fewer cadence violations, and more frequent bounded final success, supporting the treatment of verification cadence as an explicit interaction-protocol component.
- Abstract(参考訳): 外部シミュレータと相互作用するエンジニアリングエージェントは、設計の修正を調整し、修正された状態のエンジニアリングエビデンスを再取得する必要があるかもしれない。
検証関連状態/ファクトが一定に保たれている間、明示的な検証ケイデンスガイダンスが省略されている場合、最初の編集後再検証が変更されるかどうかを問う。
Cadence-Guided (CG) は実質的な修正後に新しいシミュレーションを要求する命令を保持し、Cadence-Omitted (CO) はその命令を取り除いた。
この研究は、事前の証拠が陳腐化しているという自発的な認識よりも、教育条件付き検証後政治の順守を計測する。
DWSIMをシミュレータバックエンドと連続弁圧調整に使用し、8つの合成ケースで5つのAlibaba/Qwenモデルを評価し、各モデルとケース条件の組み合わせをライブAPIコールで3回実行し、1条件あたり120の評価スロットを得た。
94/120のCGスロットと32/120のCOスロットで再検証を行い、26/120と87/120でカデンス違反が発生し、95/120と35/120で最終成功に達した。
qwen3.5-35b-a3bは, CGでは1/24, COでは0/24であった。
この境界付きプロトコルでは、明示的な検証ケイデンスガイダンスは、より再検証し、ケイデンス違反を減らし、より頻繁な境界付き最終成功と結びつき、検証ケイデンスを明示的な相互作用プロトコールコンポーネントとして扱うことをサポートする。
関連論文リスト
- Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - AERA: Adaptive Evidence Residual Allocation for Efficient Test-Time Reasoning [22.964476507912327]
テストタイムスケーリングは、追加の候補ソリューションを生成することによって言語モデル推論を改善するが、すべての問題に同じ推論予算を割り当てることは、計算的に無駄である。
チェックポイントレベルの正しさは非単調に進化し、解答が崩壊する前に観測可能な証拠が強化され、回復前に弱まる可能性があることを示す。
本稿では,チェックポイント・オブザーバブル・エビデンスから,さらなる計算がより良い解が得られるかどうかを学習するシーケンシャル・コントローラであるアダプティブ・エビデンス・レシデンス・アロケーション(AERA)を紹介する。
論文 参考訳(メタデータ) (2026-08-28T06:21:07Z) - Benchmarking Cyberattack Detection in Electric Vehicle Charging Infrastructure with Benign User Updates [3.9286216777643737]
電気自動車の充電インフラにおけるサイバー攻撃検出は、要求されたエネルギーと出発時間に対する正常な動作後の修正によって複雑である。
本稿では, 実適応充電ネットワーク(ACN)セッションの入力順序を保存するための, リーク制御されたセッションレベルベンチマークを開発する。
固定プールは、生成された各攻撃をソースセッションの分割に保持し、物理的に動機付けられた6つの攻撃とその調整されたバリエーションを含む。
論文 参考訳(メタデータ) (2026-08-11T14:50:24Z) - From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents [47.678562263387214]
研究エージェントは、産業レコメンデーション設定において、多段階の機械学習実験をますます実施している。
生成されたアーティファクトは、サポートされないか、不完全かもしれないし、実行されたラウンドは無効かもしれないし、あるいは廃止されるかもしれないし、後の修正は、以前の発見を曖昧にするかもしれない。
本稿では,連続的アーティファクトのバウンダリ検証と実行後のクレーム資格を結合するエビデンス・グラウンド・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-05T13:37:38Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation [15.532709298240215]
視覚言語アクション(VLA)ポリシーは、オープンループアクションチャンクを通じて長距離移動操作を実行する。
本稿では、個別に訓練されたフリーズされた行動条件付き世界モデルを用いて実行を検証するCheckVLAを提案する。
RoboCasa365では、一般的なトレーニングレシピと一致した呼び出し予算の下で、CheckVLAの平均成功率は36.1%であり、定期的なリプランでは27.6%である。
論文 参考訳(メタデータ) (2026-07-29T11:31:33Z) - CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning [0.6999740786886536]
MGT-Bは、事前サンプリングの不確かさと変性の特徴の重なり合う窓を、位置条件による経験的尾の確率にマップする。
ログしきい値h=10のマニュアル選択後に最初に観察された問題同一性に対して,その効果が持続するかどうかを検証した。
どちらの分析も確証がなく、実証的要因は有効な電子プロセスや電子検出器として確立されていない。
論文 参考訳(メタデータ) (2026-07-22T13:34:17Z) - Closing the Loop on Latent Reasoning via Test-Time Reconstruction [45.08180971427891]
最近の研究は、中間推論を自然言語のトレースから潜時あるいはキャッシュレベルの表現に移行している。
本稿では,クエリ自体を参照としてループをクローズする自己教師型テストタイムトレーニング手法であるRELATを提案する。
ReLATは、単一モデル推論、テキストベースのコラボレーション、オープンループラテントコラボレーション、代替テストタイムトレーニング目標よりも一貫して改善されていることを示す。
論文 参考訳(メタデータ) (2026-06-04T14:54:40Z) - The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering [67.8271652641864]
我々は,隠蔽状態の介入によって検証の厳密性を制御できるかどうかを検討した。
VerifySteerは、サンプルレベルのルーティングに潜時補正信号を使用し、段落境界に選択的に介入する。
論文 参考訳(メタデータ) (2026-05-20T05:48:16Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel [5.106950500256654]
CoT(Chain-of- Thought)トレースは、言語モデルの能力向上とモデルの振る舞いの監査にますます利用されている。
我々は、この仮定を、回答コミットプロキシを中心に構築されたステップレベルのDect-Classify-Compareフレームワークでテストする。
9つのモデルと7つの推論ベンチマーク、潜在コミットメント、明示的な回答到着は平均61.9%のステップで一致している。
論文 参考訳(メタデータ) (2026-05-12T08:24:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。