論文の概要: VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
- arxiv url: http://arxiv.org/abs/2610.08761v1
- Date: Tue, 06 Oct 2026 17:50:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.157204
- Title: VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
- Title(参考訳): VeriFine: 自己改善のためのスケーリング検証
- Abstract要約: 我々は,政策の共進化,訓練カリキュラム,審査を通じて検証をスケールする枠組みを導入する。
ポリシー改善ループは、繰り返し発生する障害を診断し、適応的なカリキュラムを構築し、ポリシーを最適化するためにルーリックな判断を使用する。
運転およびロボットナビゲーションタスクの実験は、ポリシーと判断能力の両方において継続的な自己改善を示す。
- 参考スコア(独自算出の注目度): 80.69185348729495
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-improving policies continually expose new failure patterns, changing what their judges must be able to verify. However, current fixed judges constrain both optimization feedback and the discovery of useful training examples, limiting further self-improvement. This challenge is even more acute in embodied reasoning, where reliable evaluation must account for spatial grounding, causal reasoning, and safety-aware decision-making. We introduce VeriFine, an agent harness framework that scales verification through the co-evolution of the policy, training curriculum, and judge. The Policy Improvement Loop uses a rubric judge to diagnose recurring failures, construct an adaptive curriculum, and optimize the policy. When progress plateaus and verification becomes a bottleneck, the Judge Improvement Loop selectively queries human guidance on informative failure cases and refines the judge through coactive calibration, in which humans and agents resolve disagreements and converge toward the objective rubric of physical reasoning. The revised judge then guides the next stage of data selection and policy optimization. Experiments on driving and robot navigation tasks demonstrate continuous self-improvement in both policy and judge capability across reinforcement and supervised fine-tuning. These results show how scaling verification supports continuous self-improvement as policy failure patterns evolve.
- Abstract(参考訳): 自己改善ポリシは、新たな障害パターンを継続的に公開し、審査員が検証しなくてはならないものを変更する。
しかし、現在の定員は最適化フィードバックと有用なトレーニング例の発見の両方を制約し、さらなる自己改善を制限している。
この課題は、空間的根拠付け、因果推論、安全に配慮した意思決定を信頼性の高い評価が考慮しなければならない、具体的推論においてさらに緊急である。
政策の共進化、訓練カリキュラム、審査を通じて検証をスケールするエージェントハーネスフレームワークであるVeriFineを紹介する。
ポリシー改善ループは、繰り返し発生する障害を診断し、適応的なカリキュラムを構築し、ポリシーを最適化するためにルーリックな判断を使用する。
進行プラトーと検証がボトルネックとなると、審査員改善ループは、情報的障害事例に関する人間のガイダンスを選択的にクエリし、人間とエージェントが不一致を解消し、物理的推論の客観的なルーリックに向かって収束するコアクティブキャリブレーションを通じて裁判官を洗練させる。
改訂された審査員は次にデータ選択とポリシー最適化のステージを案内する。
運転およびロボットナビゲーションタスクの実験は、強化および監督された微調整によるポリシーと判断能力の両方において継続的な自己改善を示す。
これらの結果は、ポリシーの失敗パターンが進化するにつれて、スケーリング検証が継続的自己改善をサポートすることを示す。
関連論文リスト
- Credit-Guided Policy Improvement for Test-time Adaptive Vision-Language Navigation [53.30116823667751]
視覚言語ナビゲーションのためのテスト時適応(TTA-VLN)により、事前訓練されたポリシーは、目に見えない環境にオンラインで適応できる。
分散シフトは、局所的な行動選好を歪め、オフコース決定につながる可能性がある。
我々は,行動誘発観察遷移から署名付き参照関連決定クレジットを回収する信用誘導政策改善(CGPI)を提案する。
論文 参考訳(メタデータ) (2026-09-29T13:46:11Z) - Designing Reliable LLM-as-a-Judge Measurement Systems for Multi-Turn Business Agents [8.161545709715947]
本稿では,評価仕様,モジュール型LCM判断,ユーザシミュレーションの意図保存,ループ内ガバナンスを対象とする統合手法を提案する。
仕様では、会話レベルのエンドステートと実行可能な障害オーナシップを定義している。
研究によると、繰り返し監査によってシステムレベルの忠実度が向上し、共有フィードバックループの下で人間レビュアーと自動判断器が共に改善し、これらのワークフローが共に報告されたタスク補完設定において最も強い記述的パフォーマンスを示した。
論文 参考訳(メタデータ) (2026-09-27T21:52:05Z) - Counterfactual Self-Evolving Agents for Evidence-Grounded Reasoning [35.98610301736344]
セルフプレイプロジェクタ-ソルバ手法は、タスクを生成し、検証されたソリューションから学習することで推論を改善する。
そこで,本論文では,原事例を再考するための反実的文脈を生成する反実的自己進化について紹介する。
トレーニング可能なプロポーラは、対象とするエビデンスを編集し、因果的説明で潜在的な結果の変化を記述する。
論文 参考訳(メタデータ) (2026-09-26T18:54:50Z) - Optimizing the Score, Losing Sight of the Task: Reward Hacking Across Weights, Selection, and Prompts [0.0]
プロキシエラーに対する到達可能な動作、最適化予算、永続的な適応形状の露出について示す。
正確な有限出力図示は、スコアリング欠陥の位置が各メソッドが好む振る舞いをどう変えるかを示す。
結果として得られるフレームワークは、最適化の選択と検証要件を結びつける。
論文 参考訳(メタデータ) (2026-09-22T08:12:58Z) - CARE-VI: Conservative Adaptive Reliability Estimation for Value Improvement in Off-Policy Actor-Critic Learning [9.09344103114193]
我々は、保守的適応ランク付け・スクリーニング(CARS)とセレクタ・評価値アセスメント(SEVA)を開発する。
DAREは、候補信頼性、セレクタと評価器信号のギャップ、および有限ステージ係数を用いて、各残差補正を規制する。
CARE-VIは、批評家のレグレッションとアクターのアップデートのためのバックボーンインターフェースを保存するエビデンス規制されたターゲット構築フレームワークである。
論文 参考訳(メタデータ) (2026-09-17T11:59:43Z) - RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation [56.84819098277464]
CoNLは、マルチエージェントのセルフプレイを通じて生成、評価、メタ評価を統合するフレームワークである。
CoNLは、安定したトレーニングを維持しながら、自己回帰ベースラインよりも一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-01-29T09:41:14Z) - Online Decision Mediation [72.80902932543474]
意思決定支援アシスタントを学習し、(好奇心)専門家の行動と(不完全)人間の行動の仲介役として機能することを検討する。
臨床診断では、完全に自律的な機械行動は倫理的余裕を超えることが多い。
論文 参考訳(メタデータ) (2023-10-28T05:59:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。