論文の概要: In CEM, a World Model Is Also a Proposal Mechanism
- arxiv url: http://arxiv.org/abs/2610.00921v1
- Date: Thu, 01 Oct 2026 01:57:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.845231
- Title: In CEM, a World Model Is Also a Proposal Mechanism
- Title(参考訳): CEMでは、世界モデルも提案メカニズムである
- Abstract要約: クロスエントロピー法(CEM)は、世界モデルスコアを用いてアクションシーケンスを選択し、次のイテレーションでサンプリングされた分布に適合する。
4種類の予測モデルはCEMトレースを生成し、各モデルは保存された全ての候補プールを再スコアする。
環境における同じ候補の実行は、参照エリートセットと提案の更新を提供する。
- 参考スコア(独自算出の注目度): 1.0312968200748118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The cross-entropy method (CEM) uses world-model scores to select action sequences and fit the distribution sampled in its next iteration. A scoring error can therefore change both the present decision and the candidates considered later. We evaluate these two roles separately. Four types of predictive model generate CEM traces, and every model rescores every saved candidate pool. Executing the same candidates in the environment provides a reference elite set and proposal update. Across twelve independently trained task-seed units on Walker and Cheetah, the pre-specified proposal distance falls from the first to the final CEM iteration in every unit. Proposal widths contract and fitted means separate relative to the remaining search width. Pairwise ranking agreement stays near chance on Walker and declines on Cheetah; elite-set agreement does not improve. This comparison shows greater variation between scorers than between pool sources on Cheetah; Walker has variation in both and in their pairings. We use the original six units to select Random nonlinear for a one-update intervention, without inspecting intervention outcomes. Replacing its first model-ranked update with an environment-ranked update lowers final realised selected-sequence cost in those six units and in six further units held out from the selection.
- Abstract(参考訳): クロスエントロピー法(CEM)では、世界モデルスコアを使用してアクションシーケンスを選択し、次のイテレーションでサンプリングされた分布に適合する。
したがって、スコアリングエラーは、現在の決定と後で検討される候補者の両方を変えることができる。
これら2つの役割を別々に評価する。
4種類の予測モデルはCEMトレースを生成し、各モデルは保存された全ての候補プールを再スコアする。
環境における同じ候補の実行は、参照エリートセットと提案の更新を提供する。
ウォーカーとチーターで個別に訓練された12のタスクシードユニットのうち、事前に指定された提案距離は各ユニットにおいて最初のCEMイテレーションから最後のCEMイテレーションに該当する。
提案幅契約及び取付手段は、残りの探索幅に対して分離される。
ペアワイズ・ランキングの合意はウォーカーに近づき、チーターに下がったが、エリート・セットの合意は改善しない。
この比較では、Cheetahのプールソースよりもスコア間の変動が大きく、Walkerはペアリングの両方で変動している。
我々は、介入結果を検査することなく、元の6つのユニットを使用して、1回の更新介入に対してランダム非線形を選択する。
最初のモデルランクの更新を環境ランクの更新に置き換えると、6つのユニットで最終的な選択シーケンスコストが低下し、さらに6つのユニットが選択から切り離された。
関連論文リスト
- Every Batch Is Its Own Validation Set: Leave-One-Out Gradient Matching for Online Data Selection in LLM Fine-Tuning [21.343765027634316]
LOOMはLlama-3.1-8BとQwen2.5-7Bでフルバッチトレーニングを2.3と2.4ポイント改善した。
LOOMはすべてのアンサンブル勾配マーカを2.4ポイント、検証誘導GREATSとOPUSを1.6-2.0で上回る。
論文 参考訳(メタデータ) (2026-09-30T17:22:54Z) - SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL [23.46401628317993]
本稿では、この区別をツリーベースの信用評価に組み込んだ選択推論ポリシー最適化(SIPO)を提案する。
そのスケールのない分岐基準は、一貫した相対的なスケールで生成スコアと兄弟のペナルティを保持する。
SIPOは比較手法の中で最も高いマルチホップとシングルホップの平均を達成している。
論文 参考訳(メタデータ) (2026-09-28T10:09:48Z) - Optimizers for Diffusion Models: A Controlled Benchmark [75.49404880689772]
4つの拡散定式化にまたがる制御されたベンチマークを示す。
全ての勝者は3つの種で全予算で再訓練される。
Muon、MARS-M、SOAPはそれぞれ、少なくとも1つの拡散定式化で調整されたAdamWを破った。
論文 参考訳(メタデータ) (2026-09-19T14:41:28Z) - Back to All-Entity Ranking: Sampler-Dependent Evaluation in Continuous-Time Dynamic Graphs [0.0]
CTDGsの次の決定予測は、サンプルされた負の目的地に対する観測された相互作用をランク付けする。
非均一な負の分布がベイズ最適ランクを変化させることを示す。
本機構は, 観察・未知の陰性に対する繰り返し陽性, 新規陽性の因子的評価を用いて検討した。
論文 参考訳(メタデータ) (2026-07-30T08:37:43Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence [22.315546054051143]
大規模言語モデルのバイアス監査は、EU AI Actなどのガバナンスフレームワーク内で運用されている。
このプロトコルでは、各バイアススコアを2つの軸上での信頼性推定とともに報告する。
論文 参考訳(メタデータ) (2026-05-09T16:26:49Z) - When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines [0.0]
マルチエージェントLLMパイプラインは、チームの多様性がアウトプット品質を改善するかどうかという矛盾した証拠を生み出します。
多様性が役に立つか傷つくかを判断する選択ボトルネックを特定することで解決法を提案する。
この結果から, セレクタの品質は, 単ラウンドジェネレータ選択パイプラインにおけるジェネレータの多様性よりも, より影響の高い設計レバーである可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-20T00:50:53Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - Test-Time Alignment via Hypothesis Reweighting [56.71167047381817]
大規模な事前訓練されたモデルは、しばしば未指定のタスクで苦労する。
テストタイムのユーザ意図にモデルを整合させるという課題に対処する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-11T23:02:26Z) - Confidence-Based Model Selection: When to Take Shortcuts for
Subpopulation Shifts [119.22672589020394]
モデル信頼度がモデル選択を効果的に導くことができるConfidence-based Model Selection (CosMoS)を提案する。
我々はCosMoSを,データ分散シフトのレベルが異なる複数のテストセットを持つ4つのデータセットで評価した。
論文 参考訳(メタデータ) (2023-06-19T18:48:15Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。