論文の概要: Opponent State Inference Under Partial Observability: An HMM-POMDP Framework for 2026 Formula 1 Energy Strategy
- arxiv url: http://arxiv.org/abs/2603.01290v1
- Date: Sun, 01 Mar 2026 21:48:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-03 19:50:56.610976
- Title: Opponent State Inference Under Partial Observability: An HMM-POMDP Framework for 2026 Formula 1 Energy Strategy
- Title(参考訳): 部分観測可能性下での対向状態推論:2026年のF1エネルギー戦略のためのHMM-POMDPフレームワーク
- Abstract要約: 2026 フォーミュラ1の技術的な規制はエネルギー戦略に根本的な変化をもたらす。
最適エネルギー配置ポリシーは、運転者自身の状態だけでなく、ライバル車の隠れ状態にも依存する。
抽出可能な2層推論および決定フレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The 2026 Formula 1 technical regulations introduce a fundamental change to energy strategy: under a 50/50 internal combustion engine / battery power split with unlimited regeneration and a driver-controlled Override Mode (abbreviated MOM throughout), the optimal energy deployment policy depends not only on a driver's own state but on the hidden state of rival cars. This creates a Partially Observable Stochastic Game that cannot be solved by single-agent optimisation methods. We present a tractable two-layer inference and decision framework. The first layer is a 30-state Hidden Markov Model (HMM) that infers a probability distribution over each rival's ERS charge level, Override Mode status, and tyre degradation state from five publicly observable telemetry signals. The second layer is a Deep Q-Network (DQN) policy that takes the HMM belief state as input and selects between energy deployment strategies. We formally characterise the counter-harvest trap -- a deceptive strategy in which a car deliberately suppresses observable deployment signals to induce a rival into a failed attack -- and show that detecting it requires belief-state inference rather than reactive threshold rules. On synthetic races generated from the model's own assumptions, the HMM achieves 92.3% ERS inference accuracy (random baseline: 33.3%) and detects counter-harvest trap conditions with 95.7% recall. Pre-registration -- empirical validation begins Australian Grand Prix, 8 March 2026.
- Abstract(参考訳): 2026年のフォーミュラ1の技術的規制ではエネルギー戦略に根本的な変更が加えられており、50/50の内燃機関/バッテリ電源が無制限にリジェクションされ、運転者が制御するオーバーライドモード(MOM全体)の下では、最適なエネルギー配置ポリシーは運転者自身の状態だけでなく、競合車の隠れ状態にも依存する。
これにより、単一エージェント最適化法では解決できない部分観測可能な確率ゲームが生成される。
抽出可能な2層推論および決定フレームワークを提案する。
第1層は30状態隠れマルコフモデル(HMM)で、ライバルのERS電荷レベル、オーバーライドモード状態、および5つの公に観測可能なテレメトリー信号からタイヤ劣化状態の確率分布を推定する。
第2のレイヤはディープQネットワーク(Deep Q-Network, DQN)ポリシであり、HMMの信念状態を入力として、エネルギー展開戦略間の選択を行う。
これは、車が故意に観測可能な配置信号を抑圧し、ライバルを攻撃に誘導する偽りの戦略であり、反応しきい値ルールではなく、信念状態の推論を必要とすることを示す。
モデル自身の仮定から生成された合成レースにおいて、HMMは92.3%のERS推定精度(ランダムベースライン33.3%)を獲得し、95.7%のリコールで反ハーベストトラップ条件を検出する。
事前登録 -- 2026年3月8日、オーストラリアグランプリの試験的検証が開始される。
関連論文リスト
- DREAM Technical Report [53.37525197047151]
DREAMは、既存のパイプラインの上に認識認識、オーケストレーション、監査可能なポリシ層を追加し、それを置き換えることなく、自律的な最適化制御アーキテクチャである。
DREAMには2つのコアコンポーネントがある。まず、3層Intent Engineはデバイス上の信号を構造化されたL0/L1/L2インテント表現に融合する。エッジクラウドトリガーチェーンはレポートのボリュームを約8.7%に削減する。
第2に、Meta EngineはMetaModelを使って、層状M1-to-M2-to-M3推論(インテントの要約、ストラテジーメモリに通知されるストラテジープランニング、パラメータ変換など)を定式化したM1-to-M2-to-M3推論に使用します。
論文 参考訳(メタデータ) (2026-08-10T10:35:32Z) - The SIGReg Objective as Variational Free Energy: A Theoretical Active-Inference Account of JEPA World Models [47.471225029744424]
JEPA(Joint-Embedding Predictive Architectures)は、潜在世界モデルの主要な設計である。
本稿では,JEPAのトレーニング目標である予測損失と重み付き埋め込み正規化の選択肢が,有効能動推論(AIF)変動自由エネルギーであるか否かを判定する。
論文 参考訳(メタデータ) (2026-07-15T08:59:36Z) - Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control [0.0]
本研究は,証明可能な報酬を伴う強化学習を通じて,オープンウェイト推論モデルに適応する。
30の訓練プロンプトのみを使用して、強化微調整(RFT)は上層階のスケジューラとしてモデルを訓練する。
RFTは、オープンウェイトモデルの排出量を70.5から61.2kg-CO2に削減する。
論文 参考訳(メタデータ) (2026-07-14T15:08:39Z) - When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games [69.57330692969543]
RNG-Benchは、過去の観測を再構築するベースモデルの能力を分離するために設計されたベンチマークスイートである。
RNG-Benchには2つの補完ゲームがある: マッチングペア(英語版) - 特定の場所でカードのIDを短期間明らかにする) と、エゴセントリックなビューを空間地図に統合する3D Maze である。
最も難しい構成では、約128Kのトークンと350のイメージ入力のコンテキストが必要であり、フロンティアMLLMによる飽和には程遠いままである。
論文 参考訳(メタデータ) (2026-06-17T17:59:34Z) - NOVA: Symbolic Regression Discovery of Interpretable Car-Following and Lane-Change Models with Driver Heterogeneity [1.889930012459364]
NOVAは自動車追尾および車線変更構造のための自律的な象徴的回帰フレームワークである。
NGSIM I-80とUS-101データセットからの4,765,788のアクティブな運転観察に適用される。
NOVAは502人のドライバーに対して厳格な車両IDホールドアウトの下で67.4%のバランスの取れた精度を達成した。
論文 参考訳(メタデータ) (2026-06-09T08:47:39Z) - GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives [48.545980031973556]
GAMBITは、インポスタ検出器を評価するための3つの評価モードと2つの独立したスコアを持つベンチマークである。
ベンチマークには、240の共進化型インポスタ戦略にまたがる27,804のラベル付きインスタンスのデータセットが付属している。
論文 参考訳(メタデータ) (2026-05-09T16:07:23Z) - IPEK: Intelligent Priority-Aware Event-Based Trust with Asymmetric Knowledge for Resilient Vehicular Ad-Hoc Networks [0.0]
Vehicular Ad Hoc Networks(VANET)は、既存の信頼モデルにおけるトラフィックイベントの均一な処理を利用するインテリジェントアタッカーに対して脆弱である。
本稿では,イベント認識型および位置認識型知的攻撃モデルについて紹介する。
第3に、Yagerのコンビネーションルールを使って世界的信頼融合のためにDempster-Shaferを適応させ、矛盾する証拠を早急な決定を強制するのではなく、不確実性に割り当てる。
論文 参考訳(メタデータ) (2026-04-08T19:15:28Z) - Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming [6.747476403446967]
StreamGuardは、予測問題としてモデレーションを定式化する、モデルに依存しないストリーミングガードレールである。
StreamGuardは入力モデレーションとストリーミング出力モデレーションの両方に強く作用することを示す。
また、予測に基づく監督は、トークン化者やモデルファミリー間で効果的に伝達されることを示す。
論文 参考訳(メタデータ) (2026-04-05T04:48:15Z) - Uncertainty-Aware Jamming Mitigation with Active RIS: A Robust Stackelberg Game Approach [65.06640919319413]
本稿では,アクティブリコンフィギュアブルインテリジェントサーフェス(ARIS)を利用したジャミング緩和について検討する。
正当側と敵側の戦略的相互作用をモデル化するために,Stackelbergゲーム定式化を採用する。
まず、ロバストなアンチジャミング設計のための正当側最適化に組み込む、従者のベストレスポンスとして最適なジャミングポリシーを導出する。
論文 参考訳(メタデータ) (2026-02-20T12:02:01Z) - Towards Anytime-Valid Statistical Watermarking [63.02116925616554]
我々は、任意の時間価推論で最適なサンプリングを統一する、最初のe-value-based watermarking frameworkであるAnchored E-Watermarkingを開発した。
本フレームワークはサンプル効率を大幅に向上させ,最先端のベースラインに対して,検出に必要な平均トークン予算を13~15%削減する。
論文 参考訳(メタデータ) (2026-02-19T18:32:26Z) - Potential-energy gating for robust state estimation in bistable stochastic systems [0.0]
ダブルウェル・ダイナミクスによって制御されるシステムにおけるロバストな状態推定法である電位エネルギーゲーティングを導入する。
拡張フィルタ,アンセントフィルタ,アンサンブルフィルタ,適応カルマンフィルタ内にゲーティングを実装した。
論文 参考訳(メタデータ) (2026-02-12T08:43:34Z) - You Only Need Your Transformer 25% of the Time: Meaning-First Execution for Eliminating Unnecessary Inference [0.0]
本稿では,このフレームワークを実装したコントロールプレーンアーキテクチャであるMeaning-First Execution (MFEE)を紹介する。
MFEEは78.1%の実行削減を実現し、呼び出された実行に対する100%の正確なマッチ等価性を維持している。
論文 参考訳(メタデータ) (2025-12-29T08:03:52Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Fortytwo: Swarm Inference with Peer-Ranked Consensus [36.94429692322632]
我々は、AI推論において優れたパフォーマンスを達成するために、Swarmの知能原則と分散ペアのランキングコンセンサスを活用する新しいプロトコルFortytwoを提案する。
独自のBradley-Terry-styleアグリゲーションモデルを用いて、Swarm推論が多数決をかなり上回ることを示す。
論文 参考訳(メタデータ) (2025-10-27T23:19:48Z) - MARS: A Malignity-Aware Backdoor Defense in Federated Learning [51.77354308287098]
最近提案されたSOTA攻撃(3DFed)は、ディフェンダーがバックドアモデルを受け入れたかどうかを判断するためにインジケータ機構を使用する。
本稿では,各ニューロンの有害な範囲を示すためにバックドアエネルギーを利用するMARS(Maignity-Aware backdooR defenSe)を提案する。
実験により、MARSはSOTAのバックドア攻撃に対して防御でき、既存の防御を著しく上回っていることが示された。
論文 参考訳(メタデータ) (2025-09-21T14:50:02Z) - Towards Reliable AI in 6G: Detecting Concept Drift in Wireless Network [5.553439910778821]
モデルに依存しない2つの非教師付きバッチドリフト検出器を導入する。
どちらの手法も予測ユーティリティスコアを計算し、コンセプトドリフトの発生時期とモデル再トレーニングが保証されるかどうかを決定する。
我々は,屋外指紋認証とリンク・アノマリー検出の2つの実世界の無線利用事例について,本フレームワークの有効性を検証した。
論文 参考訳(メタデータ) (2025-07-31T12:31:57Z) - Conformal Policy Learning for Sensorimotor Control Under Distribution
Shifts [61.929388479847525]
本稿では,センサコントローラの観測値の分布変化を検知・応答する問題に焦点をあてる。
鍵となる考え方は、整合量子を入力として取ることができるスイッチングポリシーの設計である。
本稿では, 基本方針を異なる特性で切り替えるために, 共形量子関数を用いてこのようなポリシーを設計する方法を示す。
論文 参考訳(メタデータ) (2023-11-02T17:59:30Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。