論文の概要: Beyond Tracking or Shortcut: Composition-Bounded Predictive States in Poker Autoregressive Models
- arxiv url: http://arxiv.org/abs/2607.19369v1
- Date: Sat, 13 Jun 2026 15:56:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.138018
- Title: Beyond Tracking or Shortcut: Composition-Bounded Predictive States in Poker Autoregressive Models
- Title(参考訳): 追跡やショートカットを超えて:ポーカー自己回帰モデルにおける構成境界予測状態
- Authors: Quanhao Li, Qianyu Chen,
- Abstract要約: 隠れ状態プローブはしばしば不完全情報系列モデルで潜伏ラベルを復元する。
本稿では, 行動目標と価値目標のみに基づいて訓練された, ノーレンジリミットホールドム自己回帰モデルにおける, この曖昧さについて検討する。
- 参考スコア(独自算出の注目度): 4.810191717262418
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Hidden-state probes often recover latent labels in imperfect-information sequence models, but this alone does not establish that a model maintains a posterior belief distribution over hidden states. This paper studies this ambiguity in a no-range Limit Hold'em autoregressive model trained only on action and value targets, not on an opponent's hand or range. Opponent-range probes are positive after action/value controls in two of three seeds, and the behavior head predicts held-out actions about five percentage points above a baseline using only observable public history. However, visible public betting composition explains more opponent-range signal than residual hidden states, suggesting that most recoverable information comes from betting summaries. Action/value+composition baselines reach 16.5-16.7% top-10 accuracy while composition-residual hidden probes fall to 11.4-12.2%, and matched-composition comparisons are negative in every seed. We call this evidence pattern composition-bounded predictive support: hidden states remain behavior-predictive and opponent-range correlated, but most recoverable range information is explained by visible betting composition rather than residual hidden-state structure. This is a case-study claim about opponent-range representational evidence, not exact Bayesian posterior tracking or a causal belief mechanism. Synthetic control and oracle validations show that the same diagnostics accept posterior-sensitive states and reject raw composition states under matched controls. Thus positive belief probes should be interpreted through targeted alternatives before being treated as evidence of belief tracking.
- Abstract(参考訳): 隠れ状態プローブは、不完全な情報系列モデルで潜伏ラベルを復元することが多いが、これはモデルが隠された状態に対する後続の信念分布を維持することを証明していない。
本稿では,この曖昧さを,相手手や範囲ではなく,行動目標と価値目標のみに基づいて学習した,非距離制限ホールドの自己回帰モデルを用いて検討する。
応答範囲プローブは3つのシードのうち2つのアクション/バリューコントロール後に陽性となり、行動ヘッドは観測可能な公開履歴のみを用いてベースライン上の5ポイントのホールドアウトアクションを予測する。
しかし、目に見える公的な賭け構成では、残留した隠れ状態よりも相手距離の信号の方が多く説明されており、ほとんどの回復可能な情報は賭けの要約から来ていることを示唆している。
アクション/バリュー+コンポジションベースラインは16.5-16.7%のトップ10に到達し、組成/残留型隠れプローブは11.4-12.2%に低下する。
隠れ状態は、動作予測と反対範囲の相関を保ちながら、最も回復可能な範囲情報は、隠れ状態の残留構造ではなく、可視的ベッティング組成によって説明される。
これは、正当なベイズの後部追跡や因果的信念のメカニズムではなく、反対方向の表現的証拠に関するケーススタディの主張である。
合成制御とオラクル検証は、同一の診断が後発感受性状態を受け入れ、一致した制御の下で生合成状態を拒否したことを示している。
したがって、肯定的な信念調査は、信念追跡の証拠として扱われる前に、対象とする選択肢を通して解釈されるべきである。
関連論文リスト
- Unsupervised Keypoints for Real-Time Fall Detection: Comparative Analysis Under Real-world Conditions with Predictive Bandwidth Reduction [0.5959007032504439]
ビデオは転倒に関連する姿勢と動きをキャプチャするが、デプロイはプライバシ、計算、帯域幅によって制限される。
本稿では,教師なしキーポイントと予測時間モデルに基づいて,RGB伝送をコンパクトな動作表現に置き換えるプライバシー保護フレームワークを提案する。
ur Fall DetectionとHuman Fallのデータセットのフレームワークを,ランダム,主観的分離,オクルージョンに基づく分割を用いて評価した。
論文 参考訳(メタデータ) (2026-07-16T18:58:43Z) - A Held-Out Transition-Pair Falsifier for Long-Horizon Non-Abelian State Tracking [0.5076419064097734]
有限非アベリア群追跡のためのホールドアウト遷移ペアファルシファイアを導入する。
制御された$S_3 times S_3$ベンチマークでは、長さ8列のみに基づいてトレーニングされた投影されたリカレント状態モデルがエラーのない最終状態予測を生成する。
論文 参考訳(メタデータ) (2026-06-05T13:26:41Z) - Ghost: Plausible Yet Unlearnable Trajectories via On-Manifold Substitution for Next-POI Privacy [34.07056031726073]
チェックイントラジェクトリをリリースするパブリッシャは、ユーザの将来位置の強い予測器を不注意に公開する。
このリスクに対処するために、クリーンなテスト入力に対して次点次点(next-POI)の精度を低下させた被害者モデルを生成する、学習不能なトラジェクトリ、摂動シーケンスを生成する。
我々はGhostを提案する。Ghostは、摂動が人間のチェックインシーケンスのように見えるが、学習可能な信号は残っていない。
論文 参考訳(メタデータ) (2026-06-02T14:31:14Z) - Counterfactual Likelihood Tests for Indirect Influence in Private Reasoning Channels [51.56484100374058]
本稿では,私的推論チャネル間の影響を測定するための実証実験について述べる。
この方法は、上流のプライベートブロックを長さマッチングドナーブロックに置き換え、公開トークンシーケンスと下流ターゲットを固定し、下流ターゲットの負のログに似たシフトを測定する。
論文 参考訳(メタデータ) (2026-05-18T20:27:43Z) - On the Structural Non-Preservation of Epistemic Behaviour under Policy Transformation [51.56484100374058]
このような情報条件の相互作用パターンを振る舞い依存として定式化する。
これにより、$$-behavioural equivalenceというプローブ相対的な概念と、政治内行動距離が導かれる。
その結果、共通政策変換の下でプローブ条件の挙動分離が保存されない構造条件が明らかになった。
論文 参考訳(メタデータ) (2026-02-24T22:55:21Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - BURN: Backdoor Unlearning via Adversarial Boundary Analysis [73.14147934175604]
Backdoor Unlearningは、モデル本来の機能を保持しながら、バックドア関連の情報を削除することを目的としている。
本稿では, 偽相関疎結合, プログレッシブデータリファインメント, モデル浄化を統合した新しい防御フレームワーク, BURNによるバックドア・アンラーニングを提案する。
論文 参考訳(メタデータ) (2025-07-14T17:13:06Z) - Ensembled Prediction Intervals for Causal Outcomes Under Hidden
Confounding [49.1865229301561]
本稿では,既存の因果感受性モデルを用いた部分同定手法を提案し,Caus-Modensがより厳密な結果区間を与えることを示す。
3つの異なるベンチマークのうち最後のものは、未知だが探究可能な基底真理を持つ観測実験にGPT-4を新たに使用することである。
論文 参考訳(メタデータ) (2023-06-15T21:42:40Z) - A New Bandit Setting Balancing Information from State Evolution and
Corrupted Context [52.67844649650687]
本稿では,2つの確立されたオンライン学習問題と包括的フィードバックを組み合わせた,逐次的意思決定方式を提案する。
任意の瞬間にプレーする最適なアクションは、エージェントによって直接観察できない基礎となる変化状態に付随する。
本稿では,レフェリーを用いて,コンテキストブレイジットとマルチアームブレイジットのポリシーを動的に組み合わせるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-11-16T14:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。