論文の概要: PROSE: A Theory of Optimal Stopping with Perishable Evidence for Peer Selection in Intermittently Connected Decentralised Learning
- arxiv url: http://arxiv.org/abs/2609.23845v1
- Date: Sun, 20 Sep 2026 20:00:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.009051
- Title: PROSE: A Theory of Optimal Stopping with Perishable Evidence for Peer Selection in Intermittently Connected Decentralised Learning
- Title(参考訳): PROSE: 間欠的連結型分散学習におけるピア選択のための透過的エビデンスによる最適停止の理論
- Abstract要約: 本稿では,結果のピア選択問題に対する最適停止の自己完結理論を開発する。
ProSE(Perishable-evidence Reservation-value Optimal Stopping for Exchange)は軽量で完全に局所的な政策である。
- 参考スコア(独自算出の注目度): 2.7091156405401566
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decentralised federated learning removes the aggregation server but makes collaboration dependent on transient peer availability. In mobile and intermittently connected systems, evaluating a promising peer consumes contact time and may cause the exchange opportunity itself to vanish, so that the evidence a learner gathers about a peer is perishable: it decays because links expire and because peer models drift while old measurements age. This paper develops a self-contained theory of optimal stopping for the resulting peer-selection problem. We formalise a receiver's within-contact decision as a finite-horizon Markov optimal-stopping problem with costly information acquisition and a future-arrival outside option, and prove that it admits an optimal policy characterised by a reservation value (Snell-envelope structure). Around this formulation we prove: (i) stage-uniform, drift-aware concentration and a maximin certification rule that is correct with high probability together with a finite-sample identification bound; (ii) a mobility-aware value of-information stopping rule and comparative statics showing that higher link hazard lowers the value of continued probing and enlarges the stopping region; (iii) a closed-form value of waiting under marked-Poisson contact arrivals, together with a search-theoretic reservation value whose comparative statics we characterise; and (iv) a myopic-optimality theorem establishing that, in sufficiently volatile (monotone) mobility regimes, the one-step confidence-safe rule is a sound surrogate for the optimal policy and never stops prematurely. We instantiate the theory as PROSE (Perishable-evidence Reservation-value Optimal Stopping for Exchange), a lightweight, fully local policy, and delineate the static contact and drift-free limits in which classical sequential decision problems are recovered. The development is entirely analytical.
- Abstract(参考訳): 分散フェデレーション学習は集約サーバを削除しますが、一過性のピア可用性に依存します。
モバイルと断続的に接続されたシステムでは、有望なピアの評価が接触時間を消費し、交換機会自体が消滅する可能性があるため、学習者がピアについて収集した証拠は、リンクが切れ、ピアモデルが古い測定期間に漂流するため、消滅する。
本稿では,結果のピア選択問題に対する最適停止の自己完結理論を考案する。
我々は,受信機の内部契約決定を,コストのかかる情報取得と将来の外部オプションを含む有限水平マルコフ最適停止問題として定式化し,予約値(Snell-envelope 構造)によって特徴付けられる最適ポリシーを認めることを証明した。
この定式化の周りで証明する。
(i)有限サンプル識別境界とともに高い確率で正当である段ユニフォーム、ドリフト対応濃度及びマキシミン認証規則
(二 情報停止規則及びリンクハザードの高次化が継続探索の価値を低下させ、停止領域を拡大することを示す比較静的値。)
三 マーク・ポアソン接触到着の待ち待ちのクローズドフォーム値及び比較静的が特徴とする探索理論予約値
四 十分な揮発性(単調)のモビリティレジームにおいて、一段階の信頼-安全規則は最適政策の健全な代理であり、早めに停止しないことを定めている。
本稿では、PROSE(Perishable-evidence Reservation-value Optimal Stopping for Exchange)として、軽量で完全に局所的なポリシーを定式化し、古典的なシーケンシャルな決定問題を回復する静的接触とドリフトフリーの限界を導出する。
開発は完全に分析的だ。
関連論文リスト
- \mathsf{VISTA}: Decentralized Machine Learning in Adversary Dominated Environments [21.69919643934826]
分散機械学習は、評価などのアウトソーシング計算を信頼できないワーカノードに頼っていることが多い。
本稿では, 相互に整合性がある場合にのみ, 報告を受理し, 報奨するインセンティブ指向の枠組みを通じて, 敵に支配される設定について検討する。
本稿では,最適化履歴を用いた適応アルゴリズムであるmathsfVISTAを提案する。
論文 参考訳(メタデータ) (2026-05-08T15:07:15Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Cognitive Friction: A Decision-Theoretic Framework for Bounded Deliberation in Tool-Using Agents [0.0]
制約のないツール使用エージェントは、どの情報ソースをクエリして実行するかを決めなければなりません。
本稿では,これらの障害モードを認知的摩擦によって形式化する決定論的枠組みであるTCAを提案する。
我々は,TCAを2つの制御された環境において,停止品質,混雑時の行動選択,時間的緊急性の分離を図った。
論文 参考訳(メタデータ) (2026-03-31T17:30:25Z) - Towards Anytime-Valid Statistical Watermarking [63.02116925616554]
我々は、任意の時間価推論で最適なサンプリングを統一する、最初のe-value-based watermarking frameworkであるAnchored E-Watermarkingを開発した。
本フレームワークはサンプル効率を大幅に向上させ,最先端のベースラインに対して,検出に必要な平均トークン予算を13~15%削減する。
論文 参考訳(メタデータ) (2026-02-19T18:32:26Z) - The Silent Scholar Problem: A Probabilistic Framework for Breaking Epistemic Asymmetry in LLM Agents [0.6117371161379209]
本稿では,エージェントに双方向知識交換のための非構造的動機を与える形式的確率的枠組みを提案する。
これらの蓄積された信念状態が、人間フィードバックからの強化学習(RLHF)と監視ファインチューニング(SFT)のための高品質データフィルタの検証可能な報酬信号としてどのように機能するかを示す。
シミュレーションの結果、この不確実性駆動型戦略が異種環境におけるランダムベースラインを著しく上回ることを示した。
論文 参考訳(メタデータ) (2025-12-24T02:02:25Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - STARec: An Efficient Agent Framework for Recommender Systems via Autonomous Deliberate Reasoning [54.28691219536054]
我々は、自律的な熟考的推論機能を備えたレコメンデータシステムを支援する、ゆっくり考えられた拡張エージェントフレームワークSTARecを紹介する。
我々は,先進的推論モデルと嗜好整合型報酬形成から構造化知識の蒸留を組み合わせた2段階のパラダイムであるアンカー強化訓練を開発する。
MovieLens 1MとAmazon CDsベンチマークの実験では、STARecは最先端のベースラインと比較して、大幅なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-08-26T08:47:58Z) - Sequential Manipulation Against Rank Aggregation: Theory and Algorithm [119.57122943187086]
脆弱なデータ収集プロセスに対するオンライン攻撃を活用します。
ゲーム理論の観点からは、対決シナリオは分布的に堅牢なゲームとして定式化される。
提案手法は,ランクアグリゲーション手法の結果を逐次的に操作する。
論文 参考訳(メタデータ) (2024-07-02T03:31:21Z) - Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes [44.974100402600165]
意思決定プロセス(MDP)に対する最良パラメトリックかつ最悪の摂動の評価について検討する。
我々は、元のMDPからの遷移観測を用いて、それらが同一または異なるポリシーの下で生成されるかのどちらかを判断する。
我々の推定器はウォルドの信頼区間を用いた統計的推測も行う。
論文 参考訳(メタデータ) (2024-03-29T18:11:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。