論文の概要: Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs
- arxiv url: http://arxiv.org/abs/2604.18576v2
- Date: Tue, 21 Apr 2026 16:42:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 14:04:47.957603
- Title: Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs
- Title(参考訳): 言語的信念の逐次ベイズ更新を用いたエージェント予測
- Abstract要約: BLF (Bayesian Linguistic Forecaster) は二進予測のためのエージェントシステムである。
ForecastBenchのリーダーボードからの400のバックテスト質問に対して、BLFはすべての主要な公開メソッドを上回ります。
- 参考スコア(独自算出の注目度): 1.7470133607730627
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present BLF (Bayesian Linguistic Forecaster), an agentic system for binary forecasting that achieves state-of-the-art performance on the ForecastBench benchmark. The system is built on three ideas. (1) A linguistic belief state: a semi-structured representation combining numerical probability estimates with natural-language evidence summaries, updated by the LLM at each step of an iterative tool-use loop. This contrasts with the common approach of appending all retrieved evidence to an ever-growing context. (2) Hierarchical multi-trial aggregation: running $K$ independent trials and combining them using logit-space shrinkage with a data-dependent prior. (3) Hierarchical calibration: Platt scaling with a hierarchical prior, which avoids over-shrinking extreme predictions for sources with skewed base rates. On 400 backtesting questions from the ForecastBench leaderboard, BLF outperforms all the top public methods, including Cassi, GPT-5, Grok~4.20, and Foresight-32B. Ablation studies show that the structured belief state is almost as impactful as web search access, and that shrinkage aggregation and hierarchical calibration each provide significant additional gains. In addition, we develop a robust back-testing framework with a leakage rate below 1.5\%, and use rigorous statistical methodology to compare different methods while controlling for various sources of noise.
- Abstract(参考訳): 本稿では、ForecastBenchベンチマークで最先端性能を実現するバイナリ予測のためのエージェントシステムであるBLF(Bayesian Linguistic Forecaster)を提案する。
システムは3つのアイデアに基づいて構築されている。
1) 言語的信念状態: 数値的確率推定と自然言語的証拠要約を組み合わせた半構造化表現で, 反復ツール利用ループの各ステップで LLM によって更新される。
これは、回収されたすべての証拠を継続的に成長する文脈に付加するという一般的なアプローチとは対照的である。
2)階層的多施設集約:$K$独立トライアルを実行し,ロジット空間の縮小とデータ依存の事前処理を併用する。
(3)階層的キャリブレーション: 階層的事前のプラットスケーリングは、歪んだベースレートを持つソースに対する過度な予測を避ける。
ForecastBenchのリーダーボードからの400のバックテスト質問に対して、BLFはCassi、GPT-5、Grok~4.20、Foresight-32Bなど、すべての主要な公開メソッドを上回ります。
アブレーション研究では、構造化された信念状態はWeb検索アクセスに匹敵する影響があり、縮小集約と階層的キャリブレーションがそれぞれ有意な追加利得をもたらすことが示されている。
さらに, 漏洩率1.5\%未満の頑健なバックテストフレームワークを開発し, 様々なノイズ源を制御しながら, 厳密な統計的手法を用いて異なる手法を比較した。
関連論文リスト
- Branch-Centric Tokenization and Test-Time Augmentation for Skeleton Generation [4.947134980425439]
シーケンス内の接続を直接エンコードするブランチ対応表現であるブランチ中心のトークン化を導入する。
また、入力メッシュに軸方向の回転を適用するテスト時間拡張手法であるビュー拡張生成を導入する。
実験により,本手法は最先端手法よりも骨格予測精度がよいことが示された。
論文 参考訳(メタデータ) (2026-09-05T18:28:35Z) - Learning Auditable Classifier Models: Source-Disjoint Tree Ensembles [0.0]
臨床および規制された設定における予測モデルは正確で、完全に監査可能である必要がある。
本稿では,3段階学習手法であるResidual Pattern Tree Ensemble(RPTE)を紹介する。
RPTEは、有界特徴予算(bounded feature budget)、ソースの不整合(source disjointness)、別個の係数推定という3つの重要な原則に基づいている。
論文 参考訳(メタデータ) (2026-08-16T12:56:49Z) - Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning [14.640786318359709]
Branching Policy Optimization (BPO)は、サンドボックス固有のRLアルゴリズムで、バックボーン軌道に沿って高いエントロピー決定ポイントでサンドボックスをスナップショットする。
我々は、この推定器が非バイアスであり、軌跡レベルベースラインよりも厳密に分散が小さいことを証明した。
BPO は GRPO と RLOO の3.6--6.1 の絶対点が一致した計算で成功し、勾配-ノルムの分散を半減させ、ポリシー更新を38%減らして最良のベースラインと一致させる。
論文 参考訳(メタデータ) (2026-07-15T09:37:36Z) - Learn from your own latents and not from tokens: A sample-complexity theory [53.5821824211418]
本研究では,関連するビューやマスキング領域の潜在表現を予測するために訓練されたネットワークについて検討する。
潜在予測は、対数的要因まで、多くのサンプルを$L$で表すことでこれを達成できることを示す。
これは、H-JEPAのような明示的な積み重ねがほとんど冗長であることを示している。
論文 参考訳(メタデータ) (2026-05-26T22:16:42Z) - DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles [5.647839536820347]
著者間の不一致構造を抽出し活用し,信頼度を良好に推定するフレームワークであるDiscoUQを紹介する。
DiscoUQ-LLM の平均 AUROC は 0.802 であり、最高のベースラインを上回っている。
学習した機能は、ほぼゼロに近いパフォーマンス劣化を伴うベンチマークで一般化される。
論文 参考訳(メタデータ) (2026-03-21T23:24:12Z) - PRECEPT: Planning Resilience via Experience, Context Engineering & Probing Trajectories A Unified Framework for Test-Time Adaptation with Compositional Rule Learning and Pareto-Guided Prompt Evolution [2.28438857884398]
自然言語として知識を格納するLLMエージェントは、条件数の増加に伴って急激な検索劣化に悩まされる。
本稿では,3つの密結合コンポーネントによるテスト時間適応のための統合フレームワークであるPreCEPTを紹介する。
論文 参考訳(メタデータ) (2026-03-10T13:16:45Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Learning Discrete Bayesian Networks with Hierarchical Dirichlet Shrinkage [52.914168158222765]
我々はDBNを学習するための包括的なベイズ的フレームワークについて詳述する。
我々は、並列ランゲヴィン提案を用いてマルコフ連鎖モンテカルロ(MCMC)アルゴリズムを新たに提案し、正確な後続サンプルを生成する。
原発性乳癌検体から予後ネットワーク構造を明らかにするために本手法を適用した。
論文 参考訳(メタデータ) (2025-09-16T17:24:35Z) - Foundation Models for Demand Forecasting via Dual-Strategy Ensembling [11.926658499983446]
本研究では,現実のサプライチェーンにおける販売予測のための基盤モデルの性能を向上させる統一アンサンブルフレームワークを提案する。
提案手法は,(1)階層型アンサンブル(HE)と(2)モデルバックボーンからの予測を統合し,バイアスを緩和し,安定性を向上させるアーキテクチャアンサンブル(AE)の2つの相補的戦略を組み合わせる。
論文 参考訳(メタデータ) (2025-07-29T17:56:38Z) - Syntactic Control of Language Models by Posterior Inference [53.823006836309695]
言語モデルによって生成されたテキストの構文構造を制御することは、明快さ、スタイリスティックな一貫性、解釈可能性を必要とするアプリケーションにとって重要である。
後部推論に基づくサンプリングアルゴリズムは、生成中に対象の選挙区構造を効果的に強制することができると論じる。
提案手法では,提案分布からのサンプリングにより後続分布を推定するモンテカルロ法と,各生成したトークンが所望の構文構造に整合することを保証する統語タグを併用する。
論文 参考訳(メタデータ) (2025-06-08T14:01:34Z) - Confidence Diagram of Nonparametric Ranking for Uncertainty Assessment in Large Language Models Evaluation [20.022623972491733]
大きな言語モデル(LLM)のランク付けは、$N$のポリシーに基づいてアライメントを改善する効果的なツールであることが証明されている。
本稿では,言語モデルのランキングの中から仮説テストのための新しい推論フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-07T02:34:30Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z) - Parameter Decoupling Strategy for Semi-supervised 3D Left Atrium
Segmentation [0.0]
本稿では,パラメータ分離戦略に基づく半教師付きセグメンテーションモデルを提案する。
提案手法は,Atrial Challengeデータセット上での最先端の半教師付き手法と競合する結果を得た。
論文 参考訳(メタデータ) (2021-09-20T14:51:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。