論文の概要: Dynamic Objective Selection with Safeguards and LLM Oversight for Financial Decision-Making
- arxiv url: http://arxiv.org/abs/2606.03704v1
- Date: Tue, 02 Jun 2026 14:22:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 22:00:05.066026
- Title: Dynamic Objective Selection with Safeguards and LLM Oversight for Financial Decision-Making
- Title(参考訳): 金融意思決定のための安全ガードとLLM監視を用いた動的客観的選択
- Authors: Keigo Sakurai, Takahiro Ogawa, Miki Haseyama, Anjyu Anan, Kei Nakagawa,
- Abstract要約: DOSS(Dynamic Objective Selection with Safeguards)は,各時点における決定関連目的関数を直接選択する学習ベースのセレクタである。
DOSSは客観的選択を目的の分類問題として定式化し、ローリングウィンドウで逐次更新を行う。
ミスの選択とデプロイの過度な切り替えを軽減するため、DOSSはフェールセーフで信頼度を意識したゲーティングを適用し、低信頼の提案を保守的なデフォルトにオーバーライドし、スイッチング周波数に関連する明示的なコントロールを実行する。
- 参考スコア(独自算出の注目度): 33.643275739813056
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Financial decision-making tasks such as stock recommendation and portfolio allocation typically estimate future return and risk and then select trades or allocations for an investor, and the chosen optimization objective often determines realized performance. However, because market conditions evolve over time, a fixed objective can be suboptimal across regimes, while regime-switching pipelines that rely on latent regime estimates can be noisy or delayed and frequent switching can increase turnover and operational instability. In this paper, we propose DOSS (Dynamic Objective Selection with Safeguards), a learning-based selector that directly chooses the decision-relevant objective function at each time point from interpretable statistical summaries of recent returns, selecting among a small set of candidates (e.g., return-seeking, loss-averse, and risk-adjusted) without introducing intermediate regime variables. DOSS formulates objective selection as a classification problem over objectives and performs sequential updates with a rolling window to make forward-looking selections without temporal leakage, while also outputting a confidence score for each proposal. To mitigate misselection and excessive switching in deployment, DOSS applies confidence-aware gating with a fail-safe that overrides low-confidence proposals to a conservative default and enforces explicit controls tied to switching frequency. We further integrate governance by positioning a Large Language Model (LLM) as an oversight component rather than a generator of new objectives: the LLM is restricted to accept a proposed objective or override it to a predefined safe default, with deterministic rule-based constraints triggering overrides when needed.
- Abstract(参考訳): 株式レコメンデーションやポートフォリオアロケーションといった金融上の意思決定タスクは通常、将来のリターンとリスクを見積もって、投資家のための取引やアロケーションを選択する。
しかし、市場状況は時間とともに変化するため、一定の目標が政権全体にわたって最適に設定できる一方で、潜伏状態の予測に依存する政権交代パイプラインはノイズや遅延があり、頻繁な切り替えはターンオーバーや運用不安定を増大させる可能性がある。
本稿では,近年のリターンの解釈可能な統計要約から各時点の意思決定関連目的関数を直接選択する学習ベースセレクタであるDOSS(Dynamic Objective Selection with Safeguards)を提案する。
DOSSは目的物に対する分類問題として客観選択を定式化し、ローリングウィンドウで逐次更新を行い、時間的リークのない前方選択を行うとともに、各提案に対して信頼スコアを出力する。
ミスの選択とデプロイの過度な切り替えを軽減するため、DOSSはフェールセーフで信頼性を意識したゲーティングを適用し、低信頼の提案を保守的なデフォルトにオーバーライドし、スイッチング周波数に関連する明示的なコントロールを強制する。
LLMは、提案された目的を受け入れたり、事前に定義されたセーフデフォルトにオーバライドするように制限されており、決定論的ルールベースの制約は、必要に応じてオーバーライドをトリガーする。
関連論文リスト
- OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents [74.20327254615854]
大規模言語モデルエージェントは、シーケンシャルな意思決定タスクを解決するために、推論、行動選択、観察をインターリーブする。
LLMエージェントの既存の推論時間適応法は、主にプロンプトや検索に依存している。
提案するOLIVIAは,ReAct型エージェントのための推論時行動適応フレームワークである。
論文 参考訳(メタデータ) (2026-05-11T19:28:20Z) - Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking [40.44372785257615]
我々は,この手順レベルの目標を明示的なチューニング予算の下で推論する。
選択対応の繰り返しレポートプロトコルであるSIRENを提案する。
制御されたシミュレーションとMMLU-Proチューニング実験は、勝者ベースのレポートが楽観的であることを示している。
論文 参考訳(メタデータ) (2026-05-07T10:18:56Z) - GEM: Guided Expectation-Maximization for Behavior-Normalized Candidate Action Selection in Offline RL [7.213487945222728]
GEM(Guided expectation-Maximization)は,マルチモーダルかつ制御可能なアクション選択を実現する分析フレームワークである。
推測中、GEMは、行動正規化サポートと結びついた保守的なアンサンブルの低信頼を用いて、候補ベースの選択を行う。
実証的には、GEMはD4RLベンチマークで競合し、計算を再トレーニングせずに意思決定品質と交換する単純な推論時予算ノブ(候補数)を提供する。
論文 参考訳(メタデータ) (2026-03-24T14:04:43Z) - Conformal Thinking: Risk Control for Reasoning on a Compute Budget [60.65072883773352]
大規模言語モデル(LLM)の推論により、トークンの予算が増加するにつれて、データセットレベルの精度が向上する。
我々は、予算設定問題をリスクコントロールとして再設定し、計算を最小化しながらエラー率を制限する。
我々のフレームワークは、モデルが自信のあるときに推論を停止する上位しきい値と、未解決のインスタンスを事前に停止させる新しい下位しきい値を導入する。
論文 参考訳(メタデータ) (2026-02-03T18:17:22Z) - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - AdaSwitch: An Adaptive Switching Meta-Algorithm for Learning-Augmented Bounded-Influence Problems [9.387255955861162]
シーケンスベース予測を用いた複数周期オンライン意思決定問題のクラスについて検討する。
各期間において、意思決定者は、実現された要求を観察し、報酬を得る、またはコストを請求する不可解な措置を取らなければならない。
我々は、過去の決定と要求が将来の最適報酬に限定的な影響を与えるような、バウンド・インフルエンス・フレームワークを導入する。
本稿では,AdaSwitchメタアルゴリズムを提案する。これは,予測が正確である場合に,オフラインベンチマークに近い性能を達成するために,予測を利用する。
論文 参考訳(メタデータ) (2025-09-02T13:26:23Z) - ConstrainedZero: Chance-Constrained POMDP Planning using Learned Probabilistic Failure Surrogates and Adaptive Safety Constraints [34.9739641898452]
本研究では、最適値とポリシーのニューラルネットワーク近似を学習することにより、信念空間におけるCC-POMDPを解くConstrainedZeroポリシーアルゴリズムを導入する。
その結果, 目標から安全制約を分離することで, 報酬とコストのバランスを最適化することなく, 目標となる安全レベルを達成できることが示唆された。
論文 参考訳(メタデータ) (2024-05-01T17:17:22Z) - A Unifying Framework for Online Optimization with Long-Term Constraints [62.35194099438855]
我々は,意思決定者が長期的制約の対象となる一連の意思決定をしなければならないオンライン学習問題について検討する。
目標は、全報酬を最大化し、同時に、$T$ラウンド全体で小さな累積違反を達成することである。
本稿では,この一般クラス問題に対して,未知のモデルに基づいて報酬と制約が選択された場合と,各ラウンドで敵が選択した場合の双方において,最良世界型アルゴリズムを提示する。
論文 参考訳(メタデータ) (2022-09-15T16:59:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。