論文の概要: YUKTI: From Natural-Language Situations to Robust, Verifiable Decisions An Uncertainty-Typed Proposition IR, Assumption-Robust Pareto Frontiers, and a Regret Certificate
- arxiv url: http://arxiv.org/abs/2607.09706v1
- Date: Mon, 22 Jun 2026 09:29:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.379505
- Title: YUKTI: From Natural-Language Situations to Robust, Verifiable Decisions An Uncertainty-Typed Proposition IR, Assumption-Robust Pareto Frontiers, and a Regret Certificate
- Title(参考訳): YUKTI:自然条件からロバスト, 不確実性型命題IR, 推定ロバストパレートフロンティア, およびレギュレット証明書
- Abstract要約: 我々は,YUKTIが各ステージを正確に,非線形,あるいは進化的解法にルートすることを示す。
我々は,決定的後悔の正確な要因として境界作成rhoを証明し,監査可能なトレーサビリティを付加し,ベンチマークに忠実なデータ基盤を合成する。
規制上の不特定の下では、堅牢な妥協が平均とテールの後悔を90%以上削減し、単純なポイントプランと比較し、規制された商業上の決定では、合法的な行動空間内で最適化し、ユーロの下落価格を下げる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models turn a worded situation into a numeric plan, and the dominant pipelines (NL4Opt, OptiMUS, ORLM, OR-LLM-Agent) commit to a single objective and point-valued coefficients, then solve once. For decisions that allocate real budget, effort, or clinical attention, that confidence is the failure mode: every objectified number is an assumption, and a plan optimal only if the guesses are exactly right is fragile -- mimicry of computation. YUKTI changes the target of autoformulation. Its representation is a typed-proposition graph whose relationships carry shape priors, coefficient uncertainty, and provenance. YUKTI routes each stage to an exact, nonlinear, or evolutionary solver; couples stages by a distributional Pareto hand-off; and introduces Assumption-Robust Pareto Frontiers (ARPF), resampling assumptions (including structural epsilon-contamination) to score how often each action survives (rho). We prove a bound making rho an exact factor of decision regret, add auditable traceability, and synthesize a benchmark-faithful data foundation when none exists (SRJANA). We validate three ways: under controlled misspecification the robust compromise cuts mean and tail regret by over 90% versus a naive point plan; on a regulated commercial decision we optimize inside a lawful action space and price the downside in euros; and on a real public dataset of 41,188 decisions an out-of-sample backtest beats the logged status quo by 34% and a naive point rule by 4% while reducing the optimizer's curse. The solvers are standard; we claim no benchmark-SOTA win. A head-to-head shows an LLM given the correct numbers, and single-objective optimization, both incur about 47x the held-out regret of YUKTI -- an LLM is a formulator, not a solver. Under long-range causal coupling, the forward hand-off becomes unsound, locating where it must become a backward-induction causal policy.
- Abstract(参考訳): 言語モデルは単語化された状況を数値プランに変換し、支配的なパイプライン(NL4Opt, OptiMUS, ORLM, OR-LLM-Agent)は1つの目的と点値係数にコミットし、一度解決する。
実際の予算、努力、あるいは臨床的注意を割り当てる決定に対しては、信頼は失敗モードである、という。
YUKTIはオートフォーメーションのターゲットを変更する。
その表現は型付きプロポジショングラフであり、その関係は形状の先行、係数の不確実性、証明性を持っている。
YUKTIは各ステージを正確に、非線形、または進化的解決器にルートし、分配されたパレート・ハンドオフによってカップルがステージを移動し、仮定(構造的エプシロン汚染を含む)を再サンプリングし、各アクションの生存頻度(rho)を評価する。
我々は,決定的後悔の正確な要因として境界作成rhoを証明し,監査可能なトレーサビリティを付加し,存在しない場合のベンチマーク忠実なデータ基盤を合成する(SRJANA)。
規制された商業上の決定では、合法的な行動空間内で最適化され、ユーロのマイナス額の価格が設定されている。41,188の実際の公開データセットでは、アウト・オブ・サンプルのバックテストがログされた状態のクォートを34%上回っており、単純なポイントルールは4%上回っており、オプティマイザの呪いを減らしている。
私たちはベンチマーク-SOTAの勝利は主張しません。
ヘッド・ツー・ヘッド(head-to-head)は、正しい数値を与えられた LLM を示し、単目的最適化(どちらも YUKTI の持つ後悔の約47倍)は、LLM は数式演算子であり、解法ではない。
長距離因果結合の下では、前方のハンドオフは不適切なものとなり、後進誘導因果関係となる必要がある場所を特定する。
関連論文リスト
- PRIMUS: Identity, Governance, and Verification for Multi-Agent Federations [0.0]
マルチエージェント・フェデレーションは、敵対的な条件下での3つの質問に答えるガバナンスを必要とする。
本稿では,BLSアグリゲートシグネチャと主パワーIDを結合したPRIMUSについて述べる。
PRIMAのバイナリアーティファクト-忠実性判定は、グレード付きフィットネス信号に変換できるかどうかを問う。
論文 参考訳(メタデータ) (2026-09-07T19:21:49Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Decision Kernels for Quantum Error Mitigation: Why Accuracy Gains Need Not Improve Downstream Decisions [0.0]
下流決定のための有限ショットQEMの理論を開発する。
我々は、商因子化、ギャップロー極小性、限界ノーゴー定理、QEMプルバック定理、固定配置ショットレベル逆を証明する。
論文 参考訳(メタデータ) (2026-07-03T02:35:57Z) - DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models [6.628401122676601]
ルールベースの論理解法は、ベンチマークの全インスタンスを50マイクロ秒未満で100%精度で解決する。
データセットと生成パイプラインであるDeFAb(Defeasible Abduction Benchmark)を紹介します。
論文 参考訳(メタデータ) (2026-06-17T00:13:40Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - Hidden Measurement Error in LLM Pipelines Distorts Annotation, Evaluation, and Benchmarking [0.20305676256390937]
本論文は,不確実性を情報源に分解し,より多くのデータで縮小する分散を識別し,総誤差を低減するためにデザインスタディ・プロジェクションを用いる。
イデオロギーアノテーション、安全性分類、MMLUベンチマーク、および人間公認プロパガンダ監査へのアプローチの適用により、ドメインとスコアリング方法によって異なる支配的な分散源が明らかになる。
論文 参考訳(メタデータ) (2026-04-13T14:58:15Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Local Discovery by Partitioning: Polynomial-Time Causal Discovery Around Exposure-Outcome Pairs [18.31538168213386]
本稿では,因果推論タスクの分割(LDP)による局所的な発見を提案する。
LDPは制約ベースのプロシージャで、潜伏したコンバウンディングの下で露光出力ペアのVASを返す。
LDPの調整セットは、ベースライン発見アルゴリズムよりもバイアスが少なく、より正確な平均処理効果の推定値が得られる。
論文 参考訳(メタデータ) (2023-10-25T14:53:10Z) - On the Practicality of Differential Privacy in Federated Learning by
Tuning Iteration Times [51.61278695776151]
フェデレートラーニング(FL)は、分散クライアント間で機械学習モデルを協調的にトレーニングする際のプライバシ保護でよく知られている。
最近の研究では、naive flは勾配リーク攻撃の影響を受けやすいことが指摘されている。
ディファレンシャルプライバシ(dp)は、勾配漏洩攻撃を防御するための有望な対策として現れる。
論文 参考訳(メタデータ) (2021-01-11T19:43:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。