論文の概要: Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling
- arxiv url: http://arxiv.org/abs/2608.15565v1
- Date: Sun, 16 Aug 2026 06:18:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.340322
- Title: Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling
- Title(参考訳): LLMに基づく最適化モデリングのためのラベルなし認定と経験学習
- Abstract要約: Admitorは、校正された外部行動証拠に基づいて構築された入場ゲートである。
これは、明確に校正された偽発見ターゲットを中心に設計された最初のラベルなし入場機構である。
- 参考スコア(独自算出の注目度): 8.467936416935986
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Experience-learning agents for optimization modeling improve by storing verified skills, but existing learners admit knowledge by checking against known answers, which real ticket streams do not provide. The natural label-free alternatives are unreliable: on a 300-problem label-blind stream, admitting every executable model poisons roughly one admission in four, while single-instance agreement accepts models that match at one value but differ elsewhere. We propose AdmitOR, an admission gate built on calibrated external behavioral evidence. Candidates from three model families, prompting strategies, and solver stacks are run on instances resampled from an extracted parameter domain; agreement across the resulting value-function traces is summarized by a cross-family clique, and a calibrated threshold returns accept, abstain, or escalate. The preregistered false-discovery criterion holds on calibration data but not on the wild stream. We report this negative result in full and trace most failures to benchmark texts that do not faithfully encode their labeled instances. Comparing four admission judges on one collection of logs inside a state-of-the-art skill learner, AdmitOR raises admission precision to 0.927, against 0.871 for majority vote and 0.726 for execution success, yielding 3.1x and 8.0x fewer poisoned admissions. Its library is the smallest and attains the highest macro accuracy across five public benchmarks, 58.4 against 54.8 for majority vote and 53.9 for the ground-truth-labeled library. The 3.5-point gain over majority vote is supported by a paired bootstrap and survives correction for a host-side anomaly. To our knowledge, AdmitOR is the first label-free admission mechanism designed around an explicitly calibrated false-discovery target. The transfer failure identifies a necessary condition for extending it to wild streams.
- Abstract(参考訳): 評価されたスキルを記憶することで、最適化モデリングのための経験学習エージェントが向上するが、既存の学習者は、実際のチケットストリームが提供していない既知の回答をチェックすることで知識を認める。
天然のラベルフリーの代替品は信頼できない: 300プロブレムのラベルブラインドストリームでは、全ての実行可能なモデル毒が4分の1の入場を認め、一方、単一インスタンス契約は、1つの値で一致するが他の異なるモデルを受け入れている。
本稿では,外的行動証拠を校正した入場口であるAdmitorを提案する。
抽出されたパラメータ領域から再サンプリングされたインスタンス上で、3つのモデルファミリーからの候補、プロンプト戦略およびソルバスタックを実行し、結果の値関数トレース間の合意をクロスファミリーのcliqueで要約し、キャリブレーションされたしきい値が受け入れ、吸収、エスカレートする。
事前登録された偽発見基準は、キャリブレーションデータに当てはまるが、野生の小川には当てはまらない。
この否定的な結果は、ラベル付きインスタンスを忠実にエンコードしないテキストをベンチマークするのに、ほとんど失敗をフルかつトレースします。
最先端のスキル学習者の1つのログの4人の審査員を比較し、Admitorは合格精度を0.927に引き上げ、多数決は0.871に、実行は0.726に引き上げ、毒殺は3.1xと8.0xに減った。
図書館は最も小さく、5つの公開ベンチマークで58.4対54.8対53.9のマクロ精度を達成している。
多数決よりも3.5ポイントの利得は、ペアのブートストラップによって支持され、ホスト側の異常に対する修正を継続する。
我々の知る限り、Admitorは、明確に校正された偽発見ターゲットを中心に設計された最初のラベルなし入場機構である。
転送障害は、それを野生のストリームに拡張するために必要な条件を特定する。
関連論文リスト
- Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR [0.0]
報酬付き強化学習(RLVR)と標準ベンチマーク評価はどちらも、無料テキスト回答をバイナリ報酬に変換する自動検証に頼っている。
以前の調査では、1つの評価ハーネスは、自身の真実の答えの94%しか受け入れず、解析を非難している。
モデルではなく検証器にメタモルフィックテストを適用し、検証された等価解の変種を生成する。
我々は、307,420以上の4つの広く使用されている検証結果に対して、回答カテゴリごとの拒絶を計測する。
論文 参考訳(メタデータ) (2026-09-01T14:57:59Z) - The C-index illusion: discrimination without calibration in published survival models [0.0]
我々は3つの構造的に異なる領域にまたがって3つのサバイバル-MLモデルを再現する。
ホルム補正された家族的誤り率の下で,5つの事前登録仮説を検証した。
論文 参考訳(メタデータ) (2026-07-21T19:13:54Z) - Falsification-Based Verification of LLM-Generated Optimization Models: Sound Test Batteries and Their Detection Limits [1.7545090618311434]
大規模言語モデルは、決定問題の自然言語記述をソルバ対応最適化モデルに変換するが、それらは静かに失敗する。
本稿では,この設定に対するファルシフィケーションに基づく検証理論を考案する。
記述中の全ての数値は型付きスロットであり、候補モデルはスロット変換されたインスタンスのソルバ呼び出しによってのみテストされる。
論文 参考訳(メタデータ) (2026-07-18T05:32:37Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference [0.0]
VERDI(verification-Decomposed Inference Inference)は、構造化された裁判官から信頼を抽出する手法である。
VERDIは各評価をサブチェックに分解し、3つの構造信号を導出する。
3つの公開ベンチマークで、VERDIはGPT-4.1-miniでAUROC 0.72-0.91、GPT-5.4-miniで0.66-0.80を達成した。
論文 参考訳(メタデータ) (2026-05-11T23:39:19Z) - Response Time Enhances Alignment with Heterogeneous Preferences [49.69696266152175]
簡易な二次信号で選好データセットを増大させることで、住民の平均選好の識別性を回復できることを示す。
私たちの結果は、将来的なデータ収集パイプラインに約束と新たな機会をもたらします。
論文 参考訳(メタデータ) (2026-05-07T22:05:23Z) - The Verification Tax: Fundamental Limits of AI Auditing in the Rare-Error Regime [0.0]
最も引用されているキャリブレーションの結果は、CIFAR-100上での温度スケーリング後のECEの0.012は、統計的ノイズフロアより下である。
モデル誤差率のエプシロンによるキャリブレーション誤差を推定するミニマックスレートは Theta((Lepsilon/m)2/3) であり、推定器が打ち負かせない。
論文 参考訳(メタデータ) (2026-04-14T16:48:24Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models [55.94503936470247]
大規模なAI評価は、審査員を含む、$K$アノテータからのバイナリ判断を集約することにますます依存している。
ほとんどの古典的なメソッドは、アノテータが条件的に独立であると仮定するが、真のラベルは$Yin0,1$であり、この仮定は LLM の審査員によってしばしば違反される。
我々はIsingグラフィカルモデルと潜在因子に基づく依存認識モデルの階層構造を通してラベルアグリゲーションを研究する。
論文 参考訳(メタデータ) (2026-01-29T21:26:50Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - How to trust unlabeled data? Instance Credibility Inference for Few-Shot
Learning [47.21354101796544]
本稿では,未ラベルのインスタンスを数発の視覚認識に利用するために,ICI (Instance Credibility Inference) と呼ばれる統計的アプローチを提案する。
擬似ラベル付きインスタンスの信頼性は, それらの付随パラメータの正規化経路に沿ってランク付けし, 最も信頼性の高い擬似ラベル付きインスタンスを拡張ラベル付きインスタンスとして保存する。
論文 参考訳(メタデータ) (2020-07-15T03:38:09Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。