論文の概要: Benchmarking System One decision models against trained classifiers and language models for automated decision gates
- arxiv url: http://arxiv.org/abs/2610.00346v2
- Date: Tue, 06 Oct 2026 22:03:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.323557
- Title: Benchmarking System One decision models against trained classifiers and language models for automated decision gates
- Title(参考訳): ベンチマークシステム 自動決定ゲートのための訓練された分類器と言語モデルに対する決定モデル
- Abstract要約: 1つのハーネスは6つのファミリーから8つの決定モデルチェックポイントを送信する。
タスクラベルでは、細調整されたDeBERTa-v3-largeが最も精度が高い。
その結果、自動決定ゲートの条件依存ルールが得られる。
- 参考スコア(独自算出の注目度): 1.089614199781423
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Software that hands branching decisions to a model needs a declared option and a probability it can threshold. Typed decision models, also called System One models, return such probabilities without generating text, while supervised classifiers and generative language models are the established alternatives. One harness sends eight decision-model checkpoints from six families, including the hosted model Jev, and four open generative models from three developers the same semantic requests, and scores trained and zero-shot classifiers on the same workflow, intent, emotion and social-science items. With task labels, a fine-tuned DeBERTa-v3-large has the highest observed accuracy on every labeled benchmark but one. Without labels, no decision model is significantly more accurate than Jev on workflows or intents, but Gemma-4-31B matches it on workflows and exceeds it on CLINC-150 at higher cost and latency. Stated probabilities of generative models become unreadable when replies miss the key format, whereas key likelihoods avoid this but can saturate. A guaranteed 5 percent risk leaves Jev 0.528 of the intent decisions, and an in-scope threshold still accepts 0.310 of out-of-scope requests. On typed-decisions, swapping yes and no flips 50.5 answers per hundred for Jev and at least 16.8 for every generative model tested, against at most 6.5 for four fine-tuned decision checkpoints. Exposure to a benchmark's training data explains the largest lead of an open checkpoint, which vanishes on rater-labeled emotions. An intent-trained first stage escalating to Gemma-4-31B reaches that model's accuracy at about Jev's price. The results yield condition-dependent design rules for automated decision gates.
- Abstract(参考訳): 分岐決定をモデルに渡すソフトウェアには、宣言されたオプションとしきい値の確率が必要です。
System Oneモデルとも呼ばれる型付き決定モデルは、テキストを生成することなくそのような確率を返すが、教師付き分類器と生成言語モデルは確立された代替手段である。
1つのハーネスは、ホストされたモデルJevを含む6つのファミリーから8つの意思決定モデルチェックポイント、同じセマンティックリクエストを3人の開発者から4つのオープン生成モデル、同じワークフロー、意図、感情、社会科学の項目でトレーニングされたスコアとゼロショットの分類器を送信する。
タスクラベルでは、細調整されたDeBERTa-v3-largeは、ラベル付きベンチマークでもっとも高い精度で評価されている。
ラベルなしでは、ワークフローやインテントでJevよりもはるかに正確な決定モデルはないが、Gemma-4-31Bはワークフローでそれと一致し、CLINC-150でより高いコストとレイテンシでそれを上回る。
生成モデルの有意な確率は、応答が鍵形式を見逃すと読めなくなるが、鍵となる確率はそれを避けるが飽和する可能性がある。
5%のリスクが保証され、Jev 0.528の意図決定が残され、スコープ内しきい値はまだスコープ外要求の0.310を受け入れている。
型付き決定では、Yes と no flip の切り替えは、Jev が 100 に対して 50.5 の回答を、テストされたすべての生成モデルに対して 16.8 の回答を、少なくとも 4 つの微調整された決定チェックポイントに対して 6.5 の値で置き換える。
ベンチマークのトレーニングデータへの露出は、レーダラベルの感情が消えるオープンチェックポイントの最大のリードを説明する。
Gemma-4-31Bにエスカレートされた意図的に訓練された第1段は、Jevの約価格でそのモデルの精度に達する。
その結果、自動決定ゲートの条件依存設計ルールが得られた。
関連論文リスト
- LLM2Jev: LLMs Are Already Jev-Style Decision Models -- When and How to Fine-Tune Them [1.818512316929965]
Jevスタイルの決定モデルは、自由形式のテキストを生成することなく、事前定義されたオプションよりもカテゴリー的な確率分布を返す。
LLM2Jevは、括弧付き数値識別子の次点確率から直接キャリブレーションされた決定を抽出するアーキテクチャ保存フレームワークである。
論文 参考訳(メタデータ) (2026-10-01T17:15:24Z) - JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated Decisions Models [25.5874772119945]
JevAdvBench は RLCD モデルの最初の敵対的ベンチマークである。
ラベルではなく、モデル自身のクリーンな決定に対して攻撃された各決定をスコア付けし、同じ再実行による変更に対して読み取る。
Jev-1.13.0では、リワードは再実行ベースラインの1.2パーセント以内に留まり、スキーマ外のフィールドはモデルに到達しない。
論文 参考訳(メタデータ) (2026-09-25T11:32:19Z) - Style, Not Self: Surface Cues Explain Zero-Shot Code Attribution by Large Language Models [4.36766480644779]
5つのLCMはMBPP、HumanEval、DS-1000のソリューションを生成し、さらに7つのMBPP、モデルが4つのタスクで評価器として機能する。
単一解法タスクでは、バランスの取れた精度は15のモデルとベンチマークの組み合わせで49-58%である。
名前付きモデルへの帰属はいくつかのペアで成功し、常に他のペアで逆転する。
論文 参考訳(メタデータ) (2026-09-24T16:11:21Z) - MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents [50.27505102982638]
本稿では,ツールコールエージェントのベンチマークおよび評価フレームワークであるMM-ToolSandBoxを紹介する。
このフレームワークは16のアプリケーションドメインで500以上のツールにまたがるステートフルな実行環境を提供する。
マルチイメージのマルチターンタスクをサポートしており、エージェントは実行可能ツールコールに徐々に視覚的な入力を入力しなければならない。
論文 参考訳(メタデータ) (2026-07-13T17:13:09Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Establishing Task Scaling Laws via Compute-Efficient Model Ladders [136.76316239300363]
我々は,事前訓練された言語モデル(LM)のタスク性能を予測するために,タスクスケーリング法則とモデルはしごを開発する。
2つの予測ステップのパラメータ化関数に適合するデータポイントを収集し、2つの対象モデルの予測を行う。
ランク付けされた4つの多重選択タスクにおいて、絶対誤差の2ポイント以内で、両方のターゲットモデルの精度を予測することができる。
論文 参考訳(メタデータ) (2024-12-05T18:21:49Z) - Confidence-Based Model Selection: When to Take Shortcuts for
Subpopulation Shifts [119.22672589020394]
モデル信頼度がモデル選択を効果的に導くことができるConfidence-based Model Selection (CosMoS)を提案する。
我々はCosMoSを,データ分散シフトのレベルが異なる複数のテストセットを持つ4つのデータセットで評価した。
論文 参考訳(メタデータ) (2023-06-19T18:48:15Z) - Adaptive Threshold for Better Performance of the Recognition and
Re-identification Models [0.0]
LFWデータセットと自己準備型アスリートデータセット上で,オンライン最適化に基づく統計的特徴学習適応技術を開発した。
適応しきい値を採用するこの方法は、通常任意の分類および識別タスクでヒットアンドトライ法を介して取られる固定しきい値0.3,0.5,0.7と比較してモデル精度が12〜45%向上した。
論文 参考訳(メタデータ) (2020-12-28T15:40:53Z) - The Right Tool for the Job: Matching Model and Instance Complexities [62.95183777679024]
NLPモデルが大きくなればなるほど、訓練されたモデルを実行するには、金銭的・環境的なコストを発生させる重要な計算資源が必要である。
我々は、推論中、早期(かつ高速)の"exit"を可能にする文脈表現微調整の修正を提案する。
3つのテキスト分類データセットと2つの自然言語推論ベンチマークの2つのタスクで、5つの異なるデータセットに対して提案した修正を検証した。
論文 参考訳(メタデータ) (2020-04-16T04:28:08Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z) - Auditing and Debugging Deep Learning Models via Decision Boundaries:
Individual-level and Group-level Analysis [0.0]
深層学習モデルの説明、監査、デバッグにはフリップポイントを使用します。
フリップポイントは、2つの出力クラスの境界にある任意の点である。
機械学習のソーシャルな応用に使用される標準データセットに基づいて訓練されたモデルをいくつか調べて,本手法を実証する。
論文 参考訳(メタデータ) (2020-01-03T01:45:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。