論文の概要: Open-Jev Judgments on CallScreenBench: Calibrated One-Pass Scam Screening with a Small Language Model
- arxiv url: http://arxiv.org/abs/2609.23959v1
- Date: Mon, 21 Sep 2026 00:09:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.031707
- Title: Open-Jev Judgments on CallScreenBench: Calibrated One-Pass Scam Screening with a Small Language Model
- Title(参考訳): CallScreenBenchのオープンJev判断: 小さい言語モデルによるキャリブレーションされたワンパススキャスティング
- Abstract要約: オプションごとに1つのキャリブレーションされた確率は、1つのフォワードパスから生まれ、生成されたテキストは存在しない。
我々は、スカムコールのスクリーニングにおいて、この読み出しのオープン実装であるJevLiteをテストする。
41のホールドアウトされたCallScreenBenchシナリオ(ターン当たり577の判定)では、3列のアンサンブルがAUROC.974に到達し、キャリブレーションエラー.052、登録済みの.02マージンでLLM審査員(MiniMax-M3)に非干渉する。
- 参考スコア(独自算出の注目度): 12.307366979757065
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Screening a phone call for fraud needs a trustworthy probability after every caller turn, in milliseconds. Jev-style typed decisions promise exactly that: declared options go in, one calibrated probability per option comes out of a single forward pass, with no generated text. We test an open implementation of this readout, JevLite, on scam-call screening: Qwen3-4B is LoRA-tuned so that the temperature-scaled softmax over two answer-label logits is P(scam). On 41 held-out CallScreenBench scenarios (577 per-turn decisions) a three-seed ensemble reaches AUROC .974 with calibration error .052, non-inferior to an LLM judge (MiniMax-M3) at a pre-registered .02 margin, with no false alarms on legitimate calls, decisions 1.14 turns earlier under the same hang-up rule, and 64.5 ms per decision on one consumer GPU, 4.9x lower than the same backbone fine-tuned to generate its answer. The gain is in the readout and calibration, not accuracy: a fine-tuned ModernBERT encoder is not significantly worse, the recipe was selected with test-set exposure, and all callers are synthetic. We claim no architectural novelty; the contribution is the application and an evaluation reporting calibration, false alarms and decision timing alongside AUROC.
- Abstract(参考訳): 電話で不正を検知するには、通話が1回に1ミリ秒で終わると、信頼できる確率が必要になります。
宣言されたオプションが入り、単一のフォワードパスからオプションごとに1つのキャリブレーションされた確率が生まれ、生成されたテキストが存在しない。
この読み出しのオープン実装であるJevLiteをスカムコールスクリーニングでテストする: Qwen3-4Bは、温度スケールのソフトマックスがP(scam)となるようにLoRA調整される。
41のホールドアウトされたCallScreenBenchシナリオ(ターン毎の577の判定)では、3列のアンサンブルがAUROC .974に到達し、キャリブレーションエラー .052, LLM 判事 (MiniMax-M3) の非インフェニオーター (MiniMax-M3) が登録済みの.02マージンに到達した。
微調整されたModernBERTエンコーダはそれほど悪くなく、レシピはテストセットの露出で選択され、すべての呼び出し元は合成される。
我々は、アーキテクチャの新規性は主張せず、AUROCと並行して、校正、誤報、意思決定のタイミングを報告するためのアプリケーションと評価である。
関連論文リスト
- Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation [52.58737865652009]
NLPにおけるMultiple-choice Question answering (MCQA)ベンチマークは、数右スコアリング(精度)を用いる。
教育試験において、スコアリング方式は、応答モードモデルが従うこと、および応答のグレーディングルールの組み合わせであり、どの能力に報酬を与えるかを規定する重要な設計選択である。
我々は、MCQAが6つの教育にインスパイアされた6つのスキームで、正確性を超えた能力を評価することで、数字右の代替手段がどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-08-30T16:35:22Z) - MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models [49.47300047353726]
MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
論文 参考訳(メタデータ) (2026-08-26T18:22:03Z) - Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling [8.467936416935986]
Admitorは、校正された外部行動証拠に基づいて構築された入場ゲートである。
これは、明確に校正された偽発見ターゲットを中心に設計された最初のラベルなし入場機構である。
論文 参考訳(メタデータ) (2026-08-16T06:18:54Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Sequential Consensus for Multi-Agent LLM Debates: A Wald-SPRT compute governor with calibration-based failure detection [0.0]
マルチエージェントの議論は事実と推論を改善するが、ほとんどのレシピは固定されたラウンドカウントを選択する。
我々は,LLM討論のプラグイン計算として,Wald's Sequential Probability Ratio Test (SPRT)を適用した。
GSM8Kでは、ルールは1.01ラウンド(4.06 LLMコール)で97.0%の精度で終了するが、15回のコールで固定5の討論では99.0%の精度で終了する。
MMLUでは、キャリブレーションされたKLは約0に崩壊し、ルール上限は2.1倍のコストで99.5%となる。
論文 参考訳(メタデータ) (2026-05-18T23:43:12Z) - To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents [43.812977635599374]
LLMエージェントは、必要のない状況でも、オーバーコール、呼び出しツールに一貫した傾向を示す。
我々はこれを本態性バイアス仮説(IBH)に辿る。
我々の研究は、経験的現象から因果的補正が可能な機械的対象への過度な呼び出しをリキャストする。
論文 参考訳(メタデータ) (2026-05-16T04:18:30Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks [12.396822247035578]
目的抽出とメタ認知のためのベンチマークであるexMTを提案する。
マルチターン書き起こしが与えられた場合、モデルは1文ベース目標と自己報告された自信を出力しなければならない。
正確性は金の目標と類似性によって評価され、300の校正項目で1度閾値付けされる。
論文 参考訳(メタデータ) (2025-08-23T03:32:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。