論文の概要: Labels Override Definitions in Jev-Style Typed Decision Models
- arxiv url: http://arxiv.org/abs/2610.02586v1
- Date: Thu, 01 Oct 2026 23:32:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.12395
- Title: Labels Override Definitions in Jev-Style Typed Decision Models
- Title(参考訳): Jev-Style型決定モデルにおけるラベルのオーバーライド
- Abstract要約: 型付き決定モデルは、複数の呼び出し者定義オプションのそれぞれに対して確率を返すことで、固定された質問に答える。
オープン実装について検討し、その重みを検査・パッチし、その確率が定義やラベルに従うかどうかを問う。
- 参考スコア(独自算出の注目度): 8.534825157831387
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A typed decision model answers a fixed question about an input by returning a probability for each of several caller-defined options. Each option carries a short label and a written definition, which is where a developer states the rule the model should apply. Jev introduced this interface for routing, moderation and triage, open implementations followed, and the same operation occurs whenever a language model is used as a classifier by scoring label strings. We study the open implementations, whose weights we can inspect and patch, and ask whether the probability follows the definitions or the labels. A preference for the label we call option-label bias. Across four open-weight typed decision models, three ways of reading an answer from a Qwen2.5 backbone, eleven classification tasks and PolicyBench, a synthetic routing suite we introduce in which the rule appears only in the definitions, the answer is mostly the labels. Deleting every definition leaves accuracy unchanged (laya-td: 0.8559 against 0.8487), although those definitions support 0.7971 on their own, and renaming the options to A and B raises accuracy by +0.1511 [+0.1377, +0.1646]. One system, von, is unaffected, and the two code bases differ in one expression: laya writes each option as "{label}: {definition}", while von writes only the definition. Changing that expression in both directions, with no weight changed, makes all three laya checkpoints exactly invariant (+0.0000 [+0.0000, +0.0000]) and creates the effect in von, whose accuracy falls from 0.8511 to 0.2281 when a label contradicts its definition. Earlier work attributed this failure to the constrained decision head these models use in place of a text decoder; our results locate it in the prompt rendering. We give a two-call test that tells a practitioner which case applies to their model, and measure what four mitigations are worth.
- Abstract(参考訳): 型付き決定モデルは、複数の呼び出し元定義オプションのそれぞれに対して確率を返すことによって、入力に関する固定された疑問に答える。
それぞれのオプションには短いラベルと記述された定義があり、そこでは開発者がモデルを適用するべきルールを記述します。
Jevはこのルーティング、モデレーション、トリアージのためのインターフェースを導入し、それに続くオープン実装を行い、ラベル文字列のスコア付けによって言語モデルが分類子として使用されると、同じ操作が実行される。
オープン実装について検討し、その重みを検査・パッチし、その確率が定義やラベルに従うかどうかを問う。
オプションラベルバイアス(Option-label bias)と呼ぶラベルの好み。
4つのオープンウェイトな型付き決定モデル、Qwen2.5のバックボーンからの回答を読む3つの方法、11の分類タスク、およびルールが定義にのみ現れる合成ルーティングスイートであるPhysianBenchの3つは、主にラベルである。
すべての定義を削除しても精度は変わらない(laa-td: 0.8559 対 0.8487)が、これらの定義は独自の 0.7971 をサポートし、オプションを A と B に変更すると、+0.1511 [+0.1377, +0.1646] の精度が向上する。
1つのシステム、vonは影響を受けず、2つのコードベースは1つの式で異なる: laya はそれぞれのオプションを "{label}: {definition}" と書き、von は定義のみを書き込む。
両方向の式を重みを変えずに変化させることで、すべての3つのレイアチェックポイント(+0.0000 [+0.0000, +0.0000])を正確に不変にし、ラベルが定義に矛盾する場合に精度が 0.8511 から 0.2281 に低下するvon で効果を生成する。
以前の作業では、この失敗は、これらのモデルがテキストデコーダの代わりに使用する制約付き決定ヘッドによるものと考えられていました。
モデルのどのケースに適用するかを実践者に教える2コールテストを実施し、その4つの軽減策の価値を測る。
関連論文リスト
- AnyJev Technical Report [30.983024823617853]
型付き決定は、テキストではなく確率として返される固定されたオプションのセットの選択である。
このレポートでは、事前訓練された命令チューニング言語モデルの1つのプリフィルから型付き決定を読み取るAnyJevについて説明する。
論文 参考訳(メタデータ) (2026-09-30T23:43:04Z) - JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated Decisions Models [25.5874772119945]
JevAdvBench は RLCD モデルの最初の敵対的ベンチマークである。
ラベルではなく、モデル自身のクリーンな決定に対して攻撃された各決定をスコア付けし、同じ再実行による変更に対して読み取る。
Jev-1.13.0では、リワードは再実行ベースラインの1.2パーセント以内に留まり、スキーマ外のフィールドはモデルに到達しない。
論文 参考訳(メタデータ) (2026-09-25T11:32:19Z) - Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It [10.956670143484502]
Jev と 2 つの Jev 様モデルを開重み付きで研究し、選択名がどのようにルーブリックに割り当てられるかを変更する。
各ルーブリックに割り当てられるオプション名のみを変更します。質問、状態、ルーブリック、オプション名のセットは、まったく同じです。
タスク固有のルーリックによる1200のワークフロー決定では、0/1からno/yesへの2つのオプションの改名により、100 95%のCIに対して70.4以上の回答が得られた: [67.6, 73.1] と AUC を.94 から.23 にシフトし、単純な不確実性ではなく、決定ランクの体系的な逆転を明らかにした。
論文 参考訳(メタデータ) (2026-09-22T17:38:12Z) - Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation [0.21483624911986507]
多くの自動ラベリングパイプラインは、入力を記述された仕様で定義されたカテゴリに分類する。
1つの解決策は、ラベラーが記述された解釈に異を唱えることができないような、十分な実際の境界条件を解決した規範的な定義を書くことである。
実際には、その詳細レベルでの定義は人間のアノテータがワーキングメモリで保持できるものを超えているので、ラベルは記述されたルールから逸脱する。
我々は、エッジケースをカバーするのに十分な詳細でラベルを定義するカテゴリごとのコンフィグレーションの記述を支援するAI駆動ワークフローの有効性を提案し、実証する。
論文 参考訳(メタデータ) (2026-05-22T21:52:12Z) - Appeal: Allow Mislabeled Samples the Chance to be Rectified in Partial Label Learning [55.4510979153023]
部分ラベル学習(PLL)では、各インスタンスは候補ラベルのセットに関連付けられ、そのうち1つだけが接地真実である。
誤記されたサンプルの「アペアル」を支援するため,最初の魅力に基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-18T09:09:52Z) - Label-Retrieval-Augmented Diffusion Models for Learning from Noisy
Labels [61.97359362447732]
ノイズの多いラベルからの学習は、実際のアプリケーションのための機械学習において、重要かつ長年にわたる問題である。
本稿では,生成モデルの観点からラベルノイズ問題を再構成する。
我々のモデルは、標準的な実世界のベンチマークデータセットで新しいSOTA(State-of-the-art)結果を達成する。
論文 参考訳(メタデータ) (2023-05-31T03:01:36Z) - Instance-Dependent Partial Label Learning [69.49681837908511]
部分ラベル学習は、典型的には弱教師付き学習問題である。
既存のほとんどのアプローチでは、トレーニングサンプルの間違ったラベルがランダムに候補ラベルとして選択されていると仮定している。
本稿では,各例が実数で構成された潜在ラベル分布と関連していると仮定する。
論文 参考訳(メタデータ) (2021-10-25T12:50:26Z) - A Study on the Autoregressive and non-Autoregressive Multi-label
Learning [77.11075863067131]
本稿では,ラベルとラベルの依存関係を共同で抽出する自己アテンションに基づく変分エンコーダモデルを提案する。
したがって、ラベルラベルとラベル機能の両方の依存関係を保ちながら、すべてのラベルを並列に予測することができる。
論文 参考訳(メタデータ) (2020-12-03T05:41:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。