論文の概要: ufakzeka-karar: An Open Turkish Typed-Decision Model with Order-Invariant Option Scoring
- arxiv url: http://arxiv.org/abs/2610.06744v1
- Date: Mon, 05 Oct 2026 17:22:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 23:10:10.594604
- Title: ufakzeka-karar: An Open Turkish Typed-Decision Model with Order-Invariant Option Scoring
- Title(参考訳): ufakzeka-karar: 順序不変オプションスコア付きオープントルコ型決定モデル
- Abstract要約: ufakzeka-kararは182,494,466のパラメータを持つトルコのオープンな決定モデルである。
任意のオプションに対する温度スケールの確率と期待されるエラーを返します。
REINFORCEはマクロF1の10.2ポイント (0.102) をクロスエントロピーに損失した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: ufakzeka-karar is an open Turkish decision model with 182,494,466 parameters. Given a Turkish text and questions of a fixed answer type (a choice, a level on an ordered scale, or yes or no), it returns a temperature-scaled probability for every option and an expected error that serves as a "not sure" signal, without generating text and in one CPU forward pass for up to ten options. Built on the lab's ufakzeka-1-base, its head scores each option blind to the others at shared positions, so the answer does not depend on option order. A sequential head trained with shuffled options was about as accurate but changed 2.3 to 2.8 percent of its answers when only the option order changed; REINFORCE lost 10.2 points (0.102) of macro F1 to cross-entropy. On the open set of HakemBench v1.0 (4,275 questions, 7 tracks) the released model ranks 7th of 16 rows with a composite of 0.660 (95% interval 0.642 to 0.677). Temperature scaling lowers calibration error (smooth ECE) on the development set but raises it on held-out support questions, from 0.027 to 0.045 for the first scored run, which never trained on them; the released model later trained on them, so its 0.036 to 0.064 is not an unseen-question test. The released model is the last of three runs scored on HakemBench, and its numbers are not blind. The second run's new training data was aimed at the first run's errors on the full test set in guardrails, moderation and customer support, and the released run was trained after the second run's guardrail results on the full test set were read, under a protocol fixed in writing before any of its data, code or runs. All its numbers come after these readings; its guardrail, moderation and customer support numbers carry the flag "shaped by reading the test results". With every model scored on the other four tracks only, its composite is 0.678, 6th of 16. Weights and code are under Apache-2.0.
- Abstract(参考訳): ufakzeka-kararは182,494,466のパラメータを持つトルコのオープンな決定モデルである。
トルコ語のテキストと固定された応答タイプ(選択、順序付きスケールのレベル、またはイエスまたはノー)の質問が与えられた場合、すべてのオプションに対する温度スケールの確率と、テキストを生成せず、最大10のオプションでCPUフォワードをパスする"不確実"信号として機能する期待されるエラーを返します。
実験室の uakzeka-1-base 上に構築された頭は、それぞれの選択肢を共有位置で他の選択肢に盲目で得点するので、答えはオプション順に依存しない。
シャッフルオプションで訓練されたシーケンシャルヘッドは、オプション順序だけを変えると2.3から2.8%に変化し、REINFORCEはマクロF1の10.2ポイント (0.102) をクロスエントロピーに損失した。
HakemBench v1.0(4,275の質問、7のトラック)のオープンセットでは、リリースされたモデルは16行の7位にランクされ、コンポジットは0.660(95%インターバル0.642から0.677)である。
温度スケーリングは開発セットのキャリブレーション誤差(スムースECE)を下げるが、最初の試験では0.027から0.045に上昇する。
リリースされたモデルは、HakemBenchで獲得した3勝のうち最後のものであり、その数字は盲目ではない。
第2ランの新たなトレーニングデータは、ガードレール、モデレーション、カスタマーサポートの完全なテストセットに対する第1ランのエラーを目標とし、第2ランの完全なテストセットに対するガードレールの結果が読み取られ、データ、コード、実行の前に書き込みで固定されたプロトコルの下でトレーニングされた。
ガードレール、モデレーション、カスタマーサポート番号は「テスト結果を読んで」旗を掲げている。
他の4トラックのみのモデルで、合成数は0.678で16の6番目である。
ウェイトとコードはApache-2.0の下にある。
関連論文リスト
- HakemBench: A Turkish Benchmark of Typed Decisions [0.0]
HakemBenchは、テスト対象のモデルがテキスト、質問、固定されたオプションセットを読み取って、すべてのオプションの確率を返す型決定のベンチマークである。
バージョン1.0はCC BY 4.0で完全に公開されており、2,346の項目と4,275の選択肢、ye/no、スコアの7つのトラックがある。
論文 参考訳(メタデータ) (2026-10-01T16:55:18Z) - AnyJev Technical Report [30.983024823617853]
型付き決定は、テキストではなく確率として返される固定されたオプションのセットの選択である。
このレポートでは、事前訓練された命令チューニング言語モデルの1つのプリフィルから型付き決定を読み取るAnyJevについて説明する。
論文 参考訳(メタデータ) (2026-09-30T23:43:04Z) - Evaluating and Benchmarking the System One Model Jev [1.579162290333307]
Jevは、テキストを生成しないTypeSafe AIのSystem Oneモデルである。
固定オプション、ルーブリック上の位置、あるいは文が真である確率から選択を返す。
分類,ルーティング,自然言語推論,読解,コモンセンス推論,モデレーション,法的条項解析,ルーリックスコアリングにまたがる37のデータセットに対して,Jevゼロショットを評価した。
論文 参考訳(メタデータ) (2026-09-29T14:15:04Z) - Scoring the Wrong Question: Readout Failures in Constrained-Option Evaluation [8.13968851214856]
本稿では,複数の選択項目を引用したプロンプトについて検討し,各項目の回答指示に終止符を打つ。
我々は、短いメモのみを与えられた読者モデルが正しく答えるかどうかの予測を求める。
3つのQwen3チェックポイントでは、回答レターが最も可能なトークンである。
論文 参考訳(メタデータ) (2026-09-27T03:58:18Z) - JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated Decisions Models [25.5874772119945]
JevAdvBench は RLCD モデルの最初の敵対的ベンチマークである。
ラベルではなく、モデル自身のクリーンな決定に対して攻撃された各決定をスコア付けし、同じ再実行による変更に対して読み取る。
Jev-1.13.0では、リワードは再実行ベースラインの1.2パーセント以内に留まり、スキーマ外のフィールドはモデルに到達しない。
論文 参考訳(メタデータ) (2026-09-25T11:32:19Z) - Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles [86.41218924166775]
LLM生成のGPUカーネルのベンチマークは、ランダムな入力とゆるやかな浮動小数点耐性で正確性を決定する。
最近の研究は、これらのチェッカーは弱く、手動でパッチを当てることに同意している。
本稿では,カーネルベンチマークの精度指標として突然変異解析を導入する。
論文 参考訳(メタデータ) (2026-09-02T10:30:05Z) - MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models [49.47300047353726]
MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
論文 参考訳(メタデータ) (2026-08-26T18:22:03Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds [43.5891705224868]
自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
5つのベンチマークと3つのモデルで制御された評価フレームワークを提案する。
全体として、永続的なスキルの自己進化は、モデル依存リターンとベンチマーク依存リターンを備えたスパース、バリデーションフィルタリング検索として理解されている。
論文 参考訳(メタデータ) (2026-07-31T04:02:51Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Selective Question Answering under Domain Shift [90.021577320085]
モデルがドメイン外の入力に対して過度に信頼されているため、モデルのソフトマックス確率のみに基づくアテンションポリシーは不適切である。
キャリブレータをトレーニングして、QAモデルがアースする入力を識別し、エラーを予測した場合に停止する。
提案手法は,80%の精度を維持しながら56%の質問に回答するが,それに対してモデルの確率を直接使用する場合,80%の精度で48%しか回答しない。
論文 参考訳(メタデータ) (2020-06-16T19:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。