論文の概要: JET: Justification Evaluation in Transformer
- arxiv url: http://arxiv.org/abs/2609.33874v1
- Date: Sun, 27 Sep 2026 19:50:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:25.897434
- Title: JET: Justification Evaluation in Transformer
- Title(参考訳): JET:変圧器の正当性評価
- Abstract要約: JETは、事前訓練された言語とビジョン言語モデルを使用して、追加のトレーニングなしで、有限の回答の中から選択する。
Qwen3.6-35B-A3Bは完全なMMLUテストセットで87.48%の精度を達成し、別途MMLUサブセットで毎秒3.69リクエストを処理している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: JET uses pretrained language and vision-language models to select among a finite set of answers without additional training. It evaluates candidate likelihoods directly and shares computation across candidates. Experiments on desktop CPUs and consumer GPUs assess decision accuracy and execution cost. Qwen3.6-35B-A3B achieves 87.48% accuracy on the full MMLU test set and 3.69 requests per second on a separately timed MMLU subset. The accuracy-throughput comparison covers model, hardware, and reasoning choices, with Jev as an external reference. Controlled execution experiments show 2.18-2.23-fold speedups from prefix reuse and cache management, and a 30.8% reduction in process time from input preparation optimizations, with unchanged outputs. Optional reasoning has a task-dependent accuracy-throughput trade-off. These results support local decision inference from existing models.
- Abstract(参考訳): JETは、事前訓練された言語とビジョン言語モデルを使用して、追加のトレーニングなしで、有限の回答の中から選択する。
候補候補を直接評価し、候補間で計算を共有する。
デスクトップCPUとコンシューマGPUの実験は、決定精度と実行コストを評価する。
Qwen3.6-35B-A3Bは完全なMMLUテストセットで87.48%の精度を達成し、別途MMLUサブセットで毎秒3.69リクエストを処理している。
精度とスループットの比較は、モデル、ハードウェア、推論の選択をカバーし、Jevは外部参照である。
制御された実行実験では、プレフィックスの再利用とキャッシュ管理から2.18-2.23倍のスピードアップ、入力準備最適化からプロセス時間を30.8%削減し、出力は変化しない。
任意推論はタスク依存の精度・スループットのトレードオフを持つ。
これらの結果は、既存のモデルからの局所的な決定推論を支援する。
関連論文リスト
- Auditing System-1 Models on Biosecurity-Relevant Benchmarks: Calibration, Selective Prediction, and Permutation Instability in a Non-Generative Model [0.0]
System-1"モデルは、自己回帰復号化なしで単一の前方パスで構造化された確率的決定を返す。
精度,キャリブレーション,エラー検出,選択予測,および解答オプションが提示される順序に対する感度を測定する。
回転の平均確率は、WMDP-Cyberの精度を3.8ポイント向上させる。
論文 参考訳(メタデータ) (2026-09-24T18:46:53Z) - JevOut: Natural Context Can Flip Decision Models [3.2875856796061513]
コンテキストに自然に適合する短い追加は、そうでなければ正しい決定をリダイレクトできることに気付きました。
これらの結果は、現在の決定モデルにおける明らかな脆弱性を明らかにします。
論文 参考訳(メタデータ) (2026-09-24T17:57:07Z) - From Text Decisions to Pixels: An Study of Jev-Style Visual Choice Model [3.9089508293561845]
PixelJevは、イメージ、タスク命令、ランタイム候補セットを構造化された選択と候補条件付き確率にマッピングする、ネイティブイメージ決定インターフェイスである。
その初期実現は、既存の言語モデルの読み出しを通じて、認識と多重選択の視覚的答えを統一する。
論文 参考訳(メタデータ) (2026-09-24T09:19:05Z) - A Proprioceptive-Only Benchmark for Quadruped State Estimation: ATE, RPE, and Runtime Trade-offs Between Filters and Smoothers [3.926021278968717]
MUSE, Invariant Extended Kalman Filter (IEKF), Invariant Smoother (IS) の3つの状態受容状態推定器を比較した。
本稿では,長期精度(ATE),短期精度(Translational and rotational Relative Pose metrics RPE),および固定ハードウェア/ソフトウェアスタック上での更新時間について報告する。
全体として、本研究では正確さとコストのスナップショットを提供し、読者がアプリケーション制約に適合する推定器を選択するのに役立つ。
論文 参考訳(メタデータ) (2026-05-12T07:31:57Z) - Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees [28.54776477263591]
本稿では, Prompt-Aware Online Evaluation Scheduling (POES)を提案する。
POESはIRTベースの識別ユーティリティ、施設位置のカバレッジ用語、スイッチングコストを意識したウォームスタートスワップを統一された目的に統合する。
POESは、無視できるトークンオーバーヘッドで、全体的な平均精度(最高のベースラインよりも6.2%改善)が最も高い。
論文 参考訳(メタデータ) (2026-04-13T11:31:04Z) - Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference [31.2331188304598]
評価バッチサイズ、GPUカウント、GPUバージョンなどのシステム構成の変更は、生成されたレスポンスに大きな違いをもたらす可能性がある。
この変数の根本原因は、限定的な数値精度で浮動小数点算術の非連想性に遡る。
そこで我々は16ビットの精度で重みを格納するが、FP32では全ての計算を実行する軽量な推論パイプラインLayerCastを開発した。
論文 参考訳(メタデータ) (2025-06-11T08:23:53Z) - Sample, Don't Search: Rethinking Test-Time Alignment for Language Models [55.2480439325792]
新しいテストタイムアライメントアプローチであるQAlignを紹介します。
テスト時間計算をスケールする際、QAlignは各プロンプトの最適配向分布からのサンプリングに収束する。
マルコフ連鎖モンテカルロのテキスト生成における最近の進歩を取り入れることで、基礎となるモデルを変更したり、ロジットアクセスを必要とせずに、より良い整合出力を可能にする。
論文 参考訳(メタデータ) (2025-04-04T00:41:40Z) - Uncertainty-aware Language Modeling for Selective Question Answering [107.47864420630923]
本稿では,不確実性を考慮したLLMを生成するLLM変換手法を提案する。
我々のアプローチはモデルとデータに依存しず、計算効率が高く、外部モデルやシステムに依存しない。
論文 参考訳(メタデータ) (2023-11-26T22:47:54Z) - Enhancing Self-Consistency and Performance of Pre-Trained Language
Models through Natural Language Inference [72.61732440246954]
大規模な事前訓練された言語モデルは、テスト入力間の論理的一貫性を欠いていることが多い。
本研究では,事前学習したNLPモデルの一貫性と精度を高めるためのフレームワークであるConCoRDを提案する。
ConCoRDは、市販のクローズドブックQAおよびVQAモデルの精度と一貫性を一貫して向上することを示す。
論文 参考訳(メタデータ) (2022-11-21T21:58:30Z) - APQ: Joint Search for Network Architecture, Pruning and Quantization
Policy [49.3037538647714]
本稿では,リソース制約のあるハードウェア上での効率的なディープラーニング推論のためのAPQを提案する。
ニューラルアーキテクチャ、プルーニングポリシー、量子化ポリシーを別々に検索する従来の方法とは異なり、我々はそれらを共同で最適化する。
同じ精度で、APQはMobileNetV2+HAQよりもレイテンシ/エネルギーを2倍/1.3倍削減する。
論文 参考訳(メタデータ) (2020-06-15T16:09:17Z) - The Right Tool for the Job: Matching Model and Instance Complexities [62.95183777679024]
NLPモデルが大きくなればなるほど、訓練されたモデルを実行するには、金銭的・環境的なコストを発生させる重要な計算資源が必要である。
我々は、推論中、早期(かつ高速)の"exit"を可能にする文脈表現微調整の修正を提案する。
3つのテキスト分類データセットと2つの自然言語推論ベンチマークの2つのタスクで、5つの異なるデータセットに対して提案した修正を検証した。
論文 参考訳(メタデータ) (2020-04-16T04:28:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。