論文の概要: The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs
- arxiv url: http://arxiv.org/abs/2607.02587v1
- Date: Wed, 01 Jul 2026 05:44:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.340268
- Title: The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs
- Title(参考訳): 移動目標:オープンソースチャットLLMの12つのチェックポイントにわたる信頼度ドリフトの経時的監査
- Authors: Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang,
- Abstract要約: モデルカードは、測定時に記録せずに信頼とベンチマークのスコアを引用する。
同じ数は、1つのリリースラインの連続したチェックポイントにわたって、まるでその背後にあるモデルが移行していないかのように、定期的に運ばれる。
我々は、Yi、Qwen、Mistral、Gemmaの4つのオープンソースリリースラインを3世代連続で監査することで、移行したかどうかをテストする。
- 参考スコア(独自算出の注目度): 12.709654635425442
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model cards quote trust-benchmark scores without recording when they were measured, and the same number is routinely carried across successive checkpoints of one release line as if the model behind it had not shifted. We test whether it has shifted by auditing four open-source release lines, Yi, Qwen, Mistral, and Gemma, at three successive generations each, on a fixed basket of trust benchmarks under multiple prompt templates. Mean absolute adjacent-generation drift lands well above an independence-based no-drift reference null, and the gap persists when we drop a benchmark, drop a release line, or switch to strict scoring. We therefore conclude that a trust score attached to a release line should not be carried forward to the next checkpoint without remeasurement; it should instead be reported as a checkpoint-bound, dated artefact, which we package as a longitudinal model card. Closed APIs, larger models, canonical benchmark protocols, and fixed month-cadence rules lie outside the audited scope and require their own evaluation.
- Abstract(参考訳): モデルカードは、測定された時に記録されずに信頼とベンチマークのスコアを引用し、同じ数字が、1つのリリースラインの連続したチェックポイントにわたって、まるでその背後にあるモデルがシフトしていないかのように日常的に運ばれる。
オープンソースの4つのリリースラインであるYi、Qwen、Mistral、Gemmaを、複数のプロンプトテンプレートの下で固定された信頼ベンチマークのバスケットで3世代に分けて監査することで、移行したかどうかを検証する。
絶対的な隣接世代ドリフトは独立ベースのno-drift参照nullよりはるかに上にあり、そのギャップはベンチマークを落として、リリースラインを落として、厳密なスコアに切り替えるときに持続します。
そこで我々は,リリースラインに付属する信頼スコアを,再測定なしに次のチェックポイントに転送するべきではないと結論付け,代わりに,縦型モデルカードとしてパッケージングしたチェックポイントバウンドの日付付きアーティファクトとして報告する。
クローズドAPI、より大きなモデル、標準ベンチマークプロトコル、固定月周期ルールは監査対象外にあり、独自の評価を必要とする。
関連論文リスト
- TopoGeoScore: A Self-Supervised Source-Only Geometric Framework for OOD Checkpoint Selection [1.4877856019517555]
ラベルなしOODチェックポイント選択のためのソースのみの幾何スコアである textbfTopoGeoScore を提案する。
我々は、ソース埋め込みからクラス条件の相互$k$-nearest-neighbourグラフを構築し、3つの解釈可能な信号を抽出する。
ウェイトを手で固定する代わりに、TopoGeoScoreは自己教師対象を通じて非負の線形スコアを学習する。
論文 参考訳(メタデータ) (2026-05-09T10:46:47Z) - The Convergence Gap: Instruction-Tuned Language Models Stabilize Later in the Forward Pass [9.8812664524155]
最終的なアウトプットは、チェックポイントがその次のポイント予測にコミットしたときに隠される。
本稿では,各層の次点分布をデコードし,モデルの最終分布までの距離を測定するモデル微分診断法である収束ギャップを導入する。
論文 参考訳(メタデータ) (2026-05-08T05:45:52Z) - Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone [11.663456969895462]
機械学習におけるアライメント評価は、主にモデルの評価となっている。
本稿では, モデルレベルの評価だけでは, 配置関連アライメントを推定できないことを論じる。
論文 参考訳(メタデータ) (2026-05-06T03:28:30Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。
信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。
我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文 参考訳(メタデータ) (2025-02-05T18:58:19Z) - Reliability-Adaptive Consistency Regularization for Weakly-Supervised
Point Cloud Segmentation [80.07161039753043]
極端に限られたラベルを持つ弱教師付きポイントクラウドセグメンテーションは、高額な注釈付き3Dポイントの収集コストを軽減するのが望ましい。
本稿では、弱教師付き学習において一般的に用いられる一貫性の正則化を、複数のデータ固有の拡張を伴うポイントクラウドに適用することを検討する。
疑似ラベルの信頼性を評価するために,予測信頼性とモデル不確実性を両立させる新しい信頼性適応整合ネットワーク(RAC-Net)を提案する。
論文 参考訳(メタデータ) (2023-03-09T10:41:57Z) - TRUST-LAPSE: An Explainable and Actionable Mistrust Scoring Framework
for Model Monitoring [4.262769931159288]
連続モデル監視のための"ミストラスト"スコアリングフレームワークであるTRUST-LAPSEを提案する。
我々は,各入力サンプルのモデル予測の信頼性を,潜時空間埋め込みのシーケンスを用いて評価する。
AUROCs 84.1 (vision), 73.9 (audio), 77.1 (clinical EEGs)
論文 参考訳(メタデータ) (2022-07-22T18:32:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。