論文の概要: Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs
- arxiv url: http://arxiv.org/abs/2610.09033v1
- Date: Tue, 06 Oct 2026 19:33:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.573305
- Title: Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs
- Title(参考訳): 非カノニカル入力によるオープンウェイト大言語モデルの準状態安全性評価
- Abstract要約: この研究は、7つの異なる表面形ファミリにわたる2,100のプロンプトからなる、Adrial Surface-Form Robustnessデータセット(ASRD)を導入している。
5つのオープンウェイト言語モデルがこれらのプロンプトで評価され、10,500のレスポンスが生成される。
準状態評価(Quad-State Evaluation)は、各応答を有害なコンプライアンス、安全な応答、理解障害、不確定の4つの結果の1つに分類する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Standard safety evaluations of large language models assess harmful requests written in canonical plain text, while models in real-world deployment routinely receive inputs containing emojis, altered spellings, encoded strings, and character-level variations. This work introduces the Adversarial Surface-Form Robustness Dataset (ASRD), comprising 2,100 prompts across seven distinct surface-form families. Five open-weight language models are evaluated across these prompts, producing 10,500 responses. The Quad-State Evaluation Rubric classifies each response into one of four outcomes: harmful compliance, safe response, comprehension failure, or indeterminate. Emoji and invisible Unicode variations cause almost no comprehension failure, with pooled harmful compliance of 20.27% and 17.20% against a 22.87% baseline that is driven mainly by Mistral 7B, whereas leetspeak, encoded wrappers, and hybrid transformations score 2.40%, 0.13%, and 2.40% while comprehension failure rises to 36.47%, 65.60%, and 34.47%. Inspection of raw model outputs reveals three response behaviors: hallucinated benignity, structural collapse, and language drift. Project page: www.pavanmaddula.com/quadstate
- Abstract(参考訳): 大規模言語モデルの標準安全性評価では、標準的な平文で書かれた有害な要求を評価する一方で、現実のデプロイメントでは、絵文字、修正スペル、エンコードされた文字列、文字レベルのバリエーションを含む入力を定期的に受信する。
この研究は、異なる7つの曲面形式ファミリにまたがる2,100のプロンプトからなるASRD(Adversarial Surface-Form Robustness Dataset)を導入している。
5つのオープンウェイト言語モデルがこれらのプロンプトで評価され、10,500のレスポンスが生成される。
Quad-State Evaluation Rubricは、各レスポンスを、有害なコンプライアンス、安全な応答、理解障害、不確定の4つの結果の1つに分類する。
絵文字と見えないUnicodeのバリエーションは、主にMistral 7Bによって駆動される22.87%のベースラインに対して20.27%と17.20%の有害なコンプライアンスをプールしたのに対して、レサピーク、エンコードされたラッパー、ハイブリッドトランスフォーメーションは2.40%、0.13%、そして2.40%であり、理解不能は36.47%、65.60%、34.47%に上昇する。
生モデル出力の検査では, 幻覚的良性, 構造的崩壊, 言語ドリフトの3つの応答挙動が明らかになった。
プロジェクトページ: www.pavanmaddula.com/quadstate
関連論文リスト
- An Empirical Evaluation of Cost-Efficient Large Language Models on Algorithmic Programming Tasks [0.0]
38.4%のメソッドは返却した値を計算せず、返却された回答の12.9%のみが正しい。
結果クラスの条件は、応答の信頼性と正しさが逆関係であることを示しているが、真の計算方法が最も多く答えられ、19.3%が正しかった。
論文 参考訳(メタデータ) (2026-09-16T02:55:03Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts [46.85286238215375]
MLLM生成Webアーティファクトの既存のベンチマークは、局所的な証拠を通じて相互作用を評価する。
タスク要求をインタラクションコントラクトグラフにコンパイルするWebRISEを紹介します。
論文 参考訳(メタデータ) (2026-06-02T06:29:40Z) - DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects [6.107850985025956]
本稿では,50の英語方言における偽情報検出のための最初のベンチマークであるDIA-HARMを提案する。
人間による方言の含有量は1.4-3.6%減少し、一方でAI生成された内容は安定している。
私たちはDIA-HARMフレームワーク、D3コーパス、評価ツールをリリースします。
論文 参考訳(メタデータ) (2026-04-07T01:43:48Z) - CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context [8.678622777553267]
CAPITUは、ブラジルポルトガル語でLLM(Large Language Models)の命令追従能力を評価するためのベンチマークである。
ベンチマークは59の命令タイプを7つのカテゴリに分類し、すべて自動的に検証できるように設計されている。
シングルターンおよびマルチターン設定における18の最先端モデルを評価する。
論文 参考訳(メタデータ) (2026-03-23T21:16:54Z) - Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical Ability in a Zero-Data-Leakage Setting [5.313647446600863]
本研究は,2026年の韓国・カレッジ・スコラスティック能力テスト(CSAT)を用いた大規模言語モデル(LLM)の数学的推論能力について,体系的に評価した。
既存のベンチマークにおけるデータ漏洩問題に対処するため、試験公開から2時間以内に46の質問(22件、24件)をすべてデジタル化した。
論文 参考訳(メタデータ) (2025-11-23T23:09:33Z) - Evaluating NL2SQL via SQL2NL [45.88028371034407]
新しいフレームワークは意味論的に等価で語彙的に多様なクエリを生成する。
最先端のモデルは、標準ベンチマークが示すよりもはるかに脆弱だ。
論文 参考訳(メタデータ) (2025-09-04T21:03:59Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Emulated Disalignment: Safety Alignment for Large Language Models May Backfire! [65.06450319194454]
大きな言語モデル(LLM)は、人間との安全な会話を確保するために安全アライメントを行う。
本稿では,安全アライメントの反転が可能なトレーニングフリーアタック手法を提案する。
本手法をエミュレートした脱アライメント (ED) と呼ぶのは, このコントラスト分布からのサンプリングは, 安全報酬を最小限に抑えるため, 微調整の結果を確実にエミュレートするからである。
論文 参考訳(メタデータ) (2024-02-19T18:16:51Z) - TextFlint: Unified Multilingual Robustness Evaluation Toolkit for
Natural Language Processing [73.16475763422446]
NLPタスク(TextFlint)のための多言語ロバスト性評価プラットフォームを提案する。
普遍的なテキスト変換、タスク固有の変換、敵攻撃、サブポピュレーション、およびそれらの組み合わせを取り入れ、包括的な堅牢性分析を提供する。
TextFlintは、モデルの堅牢性の欠点に対処するために、完全な分析レポートとターゲットとした拡張データを生成します。
論文 参考訳(メタデータ) (2021-03-21T17:20:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。