論文の概要: Calling the Bluff: Detecting Ever-Shifting Harmful Chat Dialogue via Ordered Reasoning Chain Regularization
- arxiv url: http://arxiv.org/abs/2608.08451v1
- Date: Sun, 09 Aug 2026 03:41:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.833591
- Title: Calling the Bluff: Detecting Ever-Shifting Harmful Chat Dialogue via Ordered Reasoning Chain Regularization
- Title(参考訳): Calling the Bluff: ordered Reasoning Chain Regularization による絶え間なく変化する有害なチャット対話の検出
- Authors: Haojie Yu, Ziyou Jiang, Junjie Wang, Mingyang Li, Yuekai Huang, Jie Huang, Qing Wang,
- Abstract要約: 有害なチャット対話は、タイプシフトと語彙回避を通じて、常にシフトしている。
本稿では、繰り返しトピックの順序付き推論連鎖(ORC)を符号化するBRACEを提案する。
BRACEは0.934の調和型マクロF1を達成し、デコーダバックボーン(Qwen3-1.7B LoRA)は0.949に達する。
- 参考スコア(独自算出の注目度): 14.97550921764592
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Harmful chat dialogues are ever-shifting through type-shifting and lexical evasion, yet we find they share invariant principles, i.e., an Ordered Reasoning Chain (ORC) of recurring topics, harm language indicators, severity hierarchies, and type characteristics, which can help us capture the key information in the frequently changing lexical expressions. We propose BRACE, which encodes the ORC as four differentiable stages (Topic -> Indicator -> Severity -> Type) with intermediate supervision, serving as a structured regularizer blended with direct heads, and supported by prototype-based feature augmentation and feature path disentanglement. The evaluation results show that, across 4 domains and 5 harm categories, BRACE achieves harm-type macro F1 of 0.934 (RoBERTa-wwm-ext, 3-seed mean), with decoder backbones (Qwen3-1.7B LoRA) reaching 0.949. Ablation studies show that all components contribute to BRACE, and the structural decomposition of ORC enables BRACE to distinguish harmful types with semantic ambiguity. Disclaimer: This paper may contain content that is disturbing to some readers.
- Abstract(参考訳): ハームフルなチャット対話は、型シフトと語彙回避を通じて常にシフトしているが、それらは不変の原則、すなわち、繰り返し発生するトピック、ハーフ言語指標、重大な階層、型特性の順序付き推論連鎖(ORC)を共有することで、頻繁に変化する語彙表現において重要な情報をキャプチャするのに役立つ。
BRACEは,ORCを4つの異なる段階(Topic -> Indicator -> Severity -> Type)に符号化し,直接ヘッドをブレンドした構造化正則化器として機能し,プロトタイプベースの特徴拡張と特徴経路の絡み合いによって支援する。
その結果、BRACEは4つのドメインと5つのハーモカテゴリで0.934のハーモタイプマクロF1(RoBERTa-wwm-ext, 3-seed mean)を達成し、デコーダバックボーン(Qwen3-1.7B LoRA)は0.949に達した。
アブレーション研究は、全ての成分がBRACEに寄与し、ORCの構造分解によりBRACEは意味的曖昧さで有害なタイプを識別できることを示している。
Disclaimer: この論文には、一部の読者にとって邪魔になるコンテンツが含まれています。
関連論文リスト
- Pairwise matrices for sparse autoencoders: single-feature inspection mislabels causal axes [2.741152471987327]
標準スパースオートエンコーダプロトコルは、各機能をトップアクティベーションコンテキストからラベル付けし、単一機能ステアリングによって検証する。
本稿では,Qwen3-1.7B-Instruct上での標準ワンコーナプロトコルミスをGemma-2-2B-itで再現した,ペアワイズ行列プロトコルと共変ステアリング係数を提案する。
これら3つの所見はGemmaでモデル特異的な損傷シグネチャを再現し,一致した形状制御はCIを10倍に分離する。
論文 参考訳(メタデータ) (2026-05-04T21:11:21Z) - The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content [11.226669792850645]
我々は構造的注意税という現象を定式化した:知識グラフ(KG)三倍体である。
KGトリプルは意味論的に等価な自然言語テキストよりもトークン当たりの注目度が2~3倍になる。
注意点を意味的および構造的構成要素に分解する形式的なフレームワークを開発する。
論文 参考訳(メタデータ) (2026-04-21T08:47:00Z) - DiffVP: Differential Visual Semantic Prompting for LLM-Based CT Report Generation [18.257492970454898]
DiffVP (differial Visual Prompting) を提案する。
2つの大規模ベンチマークにおいて、DiffVPは従来手法より一貫して優れ、平均のBLEU-1-4を+10.98と+4.36で改善した。
論文 参考訳(メタデータ) (2026-03-18T13:38:26Z) - Decomposing Query-Key Feature Interactions Using Contrastive Covariances [75.38737409771085]
クエリとキー間の双方向のジョイント埋め込み空間であるクエリキー空間について検討する。
キーとクエリの機能がこれらの低ランクのサブスペースに整列して、高い注目スコアが生成されるときです。
論文 参考訳(メタデータ) (2026-02-04T16:50:02Z) - Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs [85.69785384599827]
人間と物体の相互作用(Human-object Interaction、HOI)の検出は、人と物体のペアとそれらの相互作用を局在させることを目的としている。
既存のメソッドはクローズドワールドの仮定の下で動作し、タスクを未定義の小さな動詞集合上の分類問題として扱う。
本稿では,閉集合分類タスクから開語彙生成問題へのHOI検出を再構成する新しい生成推論・ステアブル知覚フレームワークGRASP-HOを提案する。
論文 参考訳(メタデータ) (2025-12-19T14:41:50Z) - From Feature Interaction to Feature Generation: A Generative Paradigm of CTR Prediction Models [81.43473418572567]
CTR(Click-Through Rate)予測は、レコメンデーションシステムにおける中核的なタスクである。
本稿では,埋め込み次元の崩壊と情報冗長性に対処する新しい生成フレームワークを提案する。
SFGは埋没崩壊を緩和し,情報冗長性を低減し,性能向上を図っている。
論文 参考訳(メタデータ) (2025-12-16T03:17:18Z) - Language-Driven Visual Consensus for Zero-Shot Semantic Segmentation [114.72734384299476]
本稿では,言語駆動型ビジュアルコンセンサス(LDVC)アプローチを提案する。
クラス埋め込みを、その離散的で抽象的な性質からアンカーとして活用し、クラス埋め込みに向けて視覚的特徴を操る。
我々の手法は、目に見えないクラスに対するセグメンテーションモデルの能力を大幅に向上させる。
論文 参考訳(メタデータ) (2024-03-13T11:23:55Z) - Uncovering Prototypical Knowledge for Weakly Open-Vocabulary Semantic
Segmentation [59.37587762543934]
本稿では,弱開語彙セマンティックセマンティックセグメンテーション(WOVSS)の問題点について検討する。
既存の方法は、グループトークンの使用に関する粒度の矛盾に悩まされる。
マルチモーダル正規化を組み込んだプロトタイプ誘導ネットワーク(PGSeg)を提案する。
論文 参考訳(メタデータ) (2023-10-29T13:18:00Z) - Generalized Funnelling: Ensemble Learning and Heterogeneous Document
Embeddings for Cross-Lingual Text Classification [78.83284164605473]
emphFunnelling (Fun)は、最近提案された言語間テキスト分類手法である。
Emph Generalized Funnelling (gFun) はFunの一般化である。
gFunは、Funや最先端のベースラインよりも大幅に改善されていることを示す。
論文 参考訳(メタデータ) (2021-09-17T23:33:04Z) - BERT-Defense: A Probabilistic Model Based on BERT to Combat Cognitively
Inspired Orthographic Adversarial Attacks [10.290050493635343]
敵対的攻撃は、ディープラーニングシステムの重要な盲点を露呈する。
文字レベルの攻撃は通常入力ストリームにタイプミスを挿入する。
トレーニングされていない反復的アプローチは,3ショット学習によって指導されるヒトの群集労働者と同等に実行可能であることを示す。
論文 参考訳(メタデータ) (2021-06-02T20:21:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。