論文の概要: SMTrap: Cost-Effective DoS Attacks Against Large Reasoning Models via SMT Conflict Guidance
- arxiv url: http://arxiv.org/abs/2608.18921v1
- Date: Wed, 19 Aug 2026 13:51:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.419822
- Title: SMTrap: Cost-Effective DoS Attacks Against Large Reasoning Models via SMT Conflict Guidance
- Title(参考訳): SMTrap:SMT Conflict Guidanceによる大規模推論モデルに対するコスト効果DoS攻撃
- Abstract要約: 既存の LRM-DoS メソッドは攻撃クエリを合成するためにモデルフィードバックに大きく依存している。
モデルフィードバックのない LRM-DoS パラダイムである Emphsearch Amplification を提案する。
- 参考スコア(独自算出の注目度): 47.25502169851139
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing LRM-DoS methods rely heavily on model feedback to synthesize attack queries, requiring either repeated queries to the target model or training a dedicated attack model. These expensive operations severely weaken attack leverage. In this paper, we propose \emph{search amplification}, a novel, model-feedback-free LRM-DoS paradigm. It employs the conflict count derived from an Satisfiability Modulo Theories (SMT) solver as a low-cost external signal to guide the synthesis of inference-heavy Constraint Satisfaction Problem (CSP) instances. Our key observation is that LRMs depend on trial-and-backtracking search when solving CSPs, where higher SMT conflict counts on a given CSP instance positively correlate with more extensive LRM backtracking search and substantially longer output trajectories. Building on this finding, we propose \textsc{SMTrap}, a lightweight, CPU-only framework. Guided by SMT conflict counts, \textsc{SMTrap} generates inference-heavy CSP queries without model queries, attack-model training, or GPU computation. Evaluations across seven frontier models demonstrate the state-of-the-art LRM-DoS capability of \textsc{SMTrap}, producing DoS effects multiple times stronger than existing baselines. To mitigate the threat of \textsc{SMTrap}, we demonstrate a tool-based mitigation that significantly cuts token usage.
- Abstract(参考訳): 既存のRM-DoSメソッドは、攻撃クエリを合成するためにモデルフィードバックに大きく依存しており、ターゲットモデルに繰り返しクエリを必要とするか、専用の攻撃モデルを訓練する。
これらの高価な作戦は攻撃のレバレッジを著しく弱めた。
本稿では,モデルフィードバックのない新しい LRM-DoS パラダイムである \emph{search amplification} を提案する。
Satisfiability Modulo Theories(SMT)ソルバから導かれる競合数を用いて、推論重度制約満足度問題(CSP)インスタンスの合成を導出する。
我々の重要な観察は、LRMはCSPを解く際にトライ・アンド・バックトラック探索に依存しており、そこでは、与えられたCSPインスタンス上でより高いSMTコンフリクトが、より広範なLRMバックトラック探索とほぼ長いアウトプットトラジェクトリとの正の相関関係を持つ。
この発見に基づいて,軽量でCPUのみのフレームワークであるtextsc{SMTrap}を提案する。
SMTコンフリクトカウントによってガイドされた \textsc{SMTrap} は、モデルクエリ、アタックモデルトレーニング、GPU計算なしで、推論に重いCSPクエリを生成する。
7つのフロンティアモデルにまたがる評価は、既存のベースラインの何倍も強いDoS効果を生じさせるような、最先端のRM-DoS能力を示す。
textsc{SMTrap}の脅威を軽減するために、トークンの使用を著しく削減するツールベースの緩和を実証する。
関連論文リスト
- RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment [57.588738943463646]
大規模言語モデル(LLM)は機械翻訳(MT)において顕著な性能を発揮した
大規模に展開するのは 違法に高価です
モデル内ルータである textbfRouteLMT を提案する。
論文 参考訳(メタデータ) (2026-04-24T13:02:45Z) - Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction [49.03500737694832]
textbfReinforcement textbfLearning with textbfTurn textbfRLSTA。
実験の結果,RTSTAは標準微調整法や禁忌法よりも有意に優れていた。
論文 参考訳(メタデータ) (2026-03-05T04:04:59Z) - Are Reasoning LLMs Robust to Interventions on Their Chain-of-Thought? [79.86483056611105]
推論 LLM は、答えを出す前にステップバイステップの思考連鎖を生成する。
これらの推論は、その内部で発生する破壊の痕跡をどれほど堅牢にしていますか?
一定のタイミングでモデル自身のCoTを摂動させる制御された評価フレームワークを導入する。
論文 参考訳(メタデータ) (2026-02-07T10:02:58Z) - Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision [11.159231524113764]
マルチモーダル大規模言語モデル(MLLM)の複雑な推論能力を高めるための重要なメカニズムとして強化学習(RL)が登場した。
本稿では,これらの構造的制約に対処する textbfGuided Verifier フレームワークを提案する。
我々は,マルチモーダル幻覚をターゲットとした特殊なデータ合成パイプラインを開発し,プロセスレベルの負の textbfCoRe データセットとtextbfCorrect-guide textbfReasoning トラジェクトリを構築し,ガイド付き検証器を訓練する。
論文 参考訳(メタデータ) (2026-02-04T07:38:42Z) - OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows [9.617220633655716]
textbfunderlineOmni-textbfunderlineModality textbfunderlineGeneration Agent (textbfOMG-Agent)について述べる。
論文 参考訳(メタデータ) (2026-02-04T02:25:40Z) - Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning [34.10133693878611]
本稿では,冗長なチャンクを選択的にペナルティ化するマルチエージェントRLフレームワークを提案する。
MARL(SCMA)による自己圧縮(Self-Compression)は,2つの特殊エージェントによる冗長検出と評価をインスタンス化する。
モデルスケールでの実証的な評価により、SCMAは応答長を11.1%から39.0%削減し、精度は4.33%から10.02%向上した。
論文 参考訳(メタデータ) (2026-01-29T16:13:10Z) - SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models [53.19726629537694]
ビデオ生成モデルと人間の好みのトレーニング後のアライメントは、重要な目標である。
現在のデータ収集パラダイムは、プロンプト内のペアワイズアノテーションに依存しており、ノイズのラベル付けに悩まされている。
ビデオRMトレーニングのための体系的フレームワークであるSoliRewardを提案する。
論文 参考訳(メタデータ) (2025-12-17T14:28:23Z) - Scalable Chain of Thoughts via Elastic Reasoning [61.75753924952059]
Elastic Reasoningは、スケーラブルな思考の連鎖のための新しいフレームワークである。
推論は、独立して割り当てられた予算で、思考と解決の2つのフェーズに分けられる。
我々のアプローチは、制約のない設定でもより簡潔で効率的な推論をもたらす。
論文 参考訳(メタデータ) (2025-05-08T15:01:06Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models [46.75272311751018]
階層的リワードモデルと呼ばれる新しい報酬モデル手法を提案する。
個々の推論ステップと連続推論ステップを、きめ細かいレベルと粗いレベルの両方で評価する。
これは多段階推論コヒーレンスの評価に優れており、特に欠陥のあるステップが後に自己回帰によって修正される場合である。
論文 参考訳(メタデータ) (2025-03-16T15:18:40Z) - Nonintrusive Uncertainty Quantification for automotive crash problems
with VPS/Pamcrash [0.0]
サロゲートモデル(メタモデル)はモンテカルロプロセスの計算コストを劇的に削減できる。
カーネル主成分分析(kPCA)はモデル結果記述の簡略化に有効である。
ベンチマーククラッシュテストは、メタモデルとkPCAを組み合わせる効率を示すために使用される。
論文 参考訳(メタデータ) (2021-02-15T16:59:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。