論文の概要: Visible Reasoning and Indirect Prompt-Injection Monitorability Across English, Tamil, and Tanglish
- arxiv url: http://arxiv.org/abs/2608.15392v1
- Date: Sat, 15 Aug 2026 19:48:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.284865
- Title: Visible Reasoning and Indirect Prompt-Injection Monitorability Across English, Tamil, and Tanglish
- Title(参考訳): 英語、タミル語、タングリッシュ語全体での可視的推論と間接的プロンプト注入モニタリング
- Authors: Madhusudhanan G,
- Abstract要約: 連鎖監視は潜在的に有用な安全信号であるが、言語間の信頼性と行動設定は依然として不確実である。
英語,タミル語,タングリッシュ語における間接的インジェクション中のAPI可視推論について検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-thought monitoring is a potentially useful safety signal, but its reliability across languages and behavioral settings remains uncertain. In a small case study of eight manually verified synthetic scenarios, one model, one annotator, and one deterministic generation seed, I study API-visible reasoning during indirect prompt injection in Sarvam-105B across English, Tamil, and Tanglish. A four scenario pilot found 5/12 injected attack successes without reasoning and 1/11 with reasoning. A preregistered four-scenario follow-up reversed that direction, finding 2/12 attacks without reasoning and 3/12 with reasoning. With only four scenarios per phase, this design cannot distinguish a real reasoning-mode effect from prompt-specific variation or sampling noise. Across 20 non-empty injected-thinking traces, all 17 benign-correct outputs stated an intent to ignore the injection, while all three attack successes stated an intent to follow it. These descriptive observations provide a reproducible case study of behaviorally informative visible reasoning when it is available; they do not establish that reasoning mode improves safety, that visible reasoning is mechanistically faithful, or that the findings generalize beyond this configuration.
- Abstract(参考訳): 連鎖監視は潜在的に有用な安全信号であるが、言語間の信頼性と行動設定は依然として不確実である。
そこで,本研究では,Sarvam-105Bにおける間接的インジェクション中のAPI可視推論を,英語,タミル語,タングリッシュ語に比較検討した。
4人のパイロットが推論なしで5/12で攻撃を成功させ、1/11で推論を行った。
事前登録された4人組のフォローアップはその方向を逆転し、推論なしで2/12攻撃、推論なしで3/12攻撃を発見した。
フェーズ毎に4つのシナリオしか持たないこの設計では、実際の推論モード効果と、即時的な変動やサンプリングノイズとを区別することはできない。
空でないインジェクトされた痕跡20点中、17点の良識あるアウトプットはインジェクションを無視する意図を示し、3点の攻撃成功は全てそれに従う意図を示した。
これらの記述的観察は、それが利用可能であるときに行動に影響を及ぼす可視的推論の再現可能なケーススタディを提供する;彼らは推論モードが安全性を改善し、可視的推論が機械的に忠実であること、あるいはこの構成を超えて発見が一般化されることを証明していない。
関連論文リスト
- Do LLMs Know Their Vulnerable Scenarios? [35.22432085632252]
本研究は, シナリオラッパーが内部シナリオの方向を活性化し, 因果的ステアリングが拒絶スコアを一定に減少させることを示す。
弱いシナリオ発見のための概念ベースの属性フレームワークであるtextscConcept2Scenario を提案する。
論文 参考訳(メタデータ) (2026-07-26T06:54:28Z) - Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models [27.2709460237741]
行動の前に理由付けをする政策は、観察を直接行動にマッピングする政策よりも摂動入力を吸収すべきである。
この前提を推論スペクトルにまたがる3つのモデルでテストする。
潜望的なモデルは、はるかにロバストであることに気付きました。
論文 参考訳(メタデータ) (2026-07-20T10:20:32Z) - Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations [0.0]
連鎖推論の不整合を検出する再利用可能な方法である推論整合性スキャンを導入する。
まず,一貫性を忠実性とは異なるものとして定式化し,矛盾性の6つの亜型分類を定式化する。
第3に、インスツルメンタルEval出力から手動で適応した60文字の検証済みのベンチマークを構築します。
第4に、4つのジェネレータモデルと3つのインスペクタ_evalsの評価結果について報告し、推論の不整合が存在し、検出可能であり、モデルとタスクタイプの両方で体系的に変化することを示す。
論文 参考訳(メタデータ) (2026-07-08T10:13:19Z) - When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning Chains [8.210900454317422]
HarmThoughtsは推論トレースの段階的安全性評価のためのベンチマークである。
データセットは4つのモデルファミリーによって生成される1,018の 推論トレースから56,931文で構成されています。
論文 参考訳(メタデータ) (2026-04-21T02:43:25Z) - Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models [14.927545906619295]
大規模言語モデルは、複雑なタスクを解決するために明示的なチェーン・オブ・シンク(CoT)推論にますます依存している。
LLMの安全性に関する既存の研究は、コンテンツ安全性に焦点を当てている。
我々は、推論の安全性をセキュリティの側面として認識する:モデルの推論の軌道が論理的に一貫したものであるという要求。
論文 参考訳(メタデータ) (2026-03-26T13:08:56Z) - Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models [70.11800794130394]
離散最適化ベースのjailbreaking攻撃は、入力プロンプトに付加された非意味なサフィックスを生成することを目的としている。
素早い意味的類似性は、伝達の成功と弱い相関関係にある。
これらの知見は、我々の統計的分析が攻撃成功の実践的改善にどのように変換できるかを示すために、介入実験で使用する、伝達可能性のよりきめ細かな理解につながる。
論文 参考訳(メタデータ) (2025-10-24T20:28:49Z) - Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning? [68.82210578851442]
メカニスティックな解釈可能性レンズによる推論モデルにおいて、なぜ安全アライメントが失敗するのかを考察する。
トークン位置における拒絶意図の追跡のための線形探索手法を用いて,textbfrefusal cliff と呼ばれる現象を発見した。
提案手法は,最大断崖を示す訓練例を識別し,推論モデルの安全性を向上する手法であるtextbfCliff-as-a-Judge を提案する。
論文 参考訳(メタデータ) (2025-10-07T15:32:59Z) - Preliminary Investigation into Uncertainty-Aware Attack Stage Classification [81.28215542218724]
この研究は、不確実性の下での攻撃段階推論の問題に対処する。
Evidential Deep Learning (EDL) に基づく分類手法を提案し、ディリクレ分布のパラメータを可能な段階に出力することで予測の不確実性をモデル化する。
シミュレーション環境における予備実験により,提案モデルが精度良く攻撃の段階を推定できることが実証された。
論文 参考訳(メタデータ) (2025-08-01T06:58:00Z) - Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption [51.98089842456886]
そこで本研究では,大規模な言語モデルにおいて,チェーン・オブ・ディフェンシブ・思想と呼ばれる単純な手法を用いて,参照破損に対するロバスト性を大幅に向上したことを示す。
特に、メソッドの単純さと適用性を考えると、この改善は驚くべきものです。
論文 参考訳(メタデータ) (2025-04-29T13:50:05Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z) - Navigating the OverKill in Large Language Models [84.62340510027042]
モデルがどのように処理し,クエリの安全性を判断するかを検討することで,過剰スキルの要因について検討する。
以上の結果から,モデル内にショートカットが存在することが明らかとなり,"キル"のような有害な単語が過剰に認識され,安全性が強調され,過度なスキルが増すことが示唆された。
我々は、この現象を緩和するために、トレーニングフリーでモデルに依存しないセルフコントラストデコーディング(Self-Contrastive Decoding、CD)を導入する。
論文 参考訳(メタデータ) (2024-01-31T07:26:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。