論文の概要: On the Chain-of-Thought Monitorability of Looped Language Models
- arxiv url: http://arxiv.org/abs/2610.02741v1
- Date: Fri, 02 Oct 2026 03:12:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.193797
- Title: On the Chain-of-Thought Monitorability of Looped Language Models
- Title(参考訳): ループ言語モデルの連鎖監視性について
- Abstract要約: CoT(Chain-of- Thought)モニタリングは、望ましくないモデルの振る舞いを検出するための有望なアプローチを提供する。
ループ言語モデル(LoopLM)は、共有トランスフォーマー層を繰り返し適用する。
本研究は,LoopLMにおけるCoT監視性の最初の体系的評価である。
- 参考スコア(独自算出の注目度): 9.139080340407158
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-thought (CoT) monitoring provides a promising approach for detecting undesirable model behavior. Looped language models (LoopLMs) repeatedly apply shared transformer layers, increasing effective computational depth and enabling additional latent computation without increasing model size. However, the effect of looped architectures on CoT monitorability remains largely unexplored. In this work, we provide the first systematic evaluation of CoT monitorability in LoopLMs. We study two complementary settings: (1) varying the loop depth within the same LoopLM family to isolate the effect of additional recurrent computation, and (2) comparing LoopLMs with non-looped language models matched by parameter size, transformer-layer count, or effective depth to study whether LoopLMs are less monitorable. Across eight tasks from MonitorBench and both standard and stress-test settings, we observe task-dependent reductions in CoT monitorability under stress tests on specific Logic/Science/Engineering \texttt{Cue Answer} tasks, while other tasks exhibit weaker or qualitatively different trends. Our diagnosis suggests that these declines are not fully explained by task difficulty, verification pass rate, or generated token length; qualitative examples further suggest changes in how deeper-loop models explicitly use or attribute provided cues. Our cross-model comparison finds no evidence that LoopLMs are systematically less monitorable than non-looped language models matched on size or depth. Overall, our results suggest that deeper loop depth can reduce CoT monitorability in some tasks under stress tests, but looped transformer architecture alone does not necessarily imply lower monitorability.
- Abstract(参考訳): CoT(Chain-of- Thought)モニタリングは、望ましくないモデルの振る舞いを検出するための有望なアプローチを提供する。
ループ言語モデル(LoopLM)は、共有トランスフォーマー層を繰り返し適用し、効率的な計算深度を増大させ、モデルサイズを増大させることなく追加の潜在計算を可能にする。
しかし、CoT監視性に対するループアーキテクチャの影響は、まだ明らかにされていない。
本研究は,LoopLMにおけるCoT監視性の最初の体系的評価である。
本研究では,(1)同じLoopLMファミリー内のループ深さを変化させて追加の繰り返し計算の効果を分離し,(2)パラメータサイズ,変圧器層数,あるいは実効深度で一致した非ループ言語モデルと比較し,LoopLMが監視しにくいかを検討した。
MonitorBenchの8つのタスクと、標準およびストレステストの両方の設定で、特定のLogic/Science/Engineering \texttt{Cue Answer}タスク上でのストレステストにおいて、タスク依存のCoT監視能力の低下を観察し、他のタスクはより弱いか質的に異なる傾向を示す。
我々の診断では、これらの低下はタスクの難易度、検証パス率、または生成されたトークン長によって完全に説明されていないことを示唆している。
我々のクロスモデル比較では、LoopLMがサイズや深さで一致した非ループ言語モデルよりも体系的に監視できないという証拠は見つからない。
以上の結果から,より深いループ深度はストレステスト中のタスクのCoT監視性を低下させるが,ループトランスアーキテクチャだけでは必ずしも監視性を低下させるとは限らないことが示唆された。
関連論文リスト
- Looped Diffusion Transformer [126.10100109922593]
分割ステップ毎に共有トランスフォーマーブロックを繰り返し実行することで、計算をスケールする別の方法を模索する。
ナイーブループは 画像の質を 常に向上させません
ループ型拡散変換器(Looped Diffusion Transformer, Looped-DiT)を提案する。
論文 参考訳(メタデータ) (2026-09-30T17:52:08Z) - Taming CoT Obfuscation in VLMs: From Mechanistic Evidence to Activation Enforcement [74.92755267784983]
強化学習は、視覚言語モデルにおける推論を改善するが、チェーン・オブ・オファシケーションを誘発することができる。
本稿では, 行動フィードバックとテンプレート関連アクティベーションの標的抑制を組み合わせ, メカニスティック・エンハンスメント(TAME)を用いた標的的アンチ・オブファシケーションを提案する。
VIRL-39k、SPA-VL、および2つのモデルファミリの中で、TAMEはグループ相対政策最適化よりも最大30.9および16.7%のCoT監視性を改善している。
論文 参考訳(メタデータ) (2026-09-21T08:08:56Z) - MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models [17.655317708526603]
大規模言語モデル(LLM)は、最終的な出力に対して必ずしも因果的ではない思考の連鎖(CoT)を生成することができる。
本研究では,LCMのCoT監視性を評価するためのベンチマークである MonitorBench を提案する。
論文 参考訳(メタデータ) (2026-03-30T15:37:42Z) - Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory [11.144603446849674]
CoT(Chain-of- Thought)モニターは、出力が興味のある属性を示す可能性があることを検知する推論トレースを分析するシステムである。
本稿では,CoTと出力の非ゼロな相互情報が必要であるが,CoT監視には不十分であることを示す。
論文 参考訳(メタデータ) (2026-02-20T15:50:30Z) - UniT: Unified Multimodal Chain-of-Thought Test-time Scaling [85.590774707406]
統一モデルは単一のアーキテクチャ内でマルチモーダル理解と生成の両方を扱うことができるが、通常は出力を反復的に書き換えることなく単一のパスで操作する。
マルチモーダルなテストタイムスケーリングのためのフレームワークであるUniTを導入し、単一の統一モデルで複数のラウンドをまたいだ推論、検証、精査を可能にします。
論文 参考訳(メタデータ) (2026-02-12T18:59:49Z) - Understanding the Role of Training Data in Test-Time Scaling [56.12341509545198]
線形回帰のための文脈内重み予測タスクを訓練した変圧器の試験時間スケーリング性能について検討した。
多様な、関連性があり、難しいタスクセットでのトレーニングが、テスト時間のスケーリングに最高のパフォーマンスをもたらすことを示す。
論文 参考訳(メタデータ) (2025-10-04T01:38:48Z) - Beyond Linear Probes: Dynamic Safety Monitoring for Language Models [67.15793594651609]
従来の安全モニタは、クエリ毎に同じ量の計算を必要とする。
動的アクティベーションモニタリングのための線形プローブの自然な拡張であるTrncated Polynomials (TPCs)を紹介する。
我々の重要な洞察は、TPCを段階的に、短期的に訓練し、評価できるということです。
論文 参考訳(メタデータ) (2025-09-30T13:32:59Z) - CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring [3.6284577335311563]
CoT(Chain-of-Thought)モニタリングは、アクションのみの監視がサボタージュを確実に識別できないシナリオにおいて、最大27ポイントの検出を改善する。
CoTトレースはまた、モニターを欺く誤解を招く合理化も含み、より明白なサボタージュケースのパフォーマンスを低下させる。
このハイブリッドモニターは、テストされたすべてのモデルとタスクにわたってCoTとアクションオンリーのモニターを一貫して上回り、微妙な詐欺シナリオに対するアクションオンリーのモニタリングよりも4倍高い速度で検出する。
論文 参考訳(メタデータ) (2025-05-29T15:47:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。