論文の概要: 'Neural howlround' in large language models: a self-reinforcing bias phenomenon, and a dynamic attenuation solution
- arxiv url: http://arxiv.org/abs/2504.07992v1
- Date: Mon, 07 Apr 2025 18:30:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-04-22 01:03:45.017931
- Title: 'Neural howlround' in large language models: a self-reinforcing bias phenomenon, and a dynamic attenuation solution
- Title(参考訳): 大規模言語モデルにおける「ニューラルハウルラウンド」-自己強化バイアス現象と動的減衰解
- Abstract要約: 大規模言語モデル(LLM)駆動型AIシステムは、ニューラルハウルラウンドと呼ばれる推論失敗モードを示す可能性がある。
本稿では,動的に反バランス調整を導入し,適応的推論を復元できる減衰に基づく補正機構を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language model (LLM)-driven AI systems may exhibit an inference failure mode we term `neural howlround,' a self-reinforcing cognitive loop where certain highly weighted inputs become dominant, leading to entrenched response patterns resistant to correction. This paper explores the mechanisms underlying this phenomenon, which is distinct from model collapse and biased salience weighting. We propose an attenuation-based correction mechanism that dynamically introduces counterbalancing adjustments and can restore adaptive reasoning, even in `locked-in' AI systems. Additionally, we discuss some other related effects arising from improperly managed reinforcement. Finally, we outline potential applications of this mitigation strategy for improving AI robustness in real-world decision-making tasks.
- Abstract(参考訳): 大規模言語モデル(LLM)駆動型AIシステムは、ある種の高度に重み付けされた入力が支配的な自己強化認知ループである「ニューラルハウルラウンド(neural howlround)」と呼ばれる推論失敗モードを示す可能性がある。
本稿では, モデル崩壊と偏りのある塩分重み付けとは異なる, この現象のメカニズムを考察する。
我々は,動的に反バランス調整を導入し,適応推論を「ロックイン」なAIシステムでも復元できる減衰に基づく補正機構を提案する。
さらに,不適切に管理された強化による他の影響についても検討する。
最後に、実世界の意思決定タスクにおいて、AIの堅牢性を改善するためのこの緩和戦略の潜在的な応用について概説する。
関連論文リスト
- The Dynamic-Probabilistic Consistency Gap in Chaotic Surrogate Modeling [12.99285218442082]
動的システム再構成は、時系列データに基づく動的データをキャプチャする代理モデルを学ぶことを目的としている。
有限ホライズン確率的目的の追求は、それが反映すべき局所力学から、ダイナミクスを分解したり、予測の不確実性を分離することができることを示す。
局所的な予測残差の確率を評価するフィルタベースのトレーニングフレームワークであるKAFFEEを提案する。
論文 参考訳(メタデータ) (2026-05-29T17:04:15Z) - Adaptive Equilibrium: Dynamic Weighting Framework for Generalized Interruption of DeepFake Models [24.55206893241103]
我々は、高度で均一な効率を達成するためには、適応均衡に達することでこの不均衡を解決する必要があると論じる。
本稿では、リアルタイム損失フィードバックを利用した動的重み付け機構を用いて、最も耐性のあるモデルにより大きな割り込み重み付けを適応的に割り当てるAdaptive Equilibrium Framework(AEF)を提案する。
論文 参考訳(メタデータ) (2026-05-01T06:19:59Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges [87.04241991512386]
本稿では、報酬ハッキングを理解するための統一フレームワークとして、PCH(Proxy Compression hypothesis)を提案する。
この観点では、報酬のハッキングは、客観的圧縮、最適化増幅、評価器-政治共適応の相互作用から生じる。
この視点は、RLHF、RLAIF、RLVR体制をまたいだ経験的現象を統一し、局所的ショートカット学習がより広範な誤認識へと一般化する方法について説明している。
論文 参考訳(メタデータ) (2026-04-15T08:11:34Z) - Causally constrained reduced-order neural models of complex turbulent dynamical systems [0.6094969391643746]
乱流系の低次ニューラルエミュレータにおいて,応答理論とスコアマッチングに基づくフレキシブルなフレームワークを導入し,非因果依存性を抑制する。
本稿では,低周波大気変動のプロトタイプとしてCharney-DeVoreモデルを用いたアプローチを紹介する。
論文 参考訳(メタデータ) (2026-02-14T18:43:52Z) - On the Limits of Self-Improving in LLMs and Why AGI, ASI and the Singularity Are Not Near Without Symbolic Model Synthesis [0.01269104766024433]
我々は,大規模言語モデル(LLM)における自己学習と生成AIを離散時間力学系として定式化する。
1) 有限サンプリング効果が分布多様性の単調な損失(モード崩壊)を引き起こすエントロピー減衰と,(2) 外部グラウンドの損失がモデルの真理表現をランダムウォークとして漂流させる変数増幅の2つの基本的障害モードを導出する。
論文 参考訳(メタデータ) (2026-01-05T19:50:49Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories [58.988535279557546]
適応推論トラジェクトリを用いたtextbf sycophancy Mitigation を提案する。
SMARTは,分布外の入力に対して強い性能を維持しながら,サイコファンティクスの挙動を著しく低下させることを示した。
論文 参考訳(メタデータ) (2025-09-20T17:09:14Z) - Certified Neural Approximations of Nonlinear Dynamics [52.79163248326912]
安全クリティカルな文脈では、神経近似の使用は、基礎となるシステムとの密接性に公式な境界を必要とする。
本稿では,認証された一階述語モデルに基づく新しい,適応的で並列化可能な検証手法を提案する。
論文 参考訳(メタデータ) (2025-05-21T13:22:20Z) - Model Hemorrhage and the Robustness Limits of Large Language Models [119.46442117681147]
大規模言語モデル(LLM)は、自然言語処理タスク全体で強力なパフォーマンスを示すが、デプロイメント用に修正された場合、大幅なパフォーマンス低下を経験する。
この現象をモデル出血(パラメータ変更とアーキテクチャ変更によるパフォーマンス低下)と定義する。
論文 参考訳(メタデータ) (2025-03-31T10:16:03Z) - Cognitive Activation and Chaotic Dynamics in Large Language Models: A Quasi-Lyapunov Analysis of Reasoning Mechanisms [6.375329734462518]
本稿では,大規模言語モデルの推論機構の本質を明らかにする「認知活性化理論」を提案する。
実験により、モデルの情報の蓄積は非線形指数法則に従っており、Multilayer Perceptron (MLP) は最終的な出力においてより高い割合を占めることが示された。
本研究は, LLMの推論の解釈可能性に関するカオス理論の枠組みを提供し, モデル設計における創造性と信頼性のバランスをとるための潜在的経路を明らかにする。
論文 参考訳(メタデータ) (2025-03-15T08:15:10Z) - Superficial Self-Improved Reasoners Benefit from Model Merging [49.09091498084467]
高品質データコーパスの合成ソリューションとしての自己改善
特に,本分析の結果から,LMがドメイン内推論の精度を向上したとしても,それらの一般的な推論能力を損なうことが判明した。
提案手法は,オリジナルモデルと自己改善モデルとの重みを戦略的に組み合わせ,一般化を保ちながら反復モデルマージング(IMM)を提案する。
論文 参考訳(メタデータ) (2025-03-03T22:41:25Z) - Causality can systematically address the monsters under the bench(marks) [64.36592889550431]
ベンチマークはさまざまなバイアス、アーティファクト、リークに悩まされている。
モデルは、調査の不十分な障害モードのため、信頼できない振る舞いをする可能性がある。
因果関係はこれらの課題を体系的に解決するための 理想的な枠組みを提供します
論文 参考訳(メタデータ) (2025-02-07T17:01:37Z) - Generative Intervention Models for Causal Perturbation Modeling [80.72074987374141]
多くの応用において、システムのメカニズムが外部の摂動によって変更されるかは未定である。
本稿では、これらの摂動特徴を原子間干渉による分布にマッピングする方法を学習する生成的介入モデル(GIM)を提案する。
論文 参考訳(メタデータ) (2024-11-21T10:37:57Z) - Self-Healing Machine Learning: A Framework for Autonomous Adaptation in Real-World Environments [50.310636905746975]
実世界の機械学習システムは、基礎となるデータ生成プロセスの分散シフトによって、モデルの性能劣化に遭遇することが多い。
概念のドリフト適応のような既存のシフトへのアプローチは、その理性に依存しない性質によって制限される。
我々はこれらの制限を克服するために自己修復機械学習(SHML)を提案する。
論文 参考訳(メタデータ) (2024-10-31T20:05:51Z) - Disentangling the Causes of Plasticity Loss in Neural Networks [55.23250269007988]
可塑性の喪失は複数の独立したメカニズムに分解できることを示す。
種々の非定常学習タスクにおいて, 層正規化と重み劣化の組み合わせは, 可塑性維持に極めて有効であることを示す。
論文 参考訳(メタデータ) (2024-02-29T00:02:33Z) - Enhancing Dynamical System Modeling through Interpretable Machine
Learning Augmentations: A Case Study in Cathodic Electrophoretic Deposition [0.8796261172196743]
本稿では,物理システムのモデリング向上を目的とした包括的データ駆動フレームワークを提案する。
実証的応用として,電顕的電気泳動沈着(EPD)のモデル化を追求する。
論文 参考訳(メタデータ) (2024-01-16T14:58:21Z) - Interpretable Imitation Learning with Dynamic Causal Relations [65.18456572421702]
得られた知識を有向非巡回因果グラフの形で公開することを提案する。
また、この因果発見プロセスを状態依存的に設計し、潜在因果グラフのダイナミクスをモデル化する。
提案するフレームワークは,動的因果探索モジュール,因果符号化モジュール,予測モジュールの3つの部分から構成され,エンドツーエンドで訓練される。
論文 参考訳(メタデータ) (2023-09-30T20:59:42Z) - Impact of conditional modelling for a universal autoregressive quantum
state [0.0]
ニューラルネットワークにおける畳み込み層の類似体としてフィルタを導入し、任意の量子状態に翻訳的対称性付き相関を組み込む。
得られた帰納バイアスが変動柔軟性,対称性,保存量に与える影響を解析した。
論文 参考訳(メタデータ) (2023-06-09T14:17:32Z) - Improving Adversarial Robustness of DEQs with Explicit Regulations Along
the Neural Dynamics [26.94367957377311]
ディープ・平衡(DEQ)モデルは、従来のディープ・ネットワークの多重層積み重ねを単一層変換の固定点反復で置き換える。
既存の作業は、広く使われている対戦訓練(AT)フレームワークで一般的なDECモデルの堅牢性を改善するが、DECモデルの構造的特異性を利用するには至らなかった。
ニューラルダイナミクスに沿って入力を段階的に更新することで予測エントロピーを低減することを提案する。
我々の手法はDECモデルのロバスト性を大幅に向上させ、強力なディープネットワークベースラインよりも優れています。
論文 参考訳(メタデータ) (2023-06-02T10:49:35Z) - Dynamics with autoregressive neural quantum states: application to
critical quench dynamics [41.94295877935867]
本稿では、量子系の長時間のダイナミクスを安定的に捉えるための代替の汎用スキームを提案する。
二次元量子イジングモデルにおけるキブル・ズレーク機構の解明により,時間依存性のクエンチ力学にこのスキームを適用した。
論文 参考訳(メタデータ) (2022-09-07T15:50:00Z) - Gradient Starvation: A Learning Proclivity in Neural Networks [97.02382916372594]
グラディエント・スターベーションは、タスクに関連する機能のサブセットのみをキャプチャすることで、クロスエントロピー損失を最小化するときに発生する。
この研究は、ニューラルネットワークにおけるそのような特徴不均衡の出現に関する理論的説明を提供する。
論文 参考訳(メタデータ) (2020-11-18T18:52:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。