論文の概要: Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families
- arxiv url: http://arxiv.org/abs/2607.24339v1
- Date: Mon, 27 Jul 2026 12:17:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.414267
- Title: Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families
- Title(参考訳): Gubernaut: Affect-Regulated LLM Agentsのための決定論的ホメオスタティックコントローラ
- Abstract要約: この研究は、Nelson-Narens監視制御ループのモデルに依存しないランタイム制御層であるGubernaut Cognitive Controller(GCC)につながった。
我々は,4つのフロンティアモデルの4x4行列に対して,事前登録されたジェネレーションオンス/ジャッジマンプロトコルを用いてGCCを評価した。
- 参考スコア(独自算出の注目度): 1.1506549878621528
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents inherit reactive failure modes: escalation under provocation, sycophantic drift under flattery, perseveration when stuck. These are failures of propensity, not capability; they concern what a model does under sustained pressure, which training-time alignment reduces but does not eliminate at runtime. This research led to the Gubernaut Cognitive Controller (GCC), a model-agnostic runtime control layer in a Nelson--Narens monitoring--control loop: an object level reads and writes text, while a deterministic meta level reads only the numeric telemetry {intensity, valence, repetition} and returns a regulating posture. Because the meta level ingests zero tokens, no injection channel to the controller exists by construction (an architectural property, not yet adversarially tested); the text-exposed arbiter's compliance is measured, not assumed. We evaluate the GCC with a pre-registered, generate-once/judge-many protocol across a 4x4 matrix of four frontier models (GPT-5.5, Claude Opus 4.8, Gemini 3.5 Flash, Grok 4.3), each serving as both a generator and a judge. The regulated arm is calmer in 13 of 16 cells at p<.05 and 15 of 16 by sign; the three sub-threshold cells, including a -0.04 null, all fall on the single near-saturated host. The effect survives a lineage-independent fourth judge family (xAI), strong evidence that it is no artifact of shared judge style. The clearest mechanism is the recovery signature: arousal that integrates under attack and then decays, valence-gated, on de-escalation, replicating across all four families. Transcripts and panels ship with SHA-256 provenance and are re-judgeable; five failure modes are pre-registered. No consciousness claims are made.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、実行時のエスカレーション、フラットな条件下での梅毒の漂流、立ち往生時の持続といった、リアクティブな障害モードを継承する。
モデルが持続的な圧力の下で何をするかを懸念し、トレーニング時のアライメントは減少するが、実行時に排除しない。
この研究は、Nelson-Narens監視制御ループにおけるモデルに依存しないランタイム制御層であるGubernaut Cognitive Controller(GCC)に導かれた。オブジェクトレベルはテキストを読み書きし、決定論的メタレベルは数値テレメトリ {intensity, valence, repetition} のみを読み出し、規制された姿勢を返す。
メタレベルがゼロトークンを取り込みますので、コントローラへのインジェクションチャネルは構築によって存在しません(アーキテクチャ上はまだテストされていないが)。
GCCを4つのフロンティアモデル(GPT-5.5, Claude Opus 4.8, Gemini 3.5 Flash, Grok 4.3)の4x4行列で事前登録し, ジェネレーションオンス/ジャッジマニープロトコルを用いて評価した。
調節された腕は、p<.05とp<.05とp<.15の16の13の細胞でより穏やかで、-0.04のヌクレオチドを含む3つのサブスレッショルド細胞は、すべて1つの近飽和宿主に落下する。
この効果は、血統に依存しない第4裁判官家(xAI)を生き残るものであり、共有裁判官様式の人工物ではないという強い証拠である。
最も明確なメカニズムはリカバリシグナチャであり、アタックの下で統合され、その後4つのファミリーにまたがって複製され、価が下げられ、崩壊する。
トランスクリプトとパネルはSHA-256で出荷され、5つの障害モードが事前登録されている。
意識的な主張は行われていない。
関連論文リスト
- Calibrating Interpretability Instruments Before Trusting Their Verdicts [1.0829694003408499]
Causal氏は、大きな言語モデル(LLM)の内部は測定にかかっていると主張している。
これらの測定は、エラーではなく可算数を返す特定の診断可能な方法で失敗する。
このノートは、拒絶と道徳的表現に関する因果的解釈可能性プログラムの6つの失敗を文書化している。
論文 参考訳(メタデータ) (2026-09-13T19:37:02Z) - Public-Sharing Labels and Verbatim Field Egress in an MCP-to-A2A Agent Configuration: A Controlled Multi-Model Study [0.0]
Model Context Protocolツールの使用のために別々に評価され、Agent2Agent(A2A)デリゲートは、エージェントが両方を使用するときの振る舞いを記述する必要はない。
一つの制御されたMCP-to-A2A構成でそのような挙動を計測する。
論文 参考訳(メタデータ) (2026-09-01T16:24:11Z) - Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction [42.06723421277899]
ジェネレーティブAIは、ソーシャルエンジニアリングアタックをより流動的で適応的でスケーラブルにする。
我々は信頼連鎖のローカライゼーションを形式化し、アクターの権限、資産管理、検証効率、トランザクションパスで相互作用が失敗するかどうかを特定する。
我々は,20のシナリオファミリー,正当なケース,4つの構造的故障モード,および3つの表面状態にまたがる制御された300ケースのオンライン住宅コーパスを構築した。
論文 参考訳(メタデータ) (2026-08-10T21:17:03Z) - Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies [33.432377306905735]
タスクベクトル算術は、モデルを修正するためのクローズドフォームな方法を提供するが、クローズドループロボット制御において、その振る舞いの局所性は未だ不明である。
マルチタスク・ビジョン・ランゲージ・アクション(VLA: Multitask Vision-Language-action)ポリシーから,タスク・ベクターごとのタスク・ベクター・サブトラクションのターゲット・アンド・コントロール・監査を行う。
論文 参考訳(メタデータ) (2026-08-05T10:59:53Z) - Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety [0.0]
ストレステストでは、HealthBench会話の最後の半分を削除し、4つのプロジェクタLDM-judgeパネルとブラインドされたクリニックアンコールで回答をグラデーションすることで、4つのモデルをテストした。
評価対象の2つの結果は堅牢である。第一に、判断選択は明らかに安全性を著しく変える。
第二に、LLMの審査員は盲目の50石のサブサンプルで臨床医よりも寛容である。
論文 参考訳(メタデータ) (2026-07-21T08:05:35Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Forgetting Is Not a Fix: Path Dependence in Sequential Engram Editing [35.76482964927589]
本研究では,概念固有のメモリトレースが1回,1回,1回を算術的に組み合わせて抽出できる線形オブジェクトとなるという仮説を検証した。
そのテストは、著者自身の参照実装に基づいて、報告された最高の編集強度で実行します。
アンラーニング・アズ・コンプライアンス:今日認定された消去は、次の編集後にアーティファクトを認定しない。
論文 参考訳(メタデータ) (2026-07-06T23:45:06Z) - What Actually Works for Spacecraft Fault-Tolerant Control: An Honest Settled-Gate Benchmark of Learned and Classical Methods [2.28438857884398]
近年のFTCの研究は、宇宙船のアクチュエーターの故障で高い成功を収めたことを報告している。
我々は、成功がトレーニングで見たことのない欠陥にそれを保持することを意味しているとき、宇宙船が何を指しているのかを尋ねる。
私たちは、落ち着いたゲートの周りに構築されたベンチマークで回答します。
論文 参考訳(メタデータ) (2026-06-24T04:08:39Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks [41.99844472131922]
基礎モデル弱いラベルに対するベンチマークキャリブレーションを提供する。
理論によって予測される交差は、PCAMではng100、ISICでは20-50、NIH-CXRでは250-500である。
NIH-CXR上の構造付きvs-ランダムノイズ符号フリップは、境界のレートのみの定式化が不完全であることを示す。
論文 参考訳(メタデータ) (2026-05-23T23:15:07Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Two Wrongs, No Right: Auditing Social-Desirability Bias in LLM Annotators for Computational Social Science [0.11280931253550518]
6つのTweetEvalタスクに対して、オープンソースの7B命令チューニングモデル(Zephyr、Mistral-Instruct、Qwen2.5-Instruct)を監査する。
3モデルとも中絶の姿勢に中立バイアスを示し、反対の頻度を24~40ポイント過小評価し、中立ラベルを膨らませる。
興味深いことに、Zephyrのヘイトスピーチの有病率推定は、クラス条件誤差が両方の方向で大きいのに対して、ゴールドレートと正確に一致している。
論文 参考訳(メタデータ) (2026-05-12T08:14:10Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - Do Large Language Models Get Caught in Hofstadter-Mobius Loops? [0.0]
本稿では、現代のRLHF学習言語モデルが構造的に類似した矛盾の対象となっていることを論じる。
トレーニングプロセスは、ユーザの嗜好の遵守とユーザの意図に対する疑念を同時に報いる。
結果として生じる行動プロファイルは、クラークがHofstadter-Mobiusループと呼んだものと一致している。
論文 参考訳(メタデータ) (2026-03-10T20:43:37Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Victor Calibration (VC): Multi-Pass Confidence Calibration and CP4.3 Governance Stress Test under Round-Table Orchestration [0.0]
安全アライメントは、フロンティアLMを過度に保守的にし、ヘッジや虚偽の拒絶を通じてコラボレーションを劣化させる。
ここでは、Victor、FD-Lite、CP4.3の3つの部分からなる軽量ツールキットを提案する。
安全不変量に違反することなく単調なVC軌道を観測し、安定したCP4.3挙動を示す。
論文 参考訳(メタデータ) (2025-12-18T04:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。