論文の概要: Intermittent Control Is Not Diluted Control: A Switching Effect in Artificial Agency
- arxiv url: http://arxiv.org/abs/2607.17432v1
- Date: Sun, 19 Jul 2026 22:51:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.466066
- Title: Intermittent Control Is Not Diluted Control: A Switching Effect in Artificial Agency
- Title(参考訳): 間欠的制御は希薄ではない:人工知能のスイッチング効果
- Abstract要約: 単純な期待は、これらの条件の間を移動するエージェントは、2つの固定されたケースの重み付き平均のように振る舞うべきであるということである。
この論文は期待を裏切る可能性があることを示している。
状態履歴を保持する模擬適応剤では、間欠的な予測制御へのアクセスは規制の負担を軽減する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adaptive agents do not always regulate under the same timing conditions. Sometimes stabilization can begin before a disturbance has fully entered the internal state; at other times the agent can only recover after disruption has taken hold. A simple expectation is that an agent moving between these conditions should behave like a weighted average of the two fixed cases: the more time spent in reactive recovery, the greater the regulatory burden. This paper shows that expectation can fail. In a simulated adaptive agent with retained state history, at an operating point where sustained reactive control is more costly than sustained anticipatory control, intermittent access to anticipatory control reduces the mean regulatory burden below the value predicted by a fixed-mode mixture. The effect appears under both periodic and stochastic switching schedules: losing anticipatory access does not simply dilute its benefit, and restoring it intermittently can reorganize the later regulatory burden. High-statistics runs (N = 1000 matched replicates per schedule) resolve a negative nonlinear switching penalty across every tested schedule. The effect is small but consistent: about half a percent of the mean gain, with 63-68% of replicates falling below zero. Late-window diagnostics reveal no unresolved upward accumulation of regulatory burden. The result identifies a design-relevant timing principle. In history-dependent adaptive systems, the burden of remaining organized is not set only by how much time an agent spends in each mode; the order in which disturbance and recovery enter the state can change the subsequent burden. Intermittent anticipatory control may therefore act less like a partial failure of regulation than like a mechanism for reducing the long-term burden of recovery.
- Abstract(参考訳): 適応エージェントは、常に同じタイミング条件で規制するとは限らない。
障害が完全に内部状態に入る前に安定化を開始する場合もあり、他の場合では、破壊が保たれた後にのみ回復できる。
単純な予測では、これらの条件の間を移動するエージェントは、2つの固定されたケースの重み付けされた平均として振る舞うべきである。
この論文は期待を裏切る可能性があることを示している。
持続反応性制御が持続性予測制御よりもコストがかかる運転点において、予測制御に対する間欠的アクセスは、固定モード混合により予測される値以下の平均規制負担を低減させる。
この効果は、周期的および確率的な切り替えスケジュールの両方に現れる:予測アクセスを失うことは、単にその利益を減らし、断続的にそれを回復することは、後の規制上の負担を再編成する。
高確率実行 (N = 1000 の一致した複製) は、テストされたスケジュール毎に負の非線形スイッチングペナルティを解消する。
効果は小さいが一貫したものであり、平均利得の約半分、複製の63-68%がゼロ以下である。
遅風診断では、規制負担の未解決の累積は示されていない。
その結果、設計関連タイミング原理が特定される。
歴史に依存した適応システムでは、残される組織的負担は、エージェントが各モードにどれだけの時間を費やしているかによってのみ設定されるのではなく、障害や回復が状態に入る順序は、その後の負担を変える可能性がある。
したがって、断続的な予測制御は、回復の長期的負担を軽減するメカニズムよりも、規制の部分的な失敗のように振る舞うことができる。
関連論文リスト
- One Gate Is Not Enough: Composing Stateful Pre-Action Controls for Agentic AI [0.0]
1つのコントロールが適用した修復は、他のコントロールが評価するアクション、エビデンス、コンテキストを変更し、そのコントロールの以前の判断を無効にすることができることを示す。
我々は、この結合を形式化し、現在の有界等質な設定において、アクションごとの音質を復元するremediate-and-regateプロトコルを提供する。
これは、生産の頻度に関する主張ではなく、合成メタデータ層によるオープンペイロードデータに対するメカニズム実証である。
論文 参考訳(メタデータ) (2026-08-18T22:24:44Z) - Residual Dominance as a Structural Account of Last-Item Reliance in Causal Self-Attention Recommenders [47.8060666024071]
我々は,SASRecスタイルのモデルが,局所的な終点依存を示すことを示す。
その後、残余加算は全ブロック表現を同位置寄与に急変させる。
残留強度を変化させると、構造混合と終点依存との間のモノトニックなトレードオフが生じる。
論文 参考訳(メタデータ) (2026-08-14T07:09:58Z) - Verification of Adaptive Agentic Controllers through Finite Rule Revision [0.0]
本稿では,有限記号規則で表される適応エージェント制御系に対する有界検証プロトコルを定式化する。
診断の失敗は、ルールの追加、ルール削除、優先度修正など、事前に定義されたルールレベルの編集にマップされる。
修理されたコントローラは、保持されたシミュレーションシードまたはクローンされた初期状態に基づいて評価される。
論文 参考訳(メタデータ) (2026-07-07T13:38:01Z) - When Regulation Has Memory: Hysteresis and Control Burden in Artificial Agency [0.0]
2つの系は同様の内部状態に到達し、一方はそこに到達するためにはるかに正確な制御を必要とする。
適応不確実性規制の計算モデルを用いて、その負担が歴史に依存するかどうかを検討する。
その結果、適応エージェントは組織化されているかどうかだけでなく、どの程度の規制を採用すべきかによって評価されるべきであることが示唆された。
論文 参考訳(メタデータ) (2026-06-29T23:19:26Z) - Delayed Verification Destabilizes Multi-Agent LLM Belief: Instability Thresholds and Optimal Corrector Placement [0.0]
マルチエージェント大言語モデル(LLM)システムは、幻覚を抑制するために検証エージェントや批判エージェントに頼っていることが多い。
この遅延の間、偽のクレームはエージェントネットワークを介して伝播する。
我々はこの過程を、接地された修正ノードを持つグラフ上の遅延コンセンサスとしてモデル化する。
論文 参考訳(メタデータ) (2026-06-25T10:52:54Z) - Authority-Level Priors: An Under-Specified Constraint in Hierarchical Predictive Processing [0.0]
オーソリティ・レベル優先(英: Authority-Level Priors、ALP)は、アイデンティティレベルの仮説の規制が許容できるサブセットを定義するメタ構造制約である。
ALPは、追加の表現状態や精度よりも高優先度であり、規制制御に許容される仮説を制約している。
計算形式化は、認可された仮説によって生成されるポリシーに対するポリシー最適化を制限する。
論文 参考訳(メタデータ) (2026-03-19T13:27:47Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning [67.45237332694025]
グループ相対政策最適化は、複雑な推論に基づいて言語モデルを訓練するのに効果的である。
Weakly Supervised GRPOを提案し、端末報酬を正当性を考慮したガイダンスに変換することにより、ロールアウト効率を向上させる。
論文 参考訳(メタデータ) (2026-02-19T02:43:35Z) - Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction [4.323124094061299]
リアルタイムのシーケンシャル制御エージェントは、しばしば推論遅延によってボトルネックとなる。
本稿では,TD-MPC2を用いたモデルベース制御に投機的実行の予測理論を適応させるフレームワークを提案する。
提案手法は,500から282までの計画推測数を削減し,エンドツーエンドのステップ遅延を25%改善し,リターン率をわずか7.1%に抑えた強い制御性能を維持した。
論文 参考訳(メタデータ) (2025-12-19T05:34:52Z) - Efficient Reinforcement Learning with Impaired Observability: Learning
to Act with Delayed and Missing State Observations [92.25604137490168]
本稿では,制御系における効率的な強化学習に関する理論的研究を紹介する。
遅延および欠落した観測条件において,RL に対して $tildemathcalO(sqrtrm poly(H) SAK)$ という形でアルゴリズムを提示し,その上限と下限をほぼ最適に設定する。
論文 参考訳(メタデータ) (2023-06-02T02:46:39Z) - Forecasting Particle Accelerator Interruptions Using Logistic LASSO
Regression [62.997667081978825]
インターロックと呼ばれる予期せぬ粒子加速器の割り込みは、必要な安全対策にもかかわらず、突然の運用変更を引き起こす。
このような中断を予測することを目的とした,単純かつ強力なバイナリ分類モデルを提案する。
このモデルは、少なくとも絶対収縮と選択演算子によって罰せられるロジスティック回帰として定式化される。
論文 参考訳(メタデータ) (2023-03-15T23:11:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。