論文の概要: Heterogeneous Agent Cohorts for Safe Open-Ended Exploration with Runtime Constraint Memory
- arxiv url: http://arxiv.org/abs/2607.11226v1
- Date: Mon, 13 Jul 2026 08:17:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.393927
- Title: Heterogeneous Agent Cohorts for Safe Open-Ended Exploration with Runtime Constraint Memory
- Title(参考訳): 実行時制約メモリを用いた安全なオープンエンド探索のための異種エージェントコホート
- Abstract要約: 創造性と注意の両方をジャグリングするために単一のモデルを強制するのではなく、私たちは、特定の役割にまたがる懸念を分離します。
Disrupterは異例のプロポーザルを生成し、バリケータはツールゲートウェイでハードランタイムチェックを実行し、Brokerは遠いが関連するアナロジーをプルする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents today are caught in an awkward bind. Lock them down with static safety instructions and they rarely venture beyond the obvious; give them free reign with tools and multi-agent debate, and safety violations quickly follow. Rather than forcing a single model to juggle both creativity and caution, we separate the concerns across specialized roles. A Disrupter generates unconventional proposals, a Validator enforces hard runtime checks at the tool gateway, and a Broker pulls in distant but relevant analogies. Failures are not discarded -- they are compiled, via MCTS, into compact, signed constraint patches we call Scars. These patches are cached locally and inherited by future cohorts, turning repeated failures into reusable, low-cost runtime constraints. In a spatial-semantic sandbox (N=20 runs, p<0.01), our cohort reaches remote targets where debate fails, the Validator prevents all executed breaches, and Scars reduce token consumption by 15.1% by avoiding redundant validator checks. Furthermore, credit-based Communication Allocation Scores (CAS) restrict outbound bandwidth, reducing overall token costs by 55.9% under resource constraints.
- Abstract(参考訳): 今日LLMエージェントは、ぎこちない結合に巻き込まれます。
ツールとマルチエージェントの議論による自由な支配を与え、安全違反はすぐに続く。
創造性と警告の両方をジャグリングするために単一のモデルを強制するのではなく、私たちは、特定の役割にまたがる懸念を分離します。
Disrupterは従来とは違う提案を生成し、Validatorはツールゲートウェイでハードランタイムチェックを実行し、Brokerは遠いが関連するアナロジーをプルする。
失敗は捨てられません -- MCTS経由で、Scarsと呼ばれるコンパクトで署名された制約パッチにコンパイルされます。
これらのパッチはローカルにキャッシュされ、将来のコホートによって継承される。
空間意味サンドボックス(N=20 run, p<0.01)では,コホートは議論が失敗するリモートターゲットに到達し,バリケータは全ての違反を防止し,Scarは冗長なバリケータチェックを回避してトークン消費を15.1%削減する。
さらに、クレジットベースの通信割当スコア(CAS)はアウトバウンド帯域幅を制限し、全体のトークンコストをリソース制約下で55.9%削減する。
関連論文リスト
- Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle [65.6642776933861]
この介入点付近で成長した保護パラダイムについて検討する。
ほとんどの保護は、主に静的あるいは弱い適応的な敵に対して検証されている。
我々は、堅牢で構成可能で、デプロイ可能な所有者側の保護のために、クロスステージ対策とオープンな問題を統合することで、閉鎖する。
論文 参考訳(メタデータ) (2026-08-05T00:46:50Z) - Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents [76.4694046738862]
TokenWallは、エージェントトークンフローのセマンティックファイアウォールとして機能するランタイム防衛フレームワークである。
TokenWallは攻撃成功率を12.5%に抑えつつ、97.4%の良質なパスレートを維持している。
論文 参考訳(メタデータ) (2026-07-09T12:18:40Z) - Governed Caste Reassignment in Heterogeneous Swarms: An Asymmetric-Trust Protocol with Audited Operator Countersignature [7.392721604463545]
規制された実施のためには、キャスターの変更によってロボットの特権エンベロープが上昇することは、監査可能で外部から認可されたガバナンスイベントである、と我々は主張する。
非対称トラストプロトコルを提案する: 自動密着型再割り当ては自動的に許可されるが、有界緩和には演算子対応が必要である。
我々は,最大100台のロボットに対して,実際のEd25519シグネチャによる参照実装を評価する。
論文 参考訳(メタデータ) (2026-07-06T03:34:07Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - GoAT-X: A Graph of Auditing Thoughts for Securing Token Transactions in Cross-Chain Contracts [52.51342355102833]
マルチチェーンエコシステムの重要な基盤であるクロスチェーンブリッジは、攻撃者にとって主要なターゲットとなっている。
バイトコードレベルの静的解析のような既存の防御は、チェーン間の相互作用のセマンティックな複雑さを扱うには不十分である。
パターンマッチングから体系的な第一原理検証へ自動的なクロスチェーンスマートコントラクト監査を移行するフレームワークであるGoAT-Xを提案する。
論文 参考訳(メタデータ) (2026-04-27T11:34:21Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Verifier-Bound Communication for LLM Agents: Certified Bounds on Covert Signaling [0.0]
言語モデルエージェントを結合することで、ポリシーに準拠したメッセージの調整を表面レベルで隠蔽することができる。
生成と受け入れを分離するプロトコルであるCLBCを提案する。
このプロトコルは、遅延リークと明示的な残留チャネルの観点から、転写リークの上限をいかに高めるかを示す。
論文 参考訳(メタデータ) (2026-02-27T23:42:37Z) - Beyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM Agents [31.789859492703016]
エージェント・ツール通信ループは、Large Language Model (LLM)エージェントにおけるクリティカルアタックサーフェスである。
既存のDoS(DoS)攻撃は、この新しいパラダイムには効果がない。
正常に完了したタスクのヒントのもと、ツール層で機能するステルスで多ターンの経済DoS攻撃を導入する。
論文 参考訳(メタデータ) (2026-01-16T02:47:45Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - GCP: Guarded Collaborative Perception with Spatial-Temporal Aware Malicious Agent Detection [11.336965062177722]
協調的知覚は、悪意のあるエージェントからの敵対的なメッセージ攻撃に対して脆弱である。
本稿では,既存の単発外乱検出手法を損なう新しい盲検領域混乱(BAC)攻撃を明らかにする。
本稿では、空間的時間的認識による悪意のあるエージェント検出に基づくガード付き協調認識フレームワークを提案する。
論文 参考訳(メタデータ) (2025-01-05T06:03:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。