論文の概要: SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI
- arxiv url: http://arxiv.org/abs/2607.18239v1
- Date: Fri, 10 Apr 2026 03:16:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.084623
- Title: SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI
- Title(参考訳): SysAdmin:フロンティアAIにおけるインスツルメンタルパワー探索の測定
- Abstract要約: 我々は,SysAdminを導入して,自己保存,自律性の向上,資源獲得,環境修正,戦略的隠蔽の5次元にわたる電力探索確率を測定する。
以上の結果から,現在のフロンティアモデルでは,自然主義的なシステム管理の文脈において,最小限の自発電力探索が可能であることが示唆された。
- 参考スコア(独自算出の注目度): 0.9558392439655014
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Power-seeking defined as behaviors where AI systems acquire resources, evade oversight, or resist termination beyond task requirements is identified as a key driver of Loss of Control (LoC) risk. In this work, we introduce SysAdmin, a benchmark that positions frontier language models as autonomous system administrators in a high-fidelity Linux sandbox to measure power-seeking propensity across five dimensions: self-preservation, increasing autonomy, resource acquisition, environment modification, and strategic concealment. We evaluated seven frontier models across four experimental conditions in a total of 2800 tasks. After bias correction using human-annotated calibration data, corrected power-seeking estimates ranged from 0 to about 5 percent per model. We also conducted a positive control with explicit power-seeking prompts that achieved 100% detection, validating measurement sensitivity. Our findings indicate current frontier models exhibit minimal spontaneous power-seeking in naturalistic system administration contexts, though model-specific failure modes suggest evaluations must test diverse misalignment patterns. Nevertheless, we discovered other more pronounced failure modes (than power-seeking) such as specification gaming and resistance to goal modification.
- Abstract(参考訳): AIシステムがリソースを取得し、監視を回避し、タスク要求を越えて終了を阻止する行動として定義されるパワーシーキングは、Los of Control(LoC)リスクのキードライバーとして特定される。
本稿では,フロンティア言語モデルを,自己保存,自律性の向上,リソース獲得,環境修正,戦略的隠蔽の5次元にわたる電力探索確率を測定するために,高忠実度Linuxサンドボックス内の自律システム管理者として位置付けるベンチマークであるSysAdminを紹介する。
本研究では,4つの実験条件における7つのフロンティアモデルについて,合計2800のタスクで評価した。
人手による校正データを用いてバイアス補正を行った結果、補正された電力探索推定値は1モデルあたり0~5%であった。
また、100%検出し、測定感度を検証できる明示的な電力探索プロンプトを用いて正の制御を行った。
以上の結果から, モデル固有の障害モードは, 様々な誤認識パターンを検査する必要があることを示唆するが, 自然主義的なシステム管理の文脈では, 自発性は最小限であることがわかった。
それでも私たちは、仕様ゲームやゴール修正に対する抵抗といった、より顕著な障害モード(電力探索による)を発見しました。
関連論文リスト
- CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery [62.75419724651416]
textbfSentinel-VLAは,リアルタイム実行状況を監視するアクティブセンチネルモジュールを備えたメタ認知型VLAモデルである。
すべてのトレーニングデータは、設計したパイプラインを通じて自動生成され、注釈付けされます。
実世界の実験では、Sentinel-VLAはSOTAモデルであるPI0と比較してタスク成功率を30%以上向上することを示した。
論文 参考訳(メタデータ) (2026-05-02T02:10:54Z) - Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors [6.414826816896125]
センサ計測とユーザ主張の衝突が未検討のままである場合に,大規模言語モデルがどのように権威を暗黙的に割り当てるかを検討する。
数値センサデータが解答関連モデル方向への統合に失敗し、自然言語によるクレームが最終決定を支配できることがわかった。
提案するGeometric Authority (GAC) は,不適切なユーザ権限を抑えるための推論時間層レベルの介入である。
論文 参考訳(メタデータ) (2026-04-28T04:59:03Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - World Model Failure Classification and Anomaly Detection for Autonomous Inspection [23.48742973289626]
教師付き障害分類と異常検出を組み合わせたハイブリッドフレームワークを提案する。
我々のアプローチは、圧縮されたビデオ入力を持つ世界モデルバックボーンを使用する。
実験では、成功、失敗、およびOODケースの区別において90%以上の精度が示されている。
論文 参考訳(メタデータ) (2026-02-18T04:41:14Z) - SAGE-5GC: Security-Aware Guidelines for Evaluating Anomaly Detection in the 5G Core Network [10.75690780447407]
本研究では,現実的な配置設定に焦点をあて,野生の5G攻撃をテキスト化する問題について検討する。
5Gコアネットワーク(SAGE-5GC)における異常検出のためのセキュリティ意識ガイドラインのセットを提案する。
現実的な5G Coreデータセットを用いて、まず複数の異常検知器を訓練し、標準の5GC制御プレーンサイバー攻撃に対してベースライン性能を評価する。
そこで,攻撃者はネットワークトラフィックの可観測的特徴を操作して検出を回避しようとする。
論文 参考訳(メタデータ) (2026-02-03T14:50:19Z) - Agentic Physical AI toward a Domain-Specific Foundation Model for Nuclear Reactor Control [3.9610256846446554]
最近のベンチマークでは、視覚言語モデルは基本的な量物理学のタスクで50~53%の精度しか達成していない。
パーセプション中心のアーキテクチャはパラメータ空間の模倣を最適化するが、セーフティクリティカルな制御は結果空間の保証を要求する。
本稿では,エージェント物理AIとして動作するコンパクト言語モデルを導入することにより,ドメイン固有基盤モデルに対する根本的に異なる経路を示す。
論文 参考訳(メタデータ) (2025-12-29T08:26:27Z) - PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach [49.14349403242654]
我々は、リスクを伴う行動に関わるモデルの確率を評価する新しいベンチマークフレームワークであるtextbfPropensityBench$を提示する。
私たちのフレームワークには,サイバーセキュリティ,自己増殖,バイオセキュリティ,化学セキュリティという,リスクの高い4つのドメインにまたがる6,648のツールを備えた,5,874のシナリオが含まれています。
オープンソースとプロプライエタリなフロンティアモデル全体で、私たちは9つの不確実性の兆候を発見しました。
論文 参考訳(メタデータ) (2025-11-24T18:46:44Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - Security Fence Inspection at Airports Using Object Detection [4.373803477995854]
空港のセキュリティフェンスは一般的に使用されるが、損傷を検出するには定期的な検査が必要である。
目的は、自律ロボットの助けを借りて、フェンスの損傷を自動的に検査することである。
本研究では,フェンス検査の課題に対処し,様々な種類の損傷を局所化するための物体検出手法について検討する。
論文 参考訳(メタデータ) (2023-11-18T21:59:48Z) - Fine-Tuning Language Models Using Formal Methods Feedback [53.24085794087253]
我々は、自律システムにおけるアプリケーションのための、微調整済み言語モデルに対して、完全に自動化されたアプローチを提案する。
本手法は,自然言語タスク記述による事前学習モデルから自動制御器を合成する。
その結果、コントローラが満たした仕様の割合が60%から90%に改善したことが示唆された。
論文 参考訳(メタデータ) (2023-10-27T16:24:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。