論文の概要: Automated Researchers Can Reliably Mitigate Alignment Failures
- arxiv url: http://arxiv.org/abs/2608.28945v1
- Date: Fri, 28 Aug 2026 23:31:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.791792
- Title: Automated Researchers Can Reliably Mitigate Alignment Failures
- Title(参考訳): 自動化された研究者は、アライメントの失敗を確実に軽減できる
- Abstract要約: 10回のアライメント障害で、最強のAAR手法は目標のアライメント障害を著しく低減した。
人間のアイデアをAARの初期の研究の方向性として使うことは、性能を向上するものではない。
これらの結果から, 良好な特性を有する故障に対するアライメント研究の自動化は, 近い将来に実施されることが示唆された。
- 参考スコア(独自算出の注目度): 10.460794002279489
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automating alignment research may accelerate progress toward aligned AI, but whether it does is hard to measure. Luckily, many alignment failures, such as deception, sycophancy, and jailbreaks, are already measurable by public benchmarks. We study whether automated alignment researchers (AARs) can post-train to mitigate alignment failures by proposing training methods and data to simultaneously optimize multiple safety benchmarks, while preserving general capability. Across 10 alignment failures, the strongest AAR methods significantly reduce the targeted alignment failures and generalize to a held-out benchmark, multi-turn behavioral audits, and models up to 4.7 times larger than the target model. As a human baseline, 28 experienced researchers receive up to eight hours to develop methods for the same benchmarks, but their methods underperform the best AAR methods. Using human ideas as the AARs' initial research direction does not improve performance, suggesting current AARs may not need guidance from experienced researchers. These results suggest that automating alignment research on well-characterized failures may be practical in the near term.
- Abstract(参考訳): アライメント研究の自動化は、アライメントAIへの進歩を加速させるかもしれないが、測定するのは困難である。
幸いなことに、詐欺、梅毒、脱獄などのアライメント障害は、すでに公開ベンチマークによって測定可能である。
自動アライメント研究者(AAR)は、複数の安全ベンチマークを同時に最適化し、汎用性を維持しながら、アライメント障害を軽減するために、トレーニング後のアライメント障害を軽減できるかどうかを検討する。
10回のアライメント障害において、最強のAAR手法は目標のアライメント障害を著しく低減し、ホールドアウトベンチマーク、マルチターン動作監査、およびターゲットモデルより最大4.7倍のモデルに一般化する。
人間のベースラインとして、28人の経験豊富な研究者が8時間以内に同じベンチマークの手法を開発しました。
人間の考えをAARの初期の研究の方向性として使うことは、パフォーマンスを向上させるものではない。
これらの結果から, 良好な特性を有する故障に対するアライメント研究の自動化は, 近い将来に実施されることが示唆された。
関連論文リスト
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks [6.001213285107465]
AutoResearchEvalは、7つの科学領域にまたがるフロンティア科学に根ざした100のタスクを特徴としている。
8つのハーネスモデルの組み合わせを評価すると、800個のオート検索剤の軌道が得られる。
我々は,人間のキャリブレーションしたエージェント・アズ・ア・ジャッジ・パイプラインを利用して,完全な軌道や中間成果物を検査する。
論文 参考訳(メタデータ) (2026-08-14T21:39:38Z) - AI Research Preference Models [87.14303218008381]
研究エージェントは、独自の機械学習実験を提案し、実装し、評価することができる。
フロンティア作業の進行は コストで妨げられています
我々は、複数の候補ソリューションのどれが実行価値が最も高いかを予測するAI Research Preference Models(RPM)を紹介する。
論文 参考訳(メタデータ) (2026-08-14T04:20:37Z) - Better, Faster: Harnessing Self-Improvement in Large Reasoning Models [88.9107786925265]
本稿では,2つの単純なyet- Effectiveアプローチにより,大規模推論モデルにおける自己改善を効果的に促進するHSIRを提案する。
具体的には、HSIRはデータの不均衡を軽減するために、検証済みの外部サンプリング戦略を導入する。
HSIRはまた、望ましくないソリューションを定量化しフィルタリングするために、固有の多様性スコアも設計している。
論文 参考訳(メタデータ) (2026-05-24T10:54:46Z) - Automated alignment is harder than you think [41.94180208011558]
人工超知能(ASI)の整列に関する主要な提案は、AIエージェントを使用して、能力の向上に伴い、アライメント研究のごく一部を自動化することである。
我々は、研究員がアライメント作業の妨害を計画していないとしても、この計画は説得力はあるが破滅的に誤解を招く安全評価を生み出すかもしれないと論じている。
これは、アライメント研究には多くの面倒な作業が伴うためである。
論文 参考訳(メタデータ) (2026-05-07T15:06:37Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - Towards Execution-Grounded Automated AI Research [106.90422658528819]
実行基盤化は役に立つかもしれないが、自動実行が実現可能かどうか、LLMが実行フィードバックから学べるかどうかは不明だ。
我々は、アイデアを実装する自動化エグゼキュータを構築し、その有効性を検証するために大規模な並列GPU実験をローンチする。
本研究では,進化的探索と強化学習という,実行フィードバックから学習する2つの方法を分析する。
論文 参考訳(メタデータ) (2026-01-20T22:35:44Z) - Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI [0.0]
トラジェクトリガードはシームズ・リカレント・オートエンコーダであり、コントラスト学習によるタスク・トラジェクトリアライメントと、再構成によるシーケンシャル・アライメントを共同で学習するハイブリッド・ロス機能を備えている。
32ミリ秒のレイテンシで、当社のアプローチは LLM Judge のベースラインよりも17-27倍高速で動作し、実運用環境におけるリアルタイムの安全性検証を可能にします。
論文 参考訳(メタデータ) (2026-01-02T00:27:11Z) - Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents [31.651748374218446]
大規模言語モデル(LLM)は、最近、複雑な多段階タスクにおいて顕著な成果を上げている。
彼らはしばしば、複数のソリューションを試して一貫したパフォーマンスを維持するのに苦労する。
論文 参考訳(メタデータ) (2025-05-19T18:50:15Z) - The Automation Advantage in AI Red Teaming [0.0]
本稿では,Crucibleのデータに基づいて,Large Language Model (LLM)の脆弱性を分析する。
その結果,自動化技術は5.2%のユーザしか採用していないにも関わらず,手技よりもはるかに優れていたことが判明した。
論文 参考訳(メタデータ) (2025-04-28T14:48:00Z) - TFG: Unified Training-Free Guidance for Diffusion Models [82.14536097768632]
トレーニング不要のガイダンスは、追加のトレーニングなしで望ましい目標特性を持つサンプルを生成することができる。
既存の手法は様々な個別の用途で有効であるが、理論的な根拠と広範囲なベンチマークでの厳密な試験が欠如していることが多い。
本稿では,既存の手法を特殊な事例として包含する新しいアルゴリズムフレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-24T05:31:17Z) - InferAligner: Inference-Time Alignment for Harmlessness through
Cross-Model Guidance [56.184255657175335]
我々は,無害アライメントのためのクロスモデルガイダンスを利用する新しい推論時間アライメント手法であるtextbfInferAligner を開発した。
実験結果から,本手法はファイナンス,医学,数学の分野特化モデルに極めて効果的に適用可能であることが示された。
これは有害な命令とジェイルブレイク攻撃の両方のアタック成功率(ASR)を著しく低下させ、下流タスクではほとんど変化のないパフォーマンスを維持している。
論文 参考訳(メタデータ) (2024-01-20T10:41:03Z) - ZARTS: On Zero-order Optimization for Neural Architecture Search [94.41017048659664]
微分可能なアーキテクチャサーチ (DARTS) は、NASの高効率性のため、一般的なワンショットパラダイムである。
この作業はゼロオーダーの最適化に変わり、上記の近似を強制せずに探索するための新しいNASスキームであるZARTSを提案する。
特に、12ベンチマークの結果は、DARTSの性能が低下するZARTSの顕著な堅牢性を検証する。
論文 参考訳(メタデータ) (2021-10-10T09:35:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。