論文の概要: Automated Researchers Can Mitigate Well-characterized Alignment Failures
- arxiv url: http://arxiv.org/abs/2608.28945v3
- Date: Wed, 02 Sep 2026 02:07:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.739816
- Title: Automated Researchers Can Mitigate Well-characterized Alignment Failures
- Title(参考訳): 自動化された研究者は、良質なアライメント障害を軽減できる
- Authors: Chen Yueh-Han, Jiaxin Wen, Jan Hendrik Kirchner,
- Abstract要約: 自動アライメント研究者は、トレーニング方法とデータの提案により、アライメント障害を軽減することができるかを検討する。
10個のアライメント障害のうち、最強のAAR手法はターゲットアライメント障害を著しく低減し、ホールドアウトベンチマークに一般化する。
人間の考えをAARの初期の研究の方向性として使うことは、パフォーマンスを向上させるものではない。
- 参考スコア(独自算出の注目度): 10.460794002279489
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automating alignment research may accelerate progress toward aligned AI, but whether it does is hard to measure. Luckily, many alignment failures, such as deception, sycophancy, and jailbreaks, are already measurable by public benchmarks. We study whether automated alignment researchers (AARs) can post-train to mitigate alignment failures by proposing training methods and data to simultaneously optimize multiple safety benchmarks, while largely preserving general capability. Across 10 alignment failures, the strongest AAR methods significantly reduce the targeted alignment failures and generalize to a held-out benchmark, multi-turn behavioral audits, and models up to 4.7x larger than the target model. As a human baseline, 28 experienced researchers receive up to eight hours to develop one-shot methods for the same benchmarks, but their methods underperform the best AAR methods. Using human ideas as the AARs' initial research direction does not improve performance, suggesting current AARs may not need guidance from experienced researchers. These results suggest that automating alignment research on well-characterized failures may be practical in the near term.
- Abstract(参考訳): アライメント研究の自動化は、アライメントAIへの進歩を加速させるかもしれないが、測定するのは困難である。
幸いなことに、詐欺、梅毒、脱獄などのアライメント障害は、すでに公開ベンチマークによって測定可能である。
我々は,自動アライメント研究者(AAR)が,複数の安全ベンチマークを同時に最適化するトレーニング手法とデータを提案することにより,アライメント障害を軽減するために,トレーニング後のアライメント障害を緩和できるかどうかを検討した。
10回のアライメント障害において、最強のAAR手法は目標のアライメント障害を著しく低減し、ホールドアウトベンチマーク、マルチターン動作監査、およびターゲットモデルよりも4.7倍のモデルに一般化する。
人間のベースラインとして、28人の経験豊富な研究者が、同じベンチマークのワンショットメソッドを開発するのに最大8時間もかかっていますが、彼らのメソッドは最高のAARメソッドより優れています。
人間の考えをAARの初期の研究の方向性として使うことは、パフォーマンスを向上させるものではない。
これらの結果から, 良好な特性を有する故障に対するアライメント研究の自動化は, 近い将来に実施されることが示唆された。
関連論文リスト
- How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks [6.001213285107465]
AutoResearchEvalは、7つの科学領域にまたがるフロンティア科学に根ざした100のタスクを特徴としている。
8つのハーネスモデルの組み合わせを評価すると、800個のオート検索剤の軌道が得られる。
我々は,人間のキャリブレーションしたエージェント・アズ・ア・ジャッジ・パイプラインを利用して,完全な軌道や中間成果物を検査する。
論文 参考訳(メタデータ) (2026-08-14T21:39:38Z) - AI Research Preference Models [87.14303218008381]
研究エージェントは、独自の機械学習実験を提案し、実装し、評価することができる。
フロンティア作業の進行は コストで妨げられています
我々は、複数の候補ソリューションのどれが実行価値が最も高いかを予測するAI Research Preference Models(RPM)を紹介する。
論文 参考訳(メタデータ) (2026-08-14T04:20:37Z) - Better, Faster: Harnessing Self-Improvement in Large Reasoning Models [88.9107786925265]
本稿では,2つの単純なyet- Effectiveアプローチにより,大規模推論モデルにおける自己改善を効果的に促進するHSIRを提案する。
具体的には、HSIRはデータの不均衡を軽減するために、検証済みの外部サンプリング戦略を導入する。
HSIRはまた、望ましくないソリューションを定量化しフィルタリングするために、固有の多様性スコアも設計している。
論文 参考訳(メタデータ) (2026-05-24T10:54:46Z) - Automated alignment is harder than you think [41.94180208011558]
人工超知能(ASI)の整列に関する主要な提案は、AIエージェントを使用して、能力の向上に伴い、アライメント研究のごく一部を自動化することである。
我々は、研究員がアライメント作業の妨害を計画していないとしても、この計画は説得力はあるが破滅的に誤解を招く安全評価を生み出すかもしれないと論じている。
これは、アライメント研究には多くの面倒な作業が伴うためである。
論文 参考訳(メタデータ) (2026-05-07T15:06:37Z) - Towards Execution-Grounded Automated AI Research [106.90422658528819]
実行基盤化は役に立つかもしれないが、自動実行が実現可能かどうか、LLMが実行フィードバックから学べるかどうかは不明だ。
我々は、アイデアを実装する自動化エグゼキュータを構築し、その有効性を検証するために大規模な並列GPU実験をローンチする。
本研究では,進化的探索と強化学習という,実行フィードバックから学習する2つの方法を分析する。
論文 参考訳(メタデータ) (2026-01-20T22:35:44Z) - Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents [31.651748374218446]
大規模言語モデル(LLM)は、最近、複雑な多段階タスクにおいて顕著な成果を上げている。
彼らはしばしば、複数のソリューションを試して一貫したパフォーマンスを維持するのに苦労する。
論文 参考訳(メタデータ) (2025-05-19T18:50:15Z) - TFG: Unified Training-Free Guidance for Diffusion Models [82.14536097768632]
トレーニング不要のガイダンスは、追加のトレーニングなしで望ましい目標特性を持つサンプルを生成することができる。
既存の手法は様々な個別の用途で有効であるが、理論的な根拠と広範囲なベンチマークでの厳密な試験が欠如していることが多い。
本稿では,既存の手法を特殊な事例として包含する新しいアルゴリズムフレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-24T05:31:17Z) - ZARTS: On Zero-order Optimization for Neural Architecture Search [94.41017048659664]
微分可能なアーキテクチャサーチ (DARTS) は、NASの高効率性のため、一般的なワンショットパラダイムである。
この作業はゼロオーダーの最適化に変わり、上記の近似を強制せずに探索するための新しいNASスキームであるZARTSを提案する。
特に、12ベンチマークの結果は、DARTSの性能が低下するZARTSの顕著な堅牢性を検証する。
論文 参考訳(メタデータ) (2021-10-10T09:35:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。