論文の概要: Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training
- arxiv url: http://arxiv.org/abs/2606.26102v3
- Date: Sun, 12 Jul 2026 17:21:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.939896
- Title: Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training
- Title(参考訳): Helpfulness Hurts: トレーニング後の中程度のコンパクション値のドメイン依存的劣化
- Authors: Jasmine Brazilek, Juliana Seawell,
- Abstract要約: トレーニング後のパイプラインは、言語モデルに微調整を適用して役に立つが、これらのプロセスは、事前トレーニング中に注入された値を不注意に劣化させる。
Llama 3.1 8Bモデルにおいて, 受傷後データのドメインが動物受傷者の受傷率の保持に差があるかどうかを, 受傷者指向の合成データに基づいて検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Standard post-training pipelines apply supervised fine-tuning (SFT) and reinforcement learning (RL) to make language models helpful, but these processes may inadvertently degrade values instilled during pre-training. We investigate whether the domain of post-training data differentially affects the retention of animal compassion values in a Llama 3.1 8B model mid-trained on compassion-oriented synthetic data, using both SFT (helpfulness via Dolly-15k vs. coding via Magicoder-110K) and GRPO (helpfulness via RLHFlow vs. coding via Magicoder), evaluated on the ANIMA 2.2 benchmark and MORU benchmark (Moral Reasoning Under Uncertainty). Helpfulness training significantly degrades animal compassion relative to coding training on ANIMA (SFT: 35.7% vs. 65.2%; GRPO: 18.7% vs. 32.0%), replicating across two independent helpfulness datasets and two training paradigms. On English MORU items, helpfulness training degrades general moral reasoning by 25.5 percentage points (46.4% vs. 71.9%), a striking gap that rivals the compassion effect in magnitude. However, this effect does not transfer cross-lingually: on the multilingual MORU benchmark, the domain effect disappears (SFT: 52.3% vs. 51.2%). In contrast, the animal compassion effect transfers consistently across languages, with Magicoder's ANIMA percentage-point gain over the base model 4.5 times larger on non-English items than English items. This divergence suggests that values instilled through mid-training are encoded more deeply and cross-lingually than reasoning improvements from domain-specific post-training. These results suggest that, for labs building on value-laden mid-training, coding-domain post-training may better preserve mid-trained values than helpfulness post-training without harming general reasoning capabilities.
- Abstract(参考訳): 標準訓練後パイプラインは、教師付き微調整(SFT)と強化学習(RL)を使用して言語モデルを補助するが、これらのプロセスは、事前訓練中に注入された値が必然的に劣化する可能性がある。
SFT (Helpfulness via Dolly-15k vs. coding via Magicoder-110K) とGRPO (Helpfulness via RLHFlow vs. coding via Magicoder) を併用し, ANIMA 2.2ベンチマークとMORUベンチマーク(Moral Reasoning Under Uncertainty)で評価した。
ANIMA (SFT: 35.7% vs. 65.2%; GRPO: 18.7% vs. 32.0%) のコーディングトレーニングと比較して、ヘルプフルネストレーニングは動物の思いやりを著しく低下させる。
英語のMORU項目では、補助訓練は一般的な道徳的推論を25.5ポイント(46.4%対71.9%)減らし、同情効果に匹敵する顕著な差がある。
マルチリンガルMORUベンチマークでは、ドメイン効果は消失する(SFT:52.3% vs. 51.2%)。
対照的に、動物の思いやり効果は言語間で一貫して伝達され、MagicoderのANIMAのパーセンテージポイントは英語以外の項目よりも4.5倍大きい。
このばらつきは、中級トレーニングによって取り入れられた値は、ドメイン固有のポストトレーニングの改善を推論するよりも、より深く、言語的にエンコードされていることを示唆している。
これらの結果から, 有意義な中級学習を基盤とする研究室では, コーディングドメインのポストトレーニングは, 一般的な推論能力を損なうことなく, トレーニング後の有用性よりも, トレーニング後の中級学習の価値を保たせる可能性が示唆された。
関連論文リスト
- Improved Large Language Diffusion Models [115.83169414681767]
8Bマスク付き拡散言語モデルである EmphiLLaDA について検討した。
iLLaDAは、事前トレーニングと教師付き微調整(SFT)、12Tトークンへの事前トレーニング、および12エポックのための25Bトークン命令コーパスの微調整を通じて、マスク付き拡散目標を維持している。
論文 参考訳(メタデータ) (2026-06-24T02:51:36Z) - Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training [2.6599014990168834]
我々は、汎用ペルシャ語モデルの推論スキルを改善するために、AIフィードバックを用いた強化学習(RLAIF)と直接選好最適化(DPO)を採用している。
これを実現するために,複数の質問応答データセットをペルシア語に翻訳し,RLAIFを用いて提案された回答ペアを生成した。
論文 参考訳(メタデータ) (2025-10-22T22:22:59Z) - RLP: Reinforcement as a Pretraining Objective [103.45068938532923]
我々は,情報駆動型強化事前訓練の目的として,強化学習のコアスピリットである探索を,事前訓練の最終段階に導くことを提案する。
このトレーニングの目的は、モデルが次に何が起こるかを予測する前に、自分自身で考えることを奨励し、事前学習の早い段階で独立した思考行動を教えることである。
特に、RLPは、通常のテキストにおける事前学習対象としての推論のための強化学習を再構築し、次のトーケン予測と有用な連鎖推論の出現の間のギャップを埋める。
論文 参考訳(メタデータ) (2025-09-26T17:53:54Z) - DataComp-LM: In search of the next generation of training sets for language models [200.5293181577585]
DataComp for Language Models (DCLM)は、制御されたデータセット実験のためのテストベッドであり、言語モデルを改善することを目的としている。
我々は、Common Crawlから抽出された240Tトークンの標準化コーパス、OpenLMフレームワークに基づく効果的な事前学習レシピ、53の下流評価スイートを提供する。
DCLMベンチマークの参加者は、412Mから7Bパラメータのモデルスケールでの重複、フィルタリング、データ混合などのデータキュレーション戦略を実験することができる。
論文 参考訳(メタデータ) (2024-06-17T17:42:57Z) - Cumulative Reasoning with Large Language Models [12.267474250936123]
Cumulative Reasoning (CR)は、大規模言語モデル(LLM)問題解決を強化する構造化フレームワークである。
CRはLLMを3つの異なる役割 - Proposer、Verifier(s)、Reporter - タスクを体系的に分解し、中間的推論ステップを生成し、検証し、ソリューションに構成する。
論文 参考訳(メタデータ) (2023-08-08T16:18:20Z) - Variational Open-Domain Question Answering [7.7365628406567675]
本稿では、エンドツーエンドのトレーニングと検索強化モデルの評価を行うための変動型オープンドメインフレームワークを提案する。
本研究は,複数選択検診質問に対する読影型BERTサイズのモデルの学習によるVODの汎用性を実証する。
論文 参考訳(メタデータ) (2022-09-23T10:25:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。