論文の概要: FORGE: Verification-Gated Behavioral Repair for Generative Language Models
- arxiv url: http://arxiv.org/abs/2610.05190v1
- Date: Sun, 04 Oct 2026 12:55:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 22:44:17.628244
- Title: FORGE: Verification-Gated Behavioral Repair for Generative Language Models
- Title(参考訳): FORGE: 生成言語モデルに対する検証付き行動修復
- Abstract要約: FORGEは、生成言語モデルの振る舞い修復を目的としたフレームワークである。
欠陥の局所化、重み付け、行動検証を独立した段階に分ける。
勾配に基づく微調整よりも、バイアスと毒性の減少が一貫して達成される。
- 参考スコア(独自算出の注目度): 4.191577542171072
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative large language models (LLMs) inherit undesirable behaviors from pre-training, including demographic bias and toxic generation, that often emerge only after deployment and affect a small subset of inputs. A repair should eliminate the identified defect, preserve the model's overall functionality and, ideally, provide correctness guarantees. Existing approaches address this only partially: gradient-based fine-tuning lacks per-instance guarantees and becomes unstable with few defect samples; model editing assumes explicit knowledge replacement rather than behavioral correction; and constraint-based repair is largely restricted to discriminative models with unique target outputs. We present FORGE, a framework for targeted behavioral repair of generative language models that separates defect localization, weight editing, and behavioral verification into independent stages. Its core is a repair abstraction that converts localized defective generation into explicit optimization objectives, enabling verification-oriented repair techniques to operate on autoregressive generation. FORGE is editing-mechanism agnostic: we instantiate it with (1) a constraint-based quadratic optimization method that provides per-sample repair certificates and (2) a null-space projection editor that minimizes interference with the original model distribution, both under the same localization and verification protocol. On five open-source LLMs, FORGE consistently achieves larger reductions in bias and toxicity than gradient-based fine-tuning with minor perplexity degradation. The two backends exhibit complementary performance across architectures, which a lightweight causal probe traces to where toxicity-related signals concentrate. FORGE also remains effective with only a handful of defective examples, where conventional fine-tuning often oscillates or fails to converge.
- Abstract(参考訳): 生成的大規模言語モデル(LLM)は、人口統計バイアスや有毒な生成を含む事前学習から望ましくない振る舞いを継承する。
修復は、特定された欠陥を排除し、モデル全体の機能を保持し、理想的には、正確性を保証するべきである。
従来のアプローチでは、勾配ベースの微調整はインスタンスごとの保証が欠如し、少数の欠陥サンプルで不安定になり、モデル編集は行動補正よりも明確な知識置換を前提としており、制約ベースの修復は独特な目標出力を持つ識別モデルに大きく制限されている。
本稿では,欠陥の局所化,重み付け,行動検証を独立した段階に分離した生成言語モデルの行動修復を目的としたフレームワークFOGEを提案する。
その中核は、局所的な欠陥生成を明示的な最適化目標に変換する修復抽象化であり、検証指向の修復技術が自己回帰生成で動作できるようにする。
FORGEは,(1)サンプルごとの修理証明書を提供する制約ベースの2次最適化手法,(2)同じローカライゼーションおよび検証プロトコルの下で,元のモデル分布との干渉を最小限に抑えるヌルスペースプロジェクションエディタをインスタンス化する。
5つのオープンソース LLM において、ForGE は小さなパープレキシティ劣化を伴う勾配に基づく微調整よりも、バイアスと毒性の低減を一貫して達成している。
2つのバックエンドはアーキテクチャ間で補完的な性能を示し、軽量な因果プローブは毒性関連信号が集中する場所を辿る。
FORGEはまた、従来の微調整がしばしば振動したり、収束しなかったりといった、少数の欠陥例で有効である。
関連論文リスト
- Safeguarding Mutual Correction in Source-Free Domain Adaptation via Cut Statistics [13.723000245697868]
Source-Free Domain Adaptationは、元のソースドメインにアクセスすることなく、未ラベルのターゲットドメインにソース予測モデルを適用することを目的としている。
本稿では, ゲートクロスモデル監視のための予測信頼性のラベルフリー尺度として, カット統計を利用する新しい手法であるSafeCutを提案する。
本手法は, 相対的信頼性に基づいて, 監督の方向性と強度を動的に制御し, 正しい補正を選択的に増幅し, サンプル毎の誤補正を抑える。
論文 参考訳(メタデータ) (2026-10-02T08:12:24Z) - When Attribution Patching Lies: Diagnosis and a Second-Order Correction [9.338965648455238]
本研究は, 下流ネットワークの非直線性に起因する誤差が, パッチ成分の局所曲率よりも大きいことを示す。
この洞察は、(i)信頼できない見積もりを検出するための信頼性スコア、(ii)エラー境界がポテンシャル属性の誤特定を定量化すること、(iii)Hessian-vector-product correctが1つの後進パスで先行エラーを除去すること、の3つの実用的なツールをもたらす。
論文 参考訳(メタデータ) (2026-06-05T05:20:32Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Dual-Teacher Distillation with Subnetwork Rectification for Black-Box Domain Adaptation [69.7036779439312]
ブラックボックスドメイン適応は、非常に実用的で非常に困難な設定である。
ブラックボックスソースモデルに埋め込まれた特定の知識を活用するサブネットワーク整合モデル(DDSR)を用いた二重蒸留法を提案する。
我々の手法は、ソースデータやモデルの使用を含む、最先端の手法に対する一貫した改善を実証する。
論文 参考訳(メタデータ) (2026-03-24T07:54:19Z) - Attribution-Guided Model Rectification of Unreliable Neural Network Behaviors [60.06461883533697]
我々は、ランクワンモデル編集を活用して、帰属誘導モデル修正フレームワークを確立する。
まず、既存のモデル編集と整合性の設定を区別し、信頼性の低い振る舞いを補正する定式化を行う。
そこで本研究では, 帰属誘導層ローカライゼーション手法を提案する。
論文 参考訳(メタデータ) (2026-03-08T01:06:07Z) - What Does It Take to Build a Performant Selective Classifier? [30.90225954725644]
ベイズノイズ,近似誤差,ランキング誤差,統計的ノイズ,実装またはシフト誘起スラックについて検討した。
我々は,合成2モードデータと実世界のビジョンと言語ベンチマークを用いて,その分解を検証した。
その結果, (i)ベイズノイズとモデル容量の制限は, 実質的なギャップを考慮し, (ii) よりリッチで特徴を考慮したキャリブレータのみを有意義に改善し, (iii) データシフトは, 分散的に堅牢なトレーニングを必要とするスラックを別々に導入することを確認した。
論文 参考訳(メタデータ) (2025-10-23T05:48:40Z) - Self-Healing Machine Learning: A Framework for Autonomous Adaptation in Real-World Environments [50.310636905746975]
実世界の機械学習システムは、基礎となるデータ生成プロセスの分散シフトによって、モデルの性能劣化に遭遇することが多い。
概念のドリフト適応のような既存のシフトへのアプローチは、その理性に依存しない性質によって制限される。
我々はこれらの制限を克服するために自己修復機械学習(SHML)を提案する。
論文 参考訳(メタデータ) (2024-10-31T20:05:51Z) - Precision-Recall Divergence Optimization for Generative Modeling with
GANs and Normalizing Flows [54.050498411883495]
本研究では,ジェネレーティブ・アドバイサル・ネットワークや正規化フローなどの生成モデルのための新しいトレーニング手法を開発した。
指定された精度-リコールトレードオフを達成することは、textitPR-divergencesと呼ぶ家族からのユニークな$f$-divergenceを最小化することを意味する。
当社のアプローチは,ImageNetなどのデータセットでテストした場合の精度とリコールの両面で,BigGANのような既存の最先端モデルの性能を向上させる。
論文 参考訳(メタデータ) (2023-05-30T10:07:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。