論文の概要: LoRA for Gender-Inclusive Rewriting and Activation Steering for Counter-Narrative Generation
- arxiv url: http://arxiv.org/abs/2607.23083v1
- Date: Sat, 25 Jul 2026 07:11:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.990375
- Title: LoRA for Gender-Inclusive Rewriting and Activation Steering for Counter-Narrative Generation
- Title(参考訳): カウンターナラティブ生成のためのジェンダーインクルーシブリライトとアクティベーションステアリングのためのLoRA
- Abstract要約: 本稿では,LT-EDI 2026共有タスクのためのIHLCシステムを提案する。
ジェンダー・インクルーシブ・リライトと反ナラティブ・ジェネレーションの両方に対処する。
ジェンダー非包括的書き換えにはパラメータ効率の低いローランド適応(LoRA)ファインチューニングを用いる。
我々の主な貢献は、反ナラティブ生成のための計算効率の良い推論時間表現工学アプローチである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Gender-inclusive language generation seeks to transform biased text into inclusive alternatives while preserving semantic meaning and contextual coherence. This paper presents the IHLC system for the LT-EDI 2026 Shared Task, addressing both gender-inclusive rewriting and counter-narrative generation. For gender-inclusive rewriting, we employ parameter-efficient Low-Rank Adaptation (LoRA) fine-tuning, achieving an official score of 80.00%. Our primary contribution is a compute-efficient inference-time representation engineering approach for counter-narrative generation. We derive a principal steering direction from contrastive hidden-state activations using principal component analysis (PCA) and inject it into the intermediate representations of Gemma-3-4B-it during inference, enabling behavioral steering toward inclusive responses without modifying model weights. Combined with constrained prompting, this approach produces polite and contextually appropriate counter-narratives, achieving an official score of 78.12%. We further present a manual analysis of steering behavior, identifying key failure modes including semantic drift, residual bias leakage, layer sensitivity, over-steering, and text degeneration. Our findings highlight both the practical potential and current limitations of activation steering as a lightweight alternative to parameter updates for controllable and socially aligned language generation.
- Abstract(参考訳): 性的に包摂的な言語生成は、意味的意味と文脈的コヒーレンスを保ちながら、偏見のあるテキストを包摂的な代替語に転換しようとする。
本稿では,ジェンダーインクルーシブ・リライトと反ナラティブ・ジェネレーションの両方に対処する,LT-EDI 2026共有タスクのためのIHLCシステムを提案する。
性別非包括的書き直しにはパラメータ効率の低いローランド適応(LoRA)微調整を採用し、公式スコアは80.00%である。
我々の主な貢献は、反ナラティブ生成のための計算効率の良い推論時間表現工学アプローチである。
主成分分析 (PCA) を用いて, 主成分分析(PCA) による対照的な隠れ状態の活性化から主ステアリング方向を導出し, 推定中のGemma-3-4B-itの中間表現に注入することにより, モデル重みを変更することなく, 包括的応答に対する行動ステアリングを可能にする。
制約付きプロンプトと組み合わせて、このアプローチは丁寧で文脈的に適切な反ナラティブを生み出し、公式スコアは78.12%に達する。
さらに, セマンティックドリフト, 残留バイアスリーク, 層感度, オーバーステアリング, テキストデジェネレーションなどのキー障害モードを同定し, 操舵動作を手動で解析する。
本研究は,アクティベーションステアリングの実用的可能性と現在の限界の両方を,制御可能かつ社会的に整合した言語生成のためのパラメータ更新の軽量な代替手段として挙げた。
関連論文リスト
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition [52.63676763985825]
トークンレベルの精度を超えた認識品質を評価するための意味認識評価指標を提案する。
我々は,人間のようなマルチターンインタラクションをシミュレートするエージェント・フレームワークを設計し,認識出力の反復的改善を可能にする。
対話型およびエージェント型ASRにおける今後の研究を促進するためのコードをリリースする。
論文 参考訳(メタデータ) (2026-04-10T09:02:42Z) - Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency [12.78111885039368]
アクティベーションエンジニアリングは、微調整の計算コストを伴わずに、大規模言語モデル(LLM)の正確な制御を可能にする。
静的なアクティベーション差からベクトルを導出する既存の手法は、高次元ノイズや階層的なセマンティックドリフトの影響を受けやすい。
本稿では,GERステアリング(Global Evolutionary Refined Steering, GER-steer)を提案する。
論文 参考訳(メタデータ) (2026-03-12T03:45:19Z) - From Static Benchmarks to Dynamic Protocol: Agent-Centric Text Anomaly Detection for Evaluating LLM Reasoning [12.024430772980502]
本稿では,大規模言語モデル評価のためのエージェント中心ベンチマークパラダイムを提案する。
教師エージェントは、候補問題を生成し、オーケストレータエージェントは、その妥当性を厳格に検証し、敵攻撃に対するガードを行う。
生徒がその問題を正しく解いた場合、オーケストレータは教師にもっと難しい変奏曲を生成するよう促す。
論文 参考訳(メタデータ) (2026-02-27T06:54:32Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Steering Language Models Before They Speak: Logit-Level Interventions [9.055997973281919]
制御可能な生成のためのトレーニング不要な推論時間ロジット介入を提案する。
以上の結果から,ロジットステアリングは大きな,一貫した,マルチタスク制御のゲインを達成できることが示唆された。
論文 参考訳(メタデータ) (2026-01-16T03:00:33Z) - In-Distribution Steering: Balancing Control and Coherence in Language Model Generation [0.0815557531820863]
In-Distribution Steering (IDS) は,表現空間における入力データ分布に基づいてステアリング強度を適応させる新しい手法である。
IDSは、崩壊することなくコヒーレントテキストを生成しながら、分類タスクに対して高い精度を達成し、実世界のアプリケーションに特に適している。
論文 参考訳(メタデータ) (2025-10-15T08:31:37Z) - RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning [64.46921169261852]
RAG-Zevalは、ルール誘導推論タスクとして忠実さと正しさの評価を定式化する、新しいエンドツーエンドフレームワークである。
提案手法は、強化学習による評価者を訓練し、コンパクトなモデルにより包括的および音質評価を生成する。
実験では、RAG-Zevalの優れた性能を示し、人間の判断と最も強い相関性を達成した。
論文 参考訳(メタデータ) (2025-05-28T14:55:33Z) - AGENT-X: Adaptive Guideline-based Expert Network for Threshold-free AI-generated teXt detection [44.66668435489055]
Agent-Xは、AI生成テキスト検出のためのゼロショットマルチエージェントフレームワークである。
我々は,検出ガイドラインを意味的,スタイリスティック,構造的次元に整理し,それぞれが専門的な言語エージェントによって独立に評価される。
メタエージェントは、信頼を意識したアグリゲーションを通じてこれらのアセスメントを統合し、しきい値のない解釈可能な分類を可能にする。
多様なデータセットの実験により、Agent-Xは精度、解釈可能性、一般化において最先端の教師付きおよびゼロショットアプローチを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2025-05-21T08:39:18Z) - A Controllable Model of Grounded Response Generation [122.7121624884747]
現在のエンドツーエンドのニューラルネットワークモデルは、応答生成プロセスにセマンティックコントロールを課す柔軟性を本質的に欠いている。
我々は制御可能な接地応答生成(CGRG)と呼ばれるフレームワークを提案する。
このフレームワークを用いることで、会話のようなRedditデータセットでトレーニングされた、新しいインダクティブアテンション機構を備えたトランスフォーマーベースのモデルが、強力な生成ベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2020-05-01T21:22:08Z) - Joint Contextual Modeling for ASR Correction and Language Understanding [60.230013453699975]
言語理解(LU)と協調してASR出力の文脈的言語補正を行うマルチタスクニューラルアプローチを提案する。
そこで本研究では,市販のASRおよびLUシステムの誤差率を,少量のドメイン内データを用いてトレーニングしたジョイントモデルと比較して14%削減できることを示した。
論文 参考訳(メタデータ) (2020-01-28T22:09:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。