論文の概要: Words Speak Louder Than Order: A Behavioral Evaluation of Gemma 4
- arxiv url: http://arxiv.org/abs/2609.30716v1
- Date: Fri, 25 Sep 2026 02:43:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.191061
- Title: Words Speak Louder Than Order: A Behavioral Evaluation of Gemma 4
- Title(参考訳): 単語が順に発音する:Gemma 4の行動評価
- Abstract要約: ソースフレーミングは読み上げ位置を大きく上回る。
モデルは最初のドキュメントを好むが、このバイアスは非常に可変である。
全体の構造的反復は、短いコピーキューではなく、位置バイアスを駆動する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a language model receives two conflicting documents as input, how does it decide which one to prioritize? Does it rely on how the sources are framed or the presentation order of the documents? We evaluated this behavior on Google's pre-trained Gemma 4-e4b model across a targeted behavioral suite (n = 13 items, 784 forward passes in short, single-turn contexts) using a completely counterbalanced experimental design. This setup allowed us to mathematically isolate the specific effects of source framing and reading position, while ensuring the model's natural vocabulary biases were canceled out. Across ten test conditions, we discovered the following: 1. Source framing heavily overpowers reading position. When directly competing, the semantic framing of a source (such as presenting it as an official guideline or a fresh update) had a significantly stronger impact on the model's final answer than the presentation order of the document. 2. The model favors the first document it reads, but this bias is highly variable. While the model consistently demonstrated a primacy effect (preferring the first document presented), the actual strength of this bias fluctuated by at least a factor of 5 based solely on the surface wording. 3. Overall structural repetition, not short copy-cues, drives positional bias. The model's preference for the first document is not a mechanical reaction to short, repetitive trigger phrases, such as "is [Answer]". However, the primacy effect does increase significantly when the two competing documents are structurally identical, using word-for-word verbatim templates. Introducing variation in the overall wording between the two sources reduces this positional bias.
- Abstract(参考訳): 言語モデルが2つの矛盾する文書を入力として受け取るとき、どの文書を優先するかをどうやって決めるのか?
ソースのフレーム化やドキュメントの表示順序に依存していますか?
我々は,Google の事前学習した Gemma 4-e4b モデルを用いて,目標となる動作スイート (n = 13 項目,784 前方パス,短絡した単一ターンコンテキスト) に対して,完全に相反する実験設計を用いて,この挙動を評価した。
この設定により、モデルの自然な語彙バイアスがキャンセルされることを保証しながら、ソースフレーミングと読み上げ位置の特定の効果を数学的に分離することができる。
10個の試験条件で, 以下の結果を得た。 1. ソースフレーミングは読み上げ位置を大きく超過する。
直接競合する場合、ソースのセマンティックフレーミング(公式のガイドラインや更新として提示するなど)は、ドキュメントの提示順序よりもモデルの最終回答に大きく影響した。
2. モデルは最初のドキュメントを好むが、このバイアスは非常に可変である。
モデルが一貫して優性効果(最初の文書を参照)を示した一方で、このバイアスの実際の強さは、表面の単語のみに基づく少なくとも5の係数で変動した。
3. 全体の構造的反復は、短い複写ではなく、位置バイアスを引き起こす。
最初の文書に対するモデルの好みは、"is [Answer]"のような短い反復的なトリガーフレーズに対する機械的な反応ではない。
しかし、2つの競合する文書が構造的に同一である場合には、ワード・フォー・ワードの動詞テンプレートを使用して、プライマリ効果が著しく増大する。
2つのソース間の全体的な単語のバリエーションの導入は、この位置バイアスを減少させる。
関連論文リスト
- Boosting Temporal Sentence Grounding via Causal Inference [55.61521060331558]
テンポラル・センテンス・グラウンディング(Temporal Sentence Grounding)は、あるテキストクエリに意味的に対応するビデオ中の関連モーメントを特定することを目的としている。
これらの素因的相関は,(1) 特定の動詞や句の頻繁な共起など,テキストデータに固有の偏り,(2) ビデオコンテンツにおける顕著なパターンや反復パターンに過度に適合する傾向,の2つの要因から生じる。
本稿では, 因果推論を利用した新たなTSGフレームワーク, 因果介入, 反ファクト推論を提案する。
論文 参考訳(メタデータ) (2025-07-07T13:01:06Z) - Beyond Early-Token Bias: Model-Specific and Language-Specific Position Effects in Multilingual LLMs [50.07451351559251]
我々は,5言語(英語,ロシア語,ドイツ語,ヒンディー語,ベトナム語)にまたがる調査を行った。
位置バイアスが即時戦略とどのように相互作用し、出力エントロピーに影響を及ぼすかを検討する。
論文 参考訳(メタデータ) (2025-05-22T02:23:00Z) - Surprise! Uniform Information Density Isn't the Whole Story: Predicting Surprisal Contours in Long-form Discourse [54.08750245737734]
話者は、階層的に構造化された談話モデル内の位置に基づいて、情報率を変調する。
階層的予測器は談話の情報輪郭の重要な予測器であり,深い階層的予測器は浅い予測器よりも予測力が高いことがわかった。
論文 参考訳(メタデータ) (2024-10-21T14:42:37Z) - GradBias: Unveiling Word Influence on Bias in Text-to-Image Generative Models [75.04426753720553]
開集合におけるバイアスを特定し,定量化し,説明するための枠組みを提案する。
このパイプラインはLarge Language Model (LLM)を活用して、一連のキャプションから始まるバイアスを提案する。
このフレームワークには、OpenBiasとGradBiasの2つのバリエーションがあります。
論文 参考訳(メタデータ) (2024-08-29T16:51:07Z) - Bias in News Summarization: Measures, Pitfalls and Corpora [4.917075909999548]
本稿では,要約モデルにおけるバイアス付き行動の定義と実用運用について紹介する。
目的合成モデルと汎用チャットモデルの両方で生成された英語要約における性別バイアスを測定する。
単一文書要約におけるコンテンツ選択は、性バイアスの影響をほとんど受けていないが、幻覚は偏見の証拠である。
論文 参考訳(メタデータ) (2023-09-14T22:20:27Z) - It's All Relative: Interpretable Models for Scoring Bias in Documents [10.678219157857946]
本稿では,テキストコンテンツのみに基づいて,Webドキュメントに存在するバイアスを評価するための解釈可能なモデルを提案する。
我々のモデルはBradley-Terryの公理を思わせる仮定を取り入れ、同じウィキペディアの記事の2つの修正に基づいて訓練されている。
我々は、訓練されたモデルのパラメータを解釈して、最も偏りを示す単語を見つけることができることを示す。
論文 参考訳(メタデータ) (2023-07-16T19:35:38Z) - Rationalizing Predictions by Adversarial Information Calibration [65.19407304154177]
我々は2つのモデルを共同で訓練する: 1つは、正確だがブラックボックスな方法でタスクを解く典型的なニューラルモデルであり、もう1つは、予測の理論的根拠を付加するセレクタ・予測モデルである。
我々は,2つのモデルから抽出した情報を,それらの違いが欠落した特徴や過度に選択された特徴の指標であるように校正するために,敵対的手法を用いる。
論文 参考訳(メタデータ) (2023-01-15T03:13:09Z) - Debiasing Stance Detection Models with Counterfactual Reasoning and
Adversarial Bias Learning [15.68462203989933]
スタンス検出モデルは、ショートカットとしてテキスト部分のデータセットバイアスに依存する傾向がある。
より正確にバイアスをモデル化するための逆バイアス学習モジュールを提案する。
論文 参考訳(メタデータ) (2022-12-20T16:20:56Z) - Unsupervised Extractive Summarization by Pre-training Hierarchical
Transformers [107.12125265675483]
教師なし抽出文書要約は、訓練中にラベル付き要約を用いることなく、文書から重要な文章を選択することを目的としている。
既存の手法は主にグラフベースで、文をノードとして、エッジの重みは文の類似性によって測定される。
教師なし抽出要約のための文のランク付けにはトランスフォーマーの注意が利用できることがわかった。
論文 参考訳(メタデータ) (2020-10-16T08:44:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。