論文の概要: AfriSyCo: Measuring Assertive Framing, Verification, and Wording Sensitivity Around African-Language Content
- arxiv url: http://arxiv.org/abs/2609.17853v1
- Date: Tue, 15 Sep 2026 21:22:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.547755
- Title: AfriSyCo: Measuring Assertive Framing, Verification, and Wording Sensitivity Around African-Language Content
- Title(参考訳): AfriSyCo: Assertive Framing, Verification and Wording Sensitivity around African-Language Content
- Abstract要約: AfriSyCoの研究は、2つの相補層を持つアフリカ系アメリカ人の事実内容の切り替えに答えている。
我々は1,415のターン-1-正しいモデル言語-イテム観測を解析した。
- 参考スコア(独自算出の注目度): 0.2446948464551684
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AfriSyCo studies answer switching around African-language factual content with two complementary layers: native-language follow-ups and a controlled cross-language factorial whose question, options, and target remain in the African language while the follow-up framing is English. We analyze 1,415 turn-1-correct model-language-item observations derived from 100 source questions across seven open-weight checkpoints and six languages; turn-1-correct denotes observed first-response accuracy, not demonstrated knowledge. Under native prompts, assertive endorsement produces 29.3 percentage points more any-turn false-target selection than mention-plus-verification (M+V), with a 19.0-point immediate T2 contrast. In the precommitted 2 x 2 factorial, averaged over three tested prompt families, assertive framing increases target selection by 30.4 points (95% CI [28.4, 32.3]); verification decreases it by 17.4 points, while the assertive effect rises from 20.5 points without verification to 40.2 with it (interaction +19.7). The effect remains 34.8 points among 611 observations correct after option reordering. Magnitude varies sharply by wording and checkpoint: prompt-family effects span 20.1-42.5 points, a Twi/Qwen3 paraphrase shifts target selection from 70.8% to 4.2%, and checkpoint effects span 9.2-47.0 points. Prompt realization is therefore part of the measurement problem.
- Abstract(参考訳): AfriSyCoの研究は、アフリカ系アメリカ人の事実コンテンツを2つの相補的なレイヤーで切り替えることに答えている。
我々は、7つのオープンウェイトチェックポイントと6つの言語にまたがる100のソース質問から得られた1,415のターン-1補正モデル-言語-item観測を解析した。
ネイティブのプロンプトでは、アサーションの支持は、言及+検証(M+V)よりも29.3ポイント、即時T2コントラストは19.0ポイントである。
3つの試験されたプロンプト族の平均値である2×2因子では、アサーションフレーミングはターゲット選択を30.4ポイント(95% CI [28.4, 32.3])増加させ、検証は17.4ポイント減少させるが、アサーション効果は検証せずに20.5ポイントから40.2ポイントに上昇する(アクション+19.7)。
この効果は611の観測の中で34.8ポイントにとどまっている。
速効効果は20.1-42.5点、Twi/Qwen3パラフレーズはターゲットの選択を70.8%から4.2%にシフトし、チェックポイント効果は9.2-47.0点である。
したがって、プロンプト実現は測定問題の一部である。
関連論文リスト
- Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation [0.0]
回答オプションを追加することで、評価の妥当性を向上することなく、複数の選択のスコアを下げることができる。
トルコのMMLU Proは58のセクションで12,000のトルコ語ソースの質問を用いてこの区別を検証している。
論文 参考訳(メタデータ) (2026-09-14T12:28:09Z) - CITECHOICE: A Causal Audit of How Document Presentation Redistributes Citation Credit in Agentic Search [0.0]
CITECHOICEは、マルチターンエージェントサーチの因果監査である。
同一の既定事実に対して独立に認証されたサポートを持つ113の同呼文書ペアを選択する。
構造化レンダリングは、ソースの入力を明示的に増加させるのではなく、引用クレジットに集中する。
論文 参考訳(メタデータ) (2026-09-14T07:47:47Z) - Structure, Association, and Decision Value: Representation-Based Difficulty Estimation for Adaptive Inference in African-Language NLI [0.0]
我々は15のアフリカ諸言語にまたがる自然言語の推論について検討した。
AfriXNLIはXNLIに由来するため、英語、フランス語、スワヒリの構成はXNLIで訓練されたモデルのクリーンな評価には役立たない。
我々の中心的な方法論的発見は、表現統計学は、ある計算的利益の概念に対して統計的に有意であり、他方とは無関係であるということである。
論文 参考訳(メタデータ) (2026-08-19T15:03:51Z) - Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap [2.8890052855500143]
我々はQwen3-8BとLlama-3.1-8B-Instructのトークン・バッジ・アーティファクトであるかどうかを検証した。
我々は、スイープの3つのQwenピークとほぼゼロの値を1024で凍結し、54万デコードで評価した。
論文 参考訳(メタデータ) (2026-08-04T19:18:41Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning [0.0]
本稿では,ペンシル・プッズル・ベンチ(Pencil Puzzle Bench)について紹介する。
62,231のパズルのデータベースから、20種にまたがる300のパズルのベンチマークを選択し、11のプロバイダから51のモデルを評価する。
ベンチマークの重要な差別化要因は、すべての中間ボード状態が、さまざまな制約に対してチェック可能であることです。
論文 参考訳(メタデータ) (2026-03-02T17:40:54Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making [38.75183725659772]
大規模言語モデル(LLM)は、複雑な推論を必要とするタスクにますます使われている。
モデル動作の理解と信頼性向上には,内部プロセスの測定が不可欠である,と我々は主張する。
計画,修正,資源制約のある意思決定という3つの中核的な側面に沿ってLCMを評価する枠組みを導入する。
論文 参考訳(メタデータ) (2025-06-13T17:59:10Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。