論文の概要: A Durability and Cross-Language Transfer Benchmark for a Validated Teaching-Feedback Classification Protocol
- arxiv url: http://arxiv.org/abs/2607.11873v1
- Date: Mon, 13 Jul 2026 17:56:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.580122
- Title: A Durability and Cross-Language Transfer Benchmark for a Validated Teaching-Feedback Classification Protocol
- Title(参考訳): 教師-フィードバック分類プロトコルの耐久性と言語間移動ベンチマーク
- Authors: Esteban U. Vega Barajas,
- Abstract要約: 先行研究では、このようなコメントをテーマカテゴリーと感情によって分類する検証済みのプロトコルが導入された。
3世代にわたるスペインのオリジナルのデータで再実行し、語彙的特徴を疎外し、トランスフォーマーの埋め込みを凍結し、その感情タスクを英語に転送しました。
2026年のフロンティア・モデルでは、最も難しいスペイン語のタスクにおいて、最も高いテーマのF1を投稿しているが、安価なモデルに対して感情上の優位性はなく、英語では説明的な分離も示していない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Institutions collect far more open-ended teaching-evaluation feedback than they read. A prior study introduced a validated protocol for classifying such comments by thematic category and sentiment, built from a documented annotation guide, an intra-annotator reliability measurement, stratified cross-validation, and a held-out evaluation on a Spanish institutional corpus with a frozen-encoder design. Two questions limit its reuse: whether a protocol fixed to 2019-era frozen embeddings stays competitive as representation methods advance, and whether it transfers to a second language. We re-run it on the original Spanish data across three representation generations, sparse lexical features, frozen transformer embeddings, and prompted large language models, and transfer its sentiment task to English with a balanced 45,000-comment corpus checked against an aspect-labeled education dataset. Treating paired comparisons as descriptive, we find the protocol durable: a 2026 frontier model posts the highest thematic F1 on the hardest Spanish task, yet shows no sentiment advantage over a cheap model and no descriptive separation from it on English, so model choice is a deployment decision, not a property of the method.
- Abstract(参考訳): 機関は、読むよりもはるかにオープンな教育評価フィードバックを収集する。
先行研究では、文書化されたアノテーションガイド、注釈内信頼性測定、階層化されたクロスバリデーション、凍結エンコーダ設計によるスペインの制度的コーパスに対する保留評価から、このようなコメントをテーマカテゴリーと感情で分類するための検証済みのプロトコルが導入された。
2019年に凍結した埋め込みに固定されたプロトコルが、表現メソッドが進行するにつれて競争力を維持するかどうか、第二言語に移行するかどうか、という2つの疑問がある。
3世代にわたるスペインのオリジナルのデータ、緩やかな語彙の特徴、凍結したトランスフォーマーの埋め込み、そして大きな言語モデル、そしてその感情タスクをバランスの取れた45,000のコーパスで英語に転送し、アスペクトラベルの教育データセットに対してチェックしました。
2026年のフロンティアモデルでは、最も難しいスペイン語タスクにおいて、最も高いテーマのF1をポストするが、安価なモデルよりも感情的な優位性はなく、それと説明的な分離が英語でできないため、モデルの選択は、メソッドの特性ではなくデプロイメントの決定である。
関連論文リスト
- A Komi-Yazva--Russian Parallel Corpus and Evaluation Protocol for Zero- and Few-Shot LLM Translation [0.0]
我々は,最初のコミヤズヴァ-ロシア並列コーパスを明示的な評価プロトコルとともに提示する。
データセットには、74の物語テキストから457の一致した文対が含まれている。
我々はこの設定を用いて、Komi-Yazva-to- Russian翻訳における近代的な大規模言語モデルの比較を行う。
論文 参考訳(メタデータ) (2026-06-04T17:26:38Z) - KIT-TIP-NLP at MultiPride: Continual Learning with Multilingual Foundation Model [0.06999740786886534]
このフレームワークは、データ不足、クラス不均衡、感情表現の言語間変異といった、相互に絡み合った3つの方法論的課題を処理する。
クロスバリデーションによるデータ駆動モデル選択、バックトランスレーションによるセマンティック保存強化、動的エポックレベルのアンダーサンプリングによるインダクティブトランスファー学習、ドメイン固有の知識注入を統合する。
RUN 1 は拡張とアンダーサンプリングによる帰納的伝達学習であり、RUN 2 はマスク付き言語モデリング事前学習、RUN 3 と RUN 4 は ROC 分析によって最適化された言語固有の決定しきい値によって改善された以前の予測である。
論文 参考訳(メタデータ) (2026-05-13T12:10:47Z) - Cross-Lingual Stability of LLM Judges Under Controlled Generation: Evidence from Finno-Ugric Languages [0.22009842278462158]
大規模言語モデル(LLM)の言語間評価は、典型的には、真のモデルの性能差と測定不安定性の2つの要因を混同する。
対象言語が異なる場合に生成条件を一定に保って評価信頼性を評価する。
本研究は, 形態学的に豊かな言語における談話レベルの評価には, ゼロショット・ジャッジ・トランスファーが信頼できないことを示唆している。
論文 参考訳(メタデータ) (2026-02-02T16:27:32Z) - SLRTP2025 Sign Language Production Challenge: Methodology, Results, and Future Work [87.9341538630949]
第1回手話生産チャレンジはCVPR 2025で第3回SLRTPワークショップの一環として開催された。
コンペティションの目的は、音声言語文からスケルトンポーズのシーケンスに変換するアーキテクチャを評価することである。
本稿では,挑戦設計と入賞方法について述べる。
論文 参考訳(メタデータ) (2025-08-09T11:57:33Z) - Cross-lingual QA: A Key to Unlocking In-context Cross-lingual Performance [2.371686365695081]
クロスランガルQAは、質問と回答の部分のみを翻訳し、翻訳コストを削減できる言語間プロンプト手法である。
4つのタイプ的多言語ベンチマークの実験により、クロスランガルQAはモデルに効果的に刺激を与え、クロスランガルの知識を引き出すことを示した。
本研究は,言語間実例を用いたオープンソースMLLMの高速化により,モデルスケールの増大に伴い,性能が向上することを示す。
論文 参考訳(メタデータ) (2023-05-24T15:14:49Z) - BUFFET: Benchmarking Large Language Models for Few-shot Cross-lingual
Transfer [81.5984433881309]
本稿では,54言語にまたがる15のタスクをシーケンス・ツー・シーケンス・フォーマットで統一するBUFFETを紹介する。
BUFFETは、数発の言語間移動のための厳密で公平な評価フレームワークを確立するように設計されている。
コンテクスト内言語間移動における改善の余地は極めて大きいことが判明した。
論文 参考訳(メタデータ) (2023-05-24T08:06:33Z) - Dual-Alignment Pre-training for Cross-lingual Sentence Embedding [79.98111074307657]
本稿では,言語間文埋め込みのためのDAP(Dual-alignment pre-training)フレームワークを提案する。
そこで本研究では,一方の文脈化トークン表現を用いて翻訳相手を再構成する,新しい表現翻訳学習(RTL)タスクを提案する。
我々の手法は文の埋め込みを大幅に改善できる。
論文 参考訳(メタデータ) (2023-05-16T03:53:30Z) - VECO 2.0: Cross-lingual Language Model Pre-training with
Multi-granularity Contrastive Learning [56.47303426167584]
複数粒度アライメントを持つコントラスト学習に基づく言語間事前学習モデルVECO2.0を提案する。
具体的には、シーケンス・ツー・シーケンスアライメントが誘導され、並列対の類似性を最大化し、非並列対を最小化する。
トークン・ツー・トークンのアライメントは、シソーラス辞書を介して発掘された同義トークンと、バイリンガルな例の他の未使用トークンとのギャップを埋めるために統合される。
論文 参考訳(メタデータ) (2023-04-17T12:23:41Z) - IGLUE: A Benchmark for Transfer Learning across Modalities, Tasks, and
Languages [87.5457337866383]
画像認識言語理解評価ベンチマークについて紹介する。
IGLUEは、視覚的質問応答、クロスモーダル検索、グラウンドド推論、20言語にわたるグラウンドドエンターテイメントタスクをまとめて提供する。
翻訳-テストの転送はゼロショットの転送よりも優れており、少数ショットの学習は多くのタスクに役立てることが難しい。
論文 参考訳(メタデータ) (2022-01-27T18:53:22Z) - On the Limitations of Cross-lingual Encoders as Exposed by
Reference-Free Machine Translation Evaluation [55.02832094101173]
クロスランガルエンコーダの評価は通常、教師付き下流タスクにおけるゼロショットのクロスランガル転送または教師なしのクロスランガル類似性によって行われる。
本稿では、ソーステキストと(低品質な)システム翻訳を直接比較するMT(Reference-free Machine Translation)の評価について述べる。
事前学習したM-BERTとLASERで得られた最先端の言語間セマンティック表現に基づいて,様々なメトリクスを体系的に検討する。
参照なしMT評価において,セマンティックエンコーダとしての性能は低く,その2つの重要な限界を同定する。
論文 参考訳(メタデータ) (2020-05-03T22:10:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。