論文の概要: Punching Above Their Weight: Classification-Head Fine-Tuning of Tiny Language Models (TLMs) for Verifiable Multiple-Choice Tasks
- arxiv url: http://arxiv.org/abs/2607.03801v1
- Date: Sat, 04 Jul 2026 10:09:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.725695
- Title: Punching Above Their Weight: Classification-Head Fine-Tuning of Tiny Language Models (TLMs) for Verifiable Multiple-Choice Tasks
- Title(参考訳): 重みの上に打ち込む: 検証可能な複数話者タスクのためのTiny Language Models (TLMs) の分類-重み付け
- Abstract要約: 私たちはTiny Language Models (TLM) を、主流のコンシューマデバイスに適合するおよそ3Bパラメータのモデルとして定義しています。
複数のQwen3モデルにまたがる統一セットアップにおいて,LoRAに基づくファインチューニングのパラダイムを3つ比較する。
識別法により微調整されたTLMは、0/fショットのGPT-3 (175B)、PaLM (540B)、GPT-4と競合する。
- 参考スコア(独自算出の注目度): 0.11458853556386796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We define Tiny Language Models (TLMs) as models below roughly 3B parameters that fit on mainstream consumer devices. We study how to adapt them for and use them on verifiable multiple-choice tasks. We compare three LoRA-based fine-tuning paradigms (label generation, gold only, and our discriminative classification head) on a unified setup across several Qwen3 models from 0.6B to 8B and five benchmarks: HellaSwag, WinoGrande, PIQA, SciQ and ARC-C. Classification-head fine-tuning reliably outperforms label generation (+2-3%) at the 0.6B and 1.7B scales. Further, TLMs fine-tuned using the discriminative method are competitive to zero-/few-shot GPT-3 (175B), PaLM (540B) and GPT-4. The performance we report for Qwen3-0.6B and Qwen3-1.7B are SOTA on HellaSwag, WinoGrande, and PIQA.
- Abstract(参考訳): 私たちはTiny Language Models (TLM) を、主流のコンシューマデバイスに適合するおよそ3Bパラメータのモデルとして定義しています。
検証可能な複数選択タスクに対して、それらを適応し、使用する方法について研究する。
我々は,5つのベンチマーク(HellaSwag,WinoGrande,PIQA,SciQ,ARC-C)と,数種類のQwen3モデル(0。
分類ヘッド微調整は、ラベル生成(+2-3%)を0.6Bと1.7Bスケールで確実に上回る。
さらに、識別法により微調整されたTLMは、0/fショットのGPT-3 (175B)、PaLM (540B)、GPT-4と競合する。
我々が報告したQwen3-0.6BとQwen3-1.7Bのパフォーマンスは、HellaSwag, WinoGrande, PIQA上のSOTAである。
関連論文リスト
- Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction [5.070542698701158]
大言語モデル(LLM)は強い関係抽出(RE)を実現する
本研究では,小言語モデル(SLM)が汎用ドメインと文学テキスト間のギャップをいかに埋めるかを考察する。
論文 参考訳(メタデータ) (2026-06-21T17:24:31Z) - Long Live Fine-Tuning: Task-Specific Transformers Outperform Zero-Shot LLMs for Misinformation Response Classification on Reddit [5.437038443632133]
我々は,誤情報談話の微妙な分類にスケールと一般能力が十分であるという暗黙の仮定を検証した。
BART-MNLI、3つのLlama変種、3つの商用フロンティアLLM、微調整されたDistilBERTとRoBERTaの9つのモデルを比較した。
検証のコンテキストでは、欠落した信念がコストの低いエラーである場合、タスク固有の微調整の方がより信頼性の高い選択である。
論文 参考訳(メタデータ) (2026-06-02T22:58:59Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Deterministic Fuzzy Triage for Legal Compliance Classification and Evidence Retrieval [0.0]
法律チームはますます、大量の契約上の証拠をトリアージするために機械学習を使用している。
多くのモデルは不透明で非決定論的であり、HIPAAやNERC-CIPのようなフレームワークと整合するのは難しい。
決定論的双対エンコーダと透明なファジィトリアージバンドに基づく簡単な再現可能な代替法について検討する。
論文 参考訳(メタデータ) (2026-03-08T00:31:34Z) - Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation [0.4349640169711269]
ビエリク・ガード(英語: Bielik Guard)は、ポーランド語の安全分類法である。
ポーランドの6,885のテキストからなるコミュニティアノテーション付きデータセットに基づいて、これらのモデルは、Hate/Aggression、Vulgarities、Sexual Content、Crith、Self-Harmという5つの安全カテゴリのコンテンツを分類する。
論文 参考訳(メタデータ) (2026-02-08T12:57:04Z) - CLaC at DISRPT 2025: Hierarchical Adapters for Cross-Framework Multi-lingual Discourse Relation Classification [0.0509780930114934]
タスク3では、39のコーパスにまたがる17の談話関係ラベルが16の言語と6の談話フレームワークで統合されている。
まず、多言語BERTベースのモデルに2つの引数順序戦略とプログレッシブ・フリーズ比を併用してタスクをベンチマークする。
次に、ゼロショットおよび少数ショット設定でプロンプトベースの大規模言語モデルを評価し、新たに提案された統一ラベルに対してLLMがどう反応するかを理解する。
論文 参考訳(メタデータ) (2025-09-21T03:34:31Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z) - InheritSumm: A General, Versatile and Compact Summarizer by Distilling
from GPT [75.29359361404073]
InheritSummは、蒸留によりGPT-3.5から派生した汎用的でコンパクトな要約モデルである。
GPT-3.5と同様、ゼロショットやスプリットショットの設定でパフォーマンスが向上する。
論文 参考訳(メタデータ) (2023-05-22T14:52:32Z) - Large Language Models in the Workplace: A Case Study on Prompt
Engineering for Job Type Classification [58.720142291102135]
本研究では,実環境における職種分類の課題について検討する。
目標は、英語の求職が卒業生やエントリーレベルの地位に適切かどうかを判断することである。
論文 参考訳(メタデータ) (2023-03-13T14:09:53Z) - Few-shot Instruction Prompts for Pretrained Language Models to Detect
Social Biases [55.45617404586874]
我々は、事前訓練された言語モデル(LM)を誘導する数ショットの命令ベース手法を提案する。
大規模なLMは、微調整モデルとよく似た精度で、異なる種類の細粒度バイアスを検出できることを示す。
論文 参考訳(メタデータ) (2021-12-15T04:19:52Z) - DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with
Gradient-Disentangled Embedding Sharing [117.41016786835452]
本稿では,DeBERTaモデルの改良を目的とした,事前学習型言語モデルDeBERTaV3を提案する。
ELECTRAでのバニラ埋め込み共有は、トレーニング効率とモデルパフォーマンスを損なう。
そこで本研究では、タグ・オブ・ウォーのダイナミクスを回避するために、新しい勾配距離の埋め込み方式を提案する。
論文 参考訳(メタデータ) (2021-11-18T06:48:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。