論文の概要: LIFT: Last-Mile Fine-Tuning for Table Explicitation
- arxiv url: http://arxiv.org/abs/2605.13424v1
- Date: Wed, 13 May 2026 12:19:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:28.035424
- Title: LIFT: Last-Mile Fine-Tuning for Table Explicitation
- Title(参考訳): LIFT:テーブルエクスプリケーションのための最後のミレニアムファインチューニング
- Authors: Divij Khaitan, Ashish Tiwari,
- Abstract要約: 本稿では,構造化されていないクリップボードテキストから,事前学習された大規模言語モデルから初期テーブルを抽出するパイプラインLiftを提案する。
3つのデータセットから2596テーブルのベンチマークでは、LiftはエンドツーエンドのSLMファインチューニングにマッチするか、超えている。
- 参考スコア(独自算出の注目度): 3.0657548822958063
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We propose last-mile fine-tuning, or Lift, a pipeline in which a pre-trained large language model extracts an initial table from unstructured clipboard text, and a fine-tuned small language model (1B-24B parameters SLM) repairs errors in the extracted table. On a benchmark of 2,596 tables from three datasets, Lift matches or exceeds end-to-end SLM fine-tuning on tree-edit-distance-based similarity (TEDS) metric while requiring as little as 1,000 training examples - where it outperforms end-to-end fine-tuning by up to 0.144 TEDS points. We term this approach last-mile fine-tuning and show it also more robust to input format variability. Comparisons with self-debug and end-to-end fine-tuning approaches show that last-mile fine-tuning provides an attractive option when training data is limited or when robustness to input variation is sought without compromising on accuracy.
- Abstract(参考訳): 我々は、未構造化クリップボードテキストから事前学習された大言語モデルが初期テーブルを抽出するパイプラインであるラストマイル微調整(Lft)を提案し、細調整された小言語モデル(1B-24BパラメータSLM)が抽出されたテーブルのエラーを修復する。
3つのデータセットから2,596テーブルのベンチマークで、Liftは、最大1000のトレーニング例を必要とするながら、ツリー-ディジット-ディスタンス-ベース類似性(TEDS)メトリックのエンドツーエンドのSLM微調整にマッチするか、あるいは超える。
このアプローチを最後の1マイルの微調整と呼び、入力フォーマットの可変性もより堅牢であることを示す。
自己デバッグやエンドツーエンドのファインチューニングと比較すると、トレーニングデータに制限がある場合や、精度を犠牲にすることなく入力変動に対する堅牢性を求める場合、ラストマイルのファインチューニングは魅力的な選択肢となる。
関連論文リスト
- Robust LLM-based Column Type Annotation via Prompt Augmentation with LoRA Tuning [0.749377967268953]
カラムタイプ。
CTAはスキーマアライメントとセマンティック理解を実現するための基本的なステップです。
既存のエンコーダのみの言語モデルでは,ラベル付き列を微調整すると高い精度が得られる。
本稿では,CTAのパラメータ効率向上のためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-28T02:04:17Z) - Context-aware Prompt Tuning: Advancing In-Context Learning with Adversarial Methods [69.36397993451742]
In this work introduced Context-aware Prompt Tuning (CPT) - ICL, PT, and adversarial attack。
入力および出力フォーマットのユニークな構造を考慮して、特定のコンテキストトークンを変更する。
敵の攻撃にインスパイアされた我々は、損失を最大化するのではなく、最小化に焦点をあてて、コンテキストに存在するラベルに基づいて入力を調整する。
論文 参考訳(メタデータ) (2024-10-22T17:45:47Z) - ETM: Modern Insights into Perspective on Text-to-SQL Evaluation in the Age of Large Language Models [8.618945530676614]
Execution Accuracy (EXE) と Exact Set Matching Accuracy (ESM) は、パフォーマンスを誤って表現できる固有の制限に悩まされている。
我々は,構文的要素と意味的要素の両方を用いてクエリを比較することで,これらの問題を緩和する新しい指標ETM(Enhanced Tree Matching)を導入する。
ETM と ESM は23.0% と 28.9% の偽陽性と負の比率を産出でき、EMM はそれぞれ 0.3% と 2.7% に減少する。
論文 参考訳(メタデータ) (2024-07-10T02:20:19Z) - Federated Full-Parameter Tuning of Billion-Sized Language Models with Communication Cost under 18 Kilobytes [53.4856038354195]
事前訓練された大規模言語モデル(LLM)は、自然言語命令に対する応答性を改善するために微調整が必要である。
FedKSeedは、ランダムシードの有限セットによるゼロ階最適化を採用している。
サーバとクライアント間の通信要求を大幅に減らし、ランダムなシードをわずかに減らします。
論文 参考訳(メタデータ) (2023-12-11T13:03:21Z) - WSPAlign: Word Alignment Pre-training via Large-Scale Weakly Supervised
Span Prediction [31.96433679860807]
既存の単語アライメント手法の多くは、手動アライメントデータセットやパラレルコーパスに依存している。
我々は正しい、完全に整合した、平行した文の要求を緩和する。
次に、このような大規模弱教師付きデータセットを用いて、スパン予測による単語アライメント事前学習を行う。
論文 参考訳(メタデータ) (2023-06-09T03:11:42Z) - DSEE: Dually Sparsity-embedded Efficient Tuning of Pre-trained Language
Models [152.29364079385635]
事前訓練されたモデルが大きくなればなるほど、微調整のプロセスは時間がかかり、計算コストがかかる可能性がある。
本稿では,重み更新と最終モデルの重み付けに先立って,疎度を活用することで,資源・パラメータ効率の微調整を行うフレームワークを提案する。
提案するフレームワークは,Dually Sparsity-Embeded Efficient Tuning (DSEE)と呼ばれ,パラメータ効率のよい微調整とリソース効率の推論という2つの重要な目標を達成することを目的としている。
論文 参考訳(メタデータ) (2021-10-30T03:29:47Z) - Prefix-Tuning: Optimizing Continuous Prompts for Generation [85.6357778621526]
微調整は、大規模な事前訓練された言語モデルを使用して下流のタスクを実行する事実上の方法です。
自然言語生成タスクの微調整に代わる軽量なプレフィックスチューニングを提案する。
パラメータの0.1%しか学習しないことで、プレフィックスチューニングは完全なデータ設定で同等のパフォーマンスを得る。
論文 参考訳(メタデータ) (2021-01-01T08:00:36Z) - Understanding tables with intermediate pre-training [11.96734018295146]
我々は、テーブルベースのBERTモデルであるTAPAASを適用して、エンターテイメントを認識する。
我々は,テーブルプルーニングを前処理ステップとして評価し,トレーニングと予測効率を大幅に向上させる。
論文 参考訳(メタデータ) (2020-10-01T17:43:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。