論文の概要: ODE-Based Transformer Decoders for Iterative Sign Language Translation
- arxiv url: http://arxiv.org/abs/2608.11352v1
- Date: Tue, 11 Aug 2026 18:58:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.356763
- Title: ODE-Based Transformer Decoders for Iterative Sign Language Translation
- Title(参考訳): 繰り返し手話翻訳のためのODEベースのトランスフォーマーデコーダ
- Abstract要約: 手話翻訳はTransformerアーキテクチャで大きな成果を上げている。
最近の改良は、計算量を増やすコストでモデルのキャパシティをスケーリングすることに大きく依存している。
モデルサイズを増大させることなく改善するパラメータ効率の代替案を提案する。
- 参考スコア(独自算出の注目度): 1.054735384167421
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Sign language translation has achieved strong results with Transformer architectures, yet recent improvements largely rely on scaling model capacity at the cost of increased computation. We propose a parameter-efficient alternative that improves expressiveness without increasing model size. Rather than scaling capacity, we focus on enhancing the update dynamics of iterative refinement decoders, where each refinement step corresponds to one internal decoder iteration that progressively improves the latent representation before translation generation. We reinterpret residual refinement updates from an Ordinary Differential Equation (ODE) perspective and replace them with higher-order numerical integration schemes, namely Runge--Kutta methods (RK-2 and RK-4). These methods perform multiple function evaluations within each refinement step to produce more accurate and stable representation updates without adding decoder parameters. To the best of our knowledge, this is the first application of ODE-inspired update dynamics to sign language translation. RK-2 achieves 22.96 BLEU-4 on the PHOENIX-2014-T test set and 19.34 BLEU-4 on the CSL-Daily test set, outperforming the IPSLT baseline on both benchmarks, with fewer decoder layers and refinement iterations on CSL-Daily. These results suggest that stronger refinement dynamics can improve translation performance under parameter-efficient decoder designs, providing a complementary alternative to conventional model scaling.
- Abstract(参考訳): 手話翻訳はTransformerアーキテクチャで大きな成果を上げているが、最近の改良は計算量を増やすコストでモデルのキャパシティのスケーリングに大きく依存している。
モデルサイズを増大させることなく表現性を向上するパラメータ効率の代替案を提案する。
キャパシティを拡大するよりも、反復的精錬デコーダの更新ダイナミクスの向上に注力し、各精錬ステップは、翻訳生成前の潜伏表現を漸進的に改善する1つの内部デコーダイテレーションに対応する。
本稿では, 正規微分方程式(ODE)の観点からの残差分更新を再解釈し, 高次数値積分法であるRunge-Kutta法(RK-2, RK-4)に置き換える。
これらの手法は、デコーダパラメータを追加することなく、より正確で安定した表現更新を生成するために、各精細ステップ内で複数の関数評価を行う。
私たちの知る限りでは、これはODEにインスパイアされた言語翻訳のための更新ダイナミクスの最初の応用です。
RK-2はPHOENIX-2014-Tテストセットで22.96 BLEU-4、CSL-Dailyテストセットで19.34 BLEU-4を達成し、両方のベンチマークでIPSLTベースラインを上回り、デコーダ層が減り、CSL-Dailyで改良を繰り返した。
これらの結果から,パラメータ効率の高いデコーダ設計による変換性能の向上が期待でき,従来のモデルスケーリングの代替となることが示唆された。
関連論文リスト
- Sequence Repetition Enhances Token Embeddings and Improves Sequence Labeling with Decoder-only Language Models [2.91425891370655]
シーケンス反復(SR)はデコーダのみのモデルで双方向性を実現するための、より侵襲的な代替手段である。
SRは本質的にデコーダを双方向にし,トークンレベルの埋め込みの品質を向上し,エンコーダや非マスケデコーダを超越することを示す。
以上の結果から,SRはデコーダの構造的制約を緩和し,より効率的で適応可能なLMを実現し,他のトークンレベルタスクにも適用可能であることが示唆された。
論文 参考訳(メタデータ) (2026-01-24T20:49:13Z) - Continuous Autoregressive Language Models [56.49239051750678]
我々はCALM(Continuous Autoregressive Language Models)を紹介する。
CALMは高忠実度オートエンコーダを使用して、Kトークンの塊を1つの連続ベクトルに圧縮する。
我々は、堅牢なトレーニング、評価、および制御可能なサンプリングを可能にする包括的可能性のないフレームワークを開発する。
論文 参考訳(メタデータ) (2025-10-31T17:58:11Z) - Latent Thought Models with Variational Bayes Inference-Time Computation [52.63299874322121]
ラテント思考モデル(LTM)は、ラテント空間における明示的な事前モデルに従う明示的なラテント思考ベクトルを包含する。
LTMは自己回帰モデルや離散拡散モデルよりも優れたサンプルおよびパラメータ効率を示す。
論文 参考訳(メタデータ) (2025-02-03T17:50:34Z) - Byte Latent Transformer: Patches Scale Better Than Tokens [101.10994909832063]
Byte Latent Transformer (BLT) はバイトを動的サイズのパッチにエンコードする。
固定推論コストに対して、BLTはパッチとモデルサイズの両方を同時に拡大することにより、トークン化ベースのモデルよりもはるかに優れたスケーリングを示している。
論文 参考訳(メタデータ) (2024-12-13T05:33:32Z) - Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning [73.73967342609603]
トラクションエラーを最小限に抑えるための予測-相関学習フレームワークを提案する。
また、高次予測器を強化するために、指数関数的移動平均ベース係数学習法を提案する。
我々のモデルは3.8BのDeepNetを平均2.9のSacreBLEUで上回り、1/3のパラメータしか使用していない。
論文 参考訳(メタデータ) (2024-11-05T12:26:25Z) - ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model [9.1108256816605]
大規模言語モデル(LLM)のトークン化機能を置き換えることにより,モデル表現と処理効率を向上させる手法を提案する。
本手法は,トークン化器を置き換えたモデルの性能を維持しつつ,長文の復号速度を大幅に向上させる。
論文 参考訳(メタデータ) (2024-10-06T03:01:07Z) - Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT [120.39362661689333]
本稿では,Lumina-T2Xの改良版を提案する。
これらの改善により、Lumina-Nextは基本的なテキスト・ツー・イメージ生成の品質と効率を向上するだけでなく、優れた解像度の補間能力も示している。
論文 参考訳(メタデータ) (2024-06-05T17:53:26Z) - Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens [15.566726645722657]
投機的サンプリングに特化して設計された新しいフレームワークを提案する。
このフレームワーク内では、以前に生成されたトークンを効果的に活用し、後続の単語を予測する軽量なドラフトモデルを導入する。
我々は、バニラ自動回帰復号方式と比較して平均遅延速度比が2.7倍になるという印象的な結果を示した。
論文 参考訳(メタデータ) (2024-02-24T08:10:39Z) - Bayesian Prompt Learning for Image-Language Model Generalization [64.50204877434878]
我々はベイズ法の正規化能力を用いて、変分推論問題としてプロンプト学習をフレーム化する。
提案手法は,プロンプト空間を正規化し,目に見えないプロンプトへの過剰適合を低減し,目に見えないプロンプトのプロンプト一般化を改善する。
ベイジアン・プロンプト学習がプロンプト空間の適切なカバレッジを提供する15のベンチマークを実証的に示す。
論文 参考訳(メタデータ) (2022-10-05T17:05:56Z) - E2S2: Encoding-Enhanced Sequence-to-Sequence Pretraining for Language
Understanding and Generation [95.49128988683191]
シークエンス・ツー・シークエンス(seq2seq)学習は、大規模事前学習言語モデルにおいて一般的な方法である。
本稿では,エンコーディング強化のseq2seq事前学習戦略,すなわちE2S2を提案する。
E2S2は、より効率的な自己教師付き情報をエンコーダに統合することで、Seq2seqモデルを改善する。
論文 参考訳(メタデータ) (2022-05-30T08:25:36Z) - Handwritten Mathematical Expression Recognition with Bidirectionally
Trained Transformer [2.952085248753861]
トランスデコーダデコーダを使用してRNNベースのデコーダを置き換える。
実験により, CROHME 2014における現在の最先端手法のExpRateを2.23%改善した。
論文 参考訳(メタデータ) (2021-05-06T03:11:54Z) - On the Encoder-Decoder Incompatibility in Variational Text Modeling and
Beyond [82.18770740564642]
変分オートエンコーダ(VAE)は、潜時変数と償却変分推論を結合する。
我々は,データ多様体のパラメータ化が不十分なエンコーダ・デコーダの不整合性を観察する。
同一構造を持つ決定論的オートエンコーダとVAEモデルを結合した結合型VAEを提案する。
論文 参考訳(メタデータ) (2020-04-20T10:34:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。