論文の概要: Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D
- arxiv url: http://arxiv.org/abs/2607.16072v1
- Date: Fri, 17 Jul 2026 15:56:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.893796
- Title: Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D
- Title(参考訳): 最前線の言語モデルからコピーへ:テキストは2Dでより良く見える
- Abstract要約: 2D-RoPEはテキストを1Dシーケンスではなく2Dグリッドに整理し、各トークンに行IDと列IDを割り当てる。
合成コピー実験では、2D-RoPEの浅いトランスフォーマーは、トレーニング中に見たものより数百倍長い入力長で完璧にコピーできる。
- 参考スコア(独自算出の注目度): 19.684508420641816
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While large language models (LLMs) can solve advanced reasoning problems in seconds, we show that even frontier models fail to perform a much simpler operation: exactly copying an input string that lies well within their context windows. We attribute this failure to positional encodings in Transformer architectures, whose inductive bias favors copying through a shortcut based on matching local contexts rather than carefully locating the corresponding input positions. To address this issue, we introduce 2D-RoPE, which organizes text into a 2D grid rather than a 1D sequence and assigns each token a row ID and a column ID. Under this view, copying becomes simply retrieving input tokens at a fixed column offset, which makes the task easy to learn. In synthetic copy experiments, shallow Transformers with 2D-RoPE achieve perfect copying at input lengths hundreds of times longer than those seen during training, whereas standard positional encodings fall far behind. We further show that the advantage of 2D-RoPE language models on copy tasks consistently holds in large-scale pretraining on DCLM with model sizes up to 1.4B parameters. Overall, our results suggest that viewing text in 2D can benefit language modeling, and we hope this encourages future work to further explore the potential of 2D positional encodings.
- Abstract(参考訳): 大規模言語モデル(LLM)は数秒で高度な推論問題を解くことができるが、フロンティアモデルでさえより単純な操作を行なわなかった。
この失敗はトランスフォーマーアーキテクチャにおける位置符号化の失敗によるもので、インダクティブバイアスは、対応する入力位置を慎重に位置決めするのではなく、一致したローカルコンテキストに基づいてショートカットを通してコピーすることを好む。
この問題に対処するために,テキストを1Dシーケンスではなく2Dグリッドに整理し,各トークンに行IDと列IDを割り当てる2D-RoPEを導入する。
このビューでは、コピーは単に固定列オフセットで入力トークンを取得するだけになり、タスクの学習が容易になる。
合成コピー実験では、2D-RoPEの浅いトランスフォーマーは、トレーニング中に見たものよりも数百倍長い入力長で完璧にコピーする。
さらに、コピータスクにおける2D-RoPE言語モデルの利点は、最大1.4Bのパラメータを持つDCLM上での大規模事前学習において一貫して成り立っていることを示す。
以上の結果から,テキストを2次元で見ることは言語モデリングに有用であることが示唆された。
関連論文リスト
- When 2D Tasks Meet 1D Serialization: On Serialization Friction in Structured Tasks [49.84804136268971]
大規模言語モデルは構造化された入力を1Dトークンシーケンスとして処理する。
ロウカラムアライメントと局所地区は、入力で直接表現されなくなった。
我々は、シリアライズされた入力に対してテキストのみの言語経路と、視覚増強された経路を比較した。
論文 参考訳(メタデータ) (2026-04-29T23:58:45Z) - PatchAlign3D: Local Feature Alignment for Dense 3D Shape understanding [67.15800065888887]
現在の3次元形状の基礎モデルは、グローバルなタスク(検索、分類)において優れているが、局所的な部分レベルの推論には不十分である。
本稿では,ポイントクラウドから直接,言語対応のパッチレベル機能を生成するエンコーダのみの3Dモデルを提案する。
我々の3Dエンコーダは、テストタイムのマルチビューレンダリングなしで高速なシングルパス推論によるゼロショット3D部分分割を実現する。
論文 参考訳(メタデータ) (2026-01-05T18:55:45Z) - Adapting Human Mesh Recovery with Vision-Language Feedback [17.253535686451897]
視覚言語モデルを用いて対話的な身体部分記述を生成する。
我々はテキストエンコーダとポーズVQ-VAEをトレーニングし、テキストを共有潜在空間内のボディポーズにアライメントする。
モデルは正確な3D知覚と画像の一貫性を持ったポーズを生成することができる。
論文 参考訳(メタデータ) (2025-02-06T07:42:00Z) - Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation [81.45400849638347]
In-image Machine Translation (IIMT) は、ソース言語のテキストを含む画像をターゲット言語の翻訳を含む画像に変換することを目的としている。
本稿では,4つのモジュールからなるエンドツーエンドIIMTモデルを提案する。
本モデルでは,70.9%のパラメータしか持たないカスケードモデルと比較して競争性能が向上し,画素レベルのエンド・ツー・エンドIIMTモデルよりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-07-03T08:15:39Z) - SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models [84.71887272654865]
SparseCtrlは時間的にスパース信号で柔軟な構造制御を可能にする。
トレーニング済みのT2Vモデルに触ることなく、これらのスパース信号を処理するための追加条件が組み込まれている。
提案手法はスケッチ,深度マップ,RGB画像など,さまざまなモダリティと互換性がある。
論文 参考訳(メタデータ) (2023-11-28T16:33:08Z) - Language Quantized AutoEncoders: Towards Unsupervised Text-Image
Alignment [81.73717488887938]
Language-Quantized AutoEncoder (LQAE)は、事前訓練された言語モデルを利用して、教師なしの方法でテキストイメージデータを整列することを学ぶ。
LQAEは類似した画像を類似したテキストトークンのクラスタで表現することを学び、一致したテキストイメージペアを使わずにこれら2つのモダリティを整列させる。
これにより、大きな言語モデル(例えばGPT-3)による少数ショット画像の分類や、BERTテキストの特徴に基づく画像の線形分類が可能になる。
論文 参考訳(メタデータ) (2023-02-02T06:38:44Z) - Learning 3D Representations from 2D Pre-trained Models via
Image-to-Point Masked Autoencoders [52.91248611338202]
I2P-MAEという名前のイメージ・ツー・ポイント・マスケッド・オートエンコーダを用いて,2次元事前学習モデルから優れた3次元表現を得る方法を提案する。
自己教師付き事前学習により、よく学習された2D知識を利用して、3Dマスクによる自動エンコーディングをガイドする。
I2P-MAEは最先端の90.11%の精度、+3.68%の精度で第2ベストに到達し、より優れた転送能力を示す。
論文 参考訳(メタデータ) (2022-12-13T17:59:20Z) - MILES: Visual BERT Pre-training with Injected Language Semantics for
Video-text Retrieval [43.2299969152561]
ゼロショット・ファインチューン評価プロトコルを用いた4つのデータセットのテキスト・ビデオ検索手法
提案手法は,ゼロショットおよびファインチューン評価プロトコルを用いた4つのデータセット上でのテキスト・ビデオ検索における最先端手法よりも優れる。
論文 参考訳(メタデータ) (2022-04-26T16:06:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。