論文の概要: Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation
- arxiv url: http://arxiv.org/abs/2606.25432v2
- Date: Mon, 29 Jun 2026 19:08:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.691753
- Title: Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation
- Title(参考訳): ブレビティは推論効率の魂--データキュレーションによるVLMの精度向上
- Authors: DatologyAI, :, Matthew L. Leavitt, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, David Schwab, Bogdan Gaza, Ari Morcos,
- Abstract要約: 推論効率は通常、モデルを縮小することによって追求される。
しかし、出力長は膨らみ続けており、標準ツールキットが未修正のまま残しているのはまさにそのコンポーネントです。
ここでは、簡潔さは推論効率の欠けているレバーであり、事前学習したデータキュレーションは、それを引っ張る実践的な方法である、と論じる。
- 参考スコア(独自算出の注目度): 6.388637009168626
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Inference efficiency is typically pursued by shrinking the model: distillation, pruning, quantization, and sparse routing each lower per-token cost while treating token count as fixed. But output length has been inflating, and it is precisely the component the standard toolkit leaves untouched. Here, we argue that brevity is the missing inference-efficiency lever, and that pretraining data curation is a practical way to pull it: a model trained on concise, correct data learns to answer in fewer tokens; i.e. it has a lower Cost-of-Pass. We apply our VLM curation pipeline to the MAmmoTH-VL single-image subset, and compare models trained on our curated data, the standard MAmmoTH-VL data, and external open-weight frontier VLMs. On a controlled 20-evaluation set and 14 VLMs at 1B-4B activated parameters, we hold output length fixed with a per-model regression, separating brevity from quality, and price models in FLOPs per correct answer. Curation buys a 35x Cost-of-Pass advantage over the most verbose 4B comparator (Qwen3.5-4B) within $\sim$1 pp of accuracy (0.41 vs 14.58 TFLOPs per correct answer; 0.691 vs 0.704 mean accuracy). Curation also buys a +17.55-percentage-point matched-length accuracy gain over the uncurated baseline that grows with model scale (from +16.7 pp at 1B to +21.2 pp at 4B). This brevity improvement concedes no quality: generic verbosity buys no accuracy at any capability or scale, and the window where reasoning-structured verbosity still earns its tokens shrinks from 4 of 8 capability groups at 2B to 1 of 8 at 4B. Per example, the concise model even reaches correct answers the verbose reasoning model misses, marking reasoning as a distinct curation target rather than something brevity gives up. Inference efficiency in this regime is a tokens-per-correct problem, and brevity is the lever that targets it directly.
- Abstract(参考訳): 推論効率は一般的に、蒸留、プルーニング、量子化、スパースルーティングといったモデルを縮小し、トークン数を固定として扱うことで追求される。
しかし、出力長は膨らみ続けており、標準ツールキットが未修正のまま残しているのはまさにそのコンポーネントです。
ここでは、簡潔さは推論効率の欠如であり、事前学習したデータキュレーションは、それを引き出すための実践的な方法である、と論じる。
我々は、VLMキュレーションパイプラインをMAmmoTH-VL単一イメージサブセットに適用し、キュレートされたデータ、標準MAmmoTH-VLデータ、および外部オープンウェイトフロンティアVLMに基づいてトレーニングされたモデルを比較する。
1B-4B 活性化パラメータの制御された 20-評価セットと 14 個の VLM に対して、モデル毎の回帰で固定された出力長を保持し、品質から可視性を分離し、正解当たりの FLOP で価格モデルを作成する。
Curationは、最も冗長な4Bコンパレータ(Qwen3.5-4B)に対して、$\sim$1 ppの精度(正解あたり0.41対14.58 TFLOP; 0.691対0.704平均精度)で35倍のコスト・オブ・パスの優位性を購入する。
キュレーションはまた、モデルスケールで成長する未計算のベースライン(+16.7 pp at 1B から +21.2 pp at 4B まで)に対して、+17.55 パーセントの一致した長さの精度のゲインを購入する。
この簡潔さの改善は品質を損なうものではない: 汎用的な冗長性は任意の能力や規模で正確さを購入せず、推論構造化された冗長性がまだトークンを得る窓は、2Bで8つの機能群のうち4つから4Bで8つの機能群に縮小する。
例えば、簡潔なモデルは、冗長な推論モデルミスに対する正しい答えまで到達し、簡潔さが諦めるのではなく、独自のキュレーションターゲットとして推論をマークする。
この状態における推論効率はトークン毎の正当性の問題であり、簡潔性は直接ターゲットとするレバーである。
関連論文リスト
- CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - 20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone [17.84750728317393]
データキュレーションは、20のVLMベンチマークにおいて、平均で+11.7ppの性能を向上できることを示す。
2BではInternVL3.5-2Bを9.9ppで17倍のトレーニング計算で上回りました。
データキュレーションは、より良いVLMを構築するための高平均ツールであり、最大150倍のトレーニング計算で最前線の精度に達する。
論文 参考訳(メタデータ) (2026-05-12T01:51:03Z) - Self-Calibrating Language Models via Test-Time Discriminative Distillation [18.46710400838861]
大規模言語モデル(LLM)は、しばしば間違って答える質問に対して体系的に過度に信頼されている。
我々は、テスト時間トレーニング(TTT)パイプラインである$textbfSECL$ ($textbfSE$lf-$textbfC$alibrating $textbfL$anguage Modelsを紹介します。
論文 参考訳(メタデータ) (2026-03-18T13:28:50Z) - What Layers When: Learning to Skip Compute in LLMs with Residual Gates [66.23658560048241]
GateSkipは、デコーダのみのLMにおけるトークンワイド層スキップを可能にする残差ストリームゲーティング機構である。
各Attention/MLPブランチは、残ストリームに再入力する前に、ブランチの出力を凝縮するシグモイドリニアゲートを備えている。
論文 参考訳(メタデータ) (2025-10-13T16:31:50Z) - Sparsity Forcing: Reinforcing Token Sparsity of MLLMs [40.93786579652003]
マルチモーダル大規模言語モデル(MLLM)におけるトークンの分散性を,単純なRLベースのポストトレーニングフレームワークであるtextitSparsity Forcing を用いて明示的に強化する。
本手法では,複数ロールアウトを異なるトークン予算で実行し,効率(トーケン還元率)と性能(回答正当性)の両方を共同報酬として定式化することにより,効率・正確性トレードオフを探索する。
論文 参考訳(メタデータ) (2025-04-23T01:45:55Z) - Data-Free Dynamic Compression of CNNs for Tractable Efficiency [46.498278084317704]
構造化プルーニング手法は, 精度が大幅に低下することなく浮動小数点演算を低下させる可能性を示唆している。
HASTE(Hashing for Tractable Efficiency)は,データフリーでプラグイン・アンド・プレイのコンボリューションモジュールで,トレーニングや微調整なしにネットワークのテスト時間推論コストを瞬時に低減する。
CIFAR-10とImageNetでは46.72%のFLOPを1.25%の精度で削減した。
論文 参考訳(メタデータ) (2023-09-29T13:09:40Z) - Gradient-Free Structured Pruning with Unlabeled Data [57.999191898036706]
ラベルのないデータのみを使用する勾配のない構造化プルーニングフレームワークを提案する。
元々のFLOPカウントの最大40%は、考慮されたすべてのタスクで4%未満の精度で削減できる。
論文 参考訳(メタデータ) (2023-03-07T19:12:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。