論文の概要: Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models
- arxiv url: http://arxiv.org/abs/2607.22771v1
- Date: Fri, 24 Jul 2026 04:28:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.872892
- Title: Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models
- Title(参考訳): 3D-CT視力モデルにおける重大トレーニング予測のためのチーププローブの開発
- Abstract要約: イメージグラウンドのプローブベンチマークを (エンコーダ$times$ compression) セル上に構築します。
予備研究では、各プローブを一致した下流タスクとペアリングする。
ホールドアップすると、エンコーダと圧縮の選択はフリーズトーケンプローブで数分でスクリーニングできる。
- 参考スコア(独自算出の注目度): 1.3198689566654107
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Picking the frozen image encoder for a 3D~CT vision--language model (VLM), together with the token-compression scheme on top of it, is a search over many candidates. There are several encoders, several ways to compress their tokens, and several token budgets, and the combinations grow fast. Comparing them the usual way means fine-tuning a large language model (LLM) on each combination, and running the whole sweep this way needs far more compute than most groups can spend. We ask whether a cheap probe on the encoder's cached embeddings can stand in for that comparison. We build an image-grounded probing benchmark over (encoder $\times$ compression) cells, with clinical attribute families and two validation gates, scale-sanity and probe-separability, that keep each attribute well-scaled and decodable. These gates are the main methodological contribution. On this benchmark we compare a range of read-out heads, and in a preliminary study we pair each probe with its matched downstream task. The early signal is encouraging: the cheap probe orders the candidates in close agreement with expensive fine-tuning, at about $r\approx0.95$ on the cells measured so far. We read this as an ordinal claim, a ranking predictor rather than an exact estimate, and we are explicit about where it stays preliminary. If it holds up, encoder and compression choices can be screened in minutes with frozen-token probes, with full training spent only on the finalists.
- Abstract(参考訳): 3D~CTビジョン言語モデル(VLM)の凍結画像エンコーダを選択すると、その上にトークン圧縮スキームが加わり、多くの候補を探索する。
いくつかのエンコーダ、トークンを圧縮する方法、いくつかのトークン予算があり、組み合わせは急速に成長する。
それらを通常の方法で比較することは、それぞれの組み合わせで大きな言語モデル(LLM)を微調整することを意味します。
エンコーダのキャッシュされた埋め込みに対する安価なプローブが、その比較に有効かどうかを問う。
臨床属性ファミリーと2つのバリデーションゲート,スケールサニティとプローブ分離性を備え,各属性を適切にスケールし,かつデオード可能にしたイメージグラウンド型プローブベンチマークを,(エンコーダ$\times$圧縮)セル上に構築する。
これらの門は主要な方法論的貢献である。
このベンチマークでは、様々な読み出しヘッドを比較し、予備研究では、各プローブを一致する下流タスクとペアリングする。
安価なプローブは、これまで測定されたセルの約$r\approx0.95$で、高価な微調整と密接な一致で候補者に注文する。
私たちはこれを、厳密な見積もりではなく、序列的な主張、ランキング予測として読みました。
ホールドアップすると、エンコーダと圧縮の選択は冷凍トーケンプローブで数分でスクリーニングされ、ファイナリストにのみフルトレーニングが費やされる。
関連論文リスト
- Which Pretext Task Transfers? Self-Supervised Pretraining Objectives for Lung Ultrasound [7.33892543652551]
自己教師型学習は、ラベル付けされた医療画像の必要性を減らすことができる。
コントラスト学習、仮面再構築、共同埋め込み予測アーキテクチャ(JEPA)は、目標が定義されている空間において異なる。
我々は,同じエンコーダバックボーン,事前学習コーパス,最適化スケジュール,凍結評価プロトコルを用いて,これらの3つの目的ファミリを比較した。
論文 参考訳(メタデータ) (2026-09-15T02:48:45Z) - CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs [58.22241532542095]
3Dシーンをマルチビュー画像として表現することで、2D VLMは事前学習の事前知識を再利用し、注釈付き3Dデータの不足を補うことで3Dを推論することができる。
既存の視覚トークンプルーナーは2つのファミリーに分かれ、それぞれが3Dマルチビュー設定に制限される。
空間被覆は3次元推論性能と関連し,トークン座標のみを用いた決定論的学習自由セレクタであるCoVeRを導入し,学習信号を持たないことを示す。
論文 参考訳(メタデータ) (2026-09-08T07:16:37Z) - Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models [66.32132912853372]
Diffusion Large Language Models (dLLMs) は自己回帰型言語モデルの競合代替として登場した。
本研究では,中間エントロピー位置を有望な候補ピボットとして求める訓練自由復号法であるRipple-Pivot Search (RPS)を提案する。
RPSは、生成品質を維持しながら標準デコーダの4-10$times$wall-clockスピードアップを実現し、以前のルックアヘッドベースラインの精度を最大5.49%向上させる。
論文 参考訳(メタデータ) (2026-08-12T07:32:29Z) - ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression [14.376246048056379]
視覚言語モデルに入る3次元CTスキャンは、視覚トークンの長いシーケンスを生成する。
トーケン圧縮は一般的な視覚ではよく研究されているが、特に3次元CTを対象とするものはほとんどない。
3次元CT用トークン圧縮機 textbfORCA (ORgan-Centroid Aggregation) を提案する。
論文 参考訳(メタデータ) (2026-07-31T23:27:39Z) - Evolving Quantum Error-Correcting Encodings for Molecular Simulation [0.6372261626436676]
言語モデルがプログラムを編集し、外部検証器が結果をスコアし、ハイスコアプログラムを保持・変更する。
ケーススタディでは、このループをfermion-to-qubitエンコーディングであるGeneralized Superfast (GSE)に適用する。
我々の知る限り、これらは高密度の分子ハミルトニアンに対して3ドルを超える距離のGSE/スーパーファストエンコーディングである。
論文 参考訳(メタデータ) (2026-06-24T14:19:43Z) - AAC: Admissible-by-Architecture Differentiable Landmark Compression for ALT [1.2891210250935148]
AAC は ALT (A*, Landmarks, Triangle) のショートパスのための差別化可能なランドマーク選択モジュールである。
これは古典的な探索における圧縮時適応の伝統の最初の微分可能な例である。
論文 参考訳(メタデータ) (2026-04-22T16:31:21Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - Foundations of Top-$k$ Decoding For Language Models [19.73575905188064]
我々は、トップ$kの復号化を説明・一般化する理論的枠組みを開発する。
大規模な分岐に対して効率的に最適化する方法を示す。
論文 参考訳(メタデータ) (2025-05-25T23:46:34Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Evaluating and Designing Sparse Autoencoders by Approximating Quasi-Orthogonality [3.9230690073443166]
近似的特徴アクティベーション(AFA)の定式化に基づく新しいアクティベーション関数 Top-AFA を導入する。
3つの中間層上のSAEをトレーニングして、OpenWebTextデータセットから8000万以上のトークンに対して、GPT2の隠れ埋め込みを再構築することにより、このアプローチの実証的なメリットを実演する。
論文 参考訳(メタデータ) (2025-03-31T16:22:11Z) - CODA: Repurposing Continuous VAEs for Discrete Tokenization [31.932323809073477]
textbfCODA(textbfCOntinuous-to-textbfDiscrete textbfAdaptation)は、圧縮と離散化を分離するフレームワークである。
提案手法は,ImageNet 256$times$256ベンチマークにおいて,$mathbf0.43$と$mathbf1.34$を8倍,$16倍の圧縮で,100%のコードブック利用と注目すべき再構成FID(rFID)を実現している。
論文 参考訳(メタデータ) (2025-03-22T12:59:00Z) - Superposed Decoding: Multiple Generations from a Single Autoregressive Inference Pass [72.07642648108849]
Superposed Decodingは、1つの自己回帰推論パスのコストで$k$のドラフトを生成する新しい復号アルゴリズムである。
Superposed Decodingは、他のデコード戦略と組み合わせることで、推論時間計算のスケーリング時に普遍的なカバレッジが向上する。
論文 参考訳(メタデータ) (2024-05-28T17:40:48Z) - SpecTr: Fast Speculative Decoding via Optimal Transport [30.18181671899423]
このアルゴリズムはデコーディングの高速化を図り、デコードされた出力に品質劣化がないことを保証します。
提案手法は,最先端の大規模言語モデルに対して,標準的なベンチマーク上での投機的復号化よりもさらに1.37倍の高速化である2.13Xのウォールクロック高速化を実現することを実験的に実証した。
論文 参考訳(メタデータ) (2023-10-23T17:47:34Z) - Efficient Nearest Neighbor Search for Cross-Encoder Models using Matrix
Factorization [60.91600465922932]
本稿では,クロスエンコーダのみに頼って,二重エンコーダによる検索を回避する手法を提案する。
我々のアプローチは、現在の広く使われている方法よりも優れたテスト時間リコール-vs計算コストトレードオフを提供する。
論文 参考訳(メタデータ) (2022-10-23T00:32:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。