論文の概要: SketchMamba: A Lightweight State-Space Model for Joint Progressive Sketch Classification and Stroke Auto-Completion
- arxiv url: http://arxiv.org/abs/2607.23580v1
- Date: Sun, 26 Jul 2026 10:05:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.163497
- Title: SketchMamba: A Lightweight State-Space Model for Joint Progressive Sketch Classification and Stroke Auto-Completion
- Title(参考訳): SketchMamba: 共同進行型スケッチ分類とストロークオートコンプリートのための軽量状態空間モデル
- Authors: Kavish Jhaveri, Arya Shah,
- Abstract要約: 既存のベクトルスケッチモデルは、認識と生成を別のタスクとして扱う。
スケッチマンバ(SketchMamba)は、任意の部分的な接頭辞からスケッチを連続的に分類し、その継続を同時に生成する単一因果配列モデルである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Existing vector-sketch models treat recognition and generation as separate tasks, leaving a gap for streaming interfaces that must understand a drawing as it is being made. We present SketchMamba, a single causal sequence model that continuously classifies a sketch from any partial prefix while simultaneously generating its continuation. We achieve this by applying a dense per-step classification loss to a selective state-space backbone. Evaluated on a 58-class subset of the Quick, Draw! dataset, SketchMamba yields 94.93% final-step accuracy and a progressive-accuracy Area Under the Curve (AUC) of 0.706, crossing 90% of its final accuracy by the time 70% of the strokes are drawn. In a matched-budget comparison, the 1.55 million-parameter backbone ties a causal Transformer while outperforming recurrent and convolutional baselines. Ablations confirm that the dense supervision regime, rather than the architecture alone, drives the early-prediction capability. The results demonstrate that a single causal hidden state can unify progressive recognition and autoregressive generation without auxiliary encoders or task-specific branching.
- Abstract(参考訳): 既存のベクトルスケッチモデルでは、認識と生成を別のタスクとして扱い、描画をそのまま理解しなければならないストリーミングインターフェースのギャップが残る。
スケッチマンバ(SketchMamba)は、任意の部分的な接頭辞からスケッチを連続的に分類し、その継続を同時に生成する単一因果配列モデルである。
我々は、選択的な状態空間のバックボーンに高密度なステップ毎の分類損失を適用することで、これを実現する。
Quick, Draw!データセットの58クラスのサブセットで評価され、SketchMambaは94.93%の最終ステップの精度と、0.706のAUCの下でのプログレッシブ・精度の領域を出力し、ストロークの70%の時間で最終的な精度の90%を越える。
一致した予算比較では、155万パラメーターのバックボーンが因果トランスフォーマーを結び、繰り返しおよび畳み込みベースラインを上回ります。
アブレーションは、アーキテクチャのみではなく、密集した監督体制が早期予測能力を促進することを確認している。
その結果,1つの因果隠れ状態が,補助エンコーダやタスク固有の分岐を使わずに,進行認識と自己回帰生成を統一できることが示唆された。
関連論文リスト
- PathSelect: Sequential Token Selection for Whole Slide Pathology [0.6362628914555645]
WSI(Whole-Slide Images)は、視覚言語モデル(VLM)の基本的計算ボトルネックを示す。
我々は、WSIトークンプルーニングを逐次選択プロセスとして再構成し、モデルが最適なルーティング戦略を自律的に学習できるようにする。
論文 参考訳(メタデータ) (2026-07-26T12:36:16Z) - Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models [1.4563514298965277]
チェーン・オブ・シント推論モデルはバイモーダル収束パターンを示す。
世代は、(収束しない)トークン予算内で終了するか、(収束しない)結論に達することなくそれを排気する
AIME 1983-2024では収束世代が90.3%、非収束世代は6.6%であり、全体の収束率は62.0%である。
論文 参考訳(メタデータ) (2026-07-23T15:37:04Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - Aionoscope: Debugging Latent-State Accessibility in Time-Series Representations [59.34593956287438]
Aionoscope(アイオノスコープ)は、凍結した時系列表現における潜在状態のアクセシビリティを検査するための診断ツールである。
アイオノスコープはプロセス生成を観察レンダリングから切り離し、正確な分類と密度のラベルを持つシード合成ストリームを生成する。
論文 参考訳(メタデータ) (2026-07-01T13:54:20Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - MamBOA: State-Space Architecture for Video Recognition [0.0]
MamBOAは、選択的な状態空間反復(S6)をネイティブモーションシンセサイザーとして再キャストする、バックボーンに依存しない時間的枠組みである。
Diving48では、MamBOAは85.02%のTop-1の精度で、画像付きバックボーンが86.24%、ビデオ付きバックボーンが1回のフォワードパスで全ビデオを処理している。
論文 参考訳(メタデータ) (2026-06-13T12:27:06Z) - CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis [49.596677723190886]
スケッチベースの似顔絵合成は、基本的な失敗モードに悩まされる。
アイデンティティと形状の条件は拡散モデルに組み合わされ、地味な肖像画や認識不能な歪みに対して崩壊する。
並列な未汚染拡散経路を通じてこの汚染を明示的に解消する最初の訓練不要な手法であるCaricHarmonyを提案する。
論文 参考訳(メタデータ) (2026-06-11T22:57:59Z) - Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection [85.49213290363834]
理解力向上型モデル協調手法(UE-MCM)を提案する。
より効率的な粗いビデオ理解と正確なきめ細かなアクション推論を組み合わせる。
結果として得られるシステムは速度と精度のバランスを保ち、エゴセントリックな指導ビデオの微妙で稀で曖昧な誤りを検出するのに効果的である。
論文 参考訳(メタデータ) (2026-06-01T11:50:16Z) - Scaling Test-Time Compute for Agentic Coding [126.72747643609274]
本稿では,ロールアウト軌跡のコンパクトな表現に基づくエージェントコーディングのためのテスト時間スケーリングフレームワークを提案する。
当社のフレームワークは,各ロールアウトを,その健全な仮説,進捗,障害モードを保存する構造的な要約に変換する。
提案手法は,SWE-Bench Verified および Terminal-Bench v2.0 におけるフロンティア符号化エージェントの性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-04-16T17:39:33Z) - Self-Adversarial One Step Generation via Condition Shifting [11.426065945265647]
APEXは、フローモデルから不均一に抽出された逆補正信号のフレームワークである。
私たちの0.6BモデルはFLUX-Schnell 12B(20$times$ more parameters)を1ステップ品質で上回ります。
Qwen-Image 20BのLoRAチューニングにより、APEXは6時間でNFE=1のGenEvalスコア0.89に達し、最初の50ステップの教師(0.87)を超え、15.33$times$推論スピードアップを提供する。
論文 参考訳(メタデータ) (2026-04-14T05:54:33Z) - First-Mover Bias in Gradient Boosting Explanations: Mechanism, Detection, and Resolution [0.0]
第1モーバーバイアス(英: First-mover bias)は、勾配上昇における逐次的残留フィッティングに起因する特徴量の集中である。
モデル独立性は線形状態における最優先バイアスを解くのに十分であり、非線形データ生成プロセス下では最も効果的な緩和法であることを示す。
論文 参考訳(メタデータ) (2026-03-22T02:59:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。