論文の概要: Budget-Adaptive Routing: Skipping the Weak When the Strong Answers Anyway
- arxiv url: http://arxiv.org/abs/2606.30919v1
- Date: Mon, 29 Jun 2026 21:11:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.003008
- Title: Budget-Adaptive Routing: Skipping the Weak When the Strong Answers Anyway
- Title(参考訳): Budget-Adaptive Routing: 強く答えるときの弱みを叩く
- Abstract要約: オフロード予算が変化すると、この弱条件設計は最適以下になり得ると我々は主張する。
本稿では,原画素からのルーティング信号を抽出する弱いスイッチング推定器を提案する。
オフロード予算を2つのオフライン調整しきい値から選択する。
- 参考スコア(独自算出の注目度): 1.2176481645030994
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Edge-cloud inference collaborations are often designed with a routing estimator that decides whether to offload each frame from weak models at the edge to stronger models in the cloud. Existing systems place the routing estimator after the weak detector, so the weak forward pass still runs even on frames that are later offloaded. In this paper, we argue that this weak-conditioned design can be suboptimal when the offload budget varies. First, we present a competitive weak-skipping estimator (0.153 GFLOPs, about 29x lighter than the weak detector at 4.49 GFLOPs) that extracts routing signal from raw pixels, outperforming the common after-weak placement weak-conditioned baselines. Second, we show that neither weak-skipping nor weak-conditioned placement dominates across the full operating curve, and we propose budget-adaptive routing, which selects between them by offload budget via two offline-tuned thresholds. On PASCAL VOC, our budget-adaptive router traces the upper accuracy envelope of both fixed placements across the operating range. Our method reduces per-frame latency by up to 19.1 ms (about 30% lower at rho = 0.9). Besides outperforming SOTA methods, it is surprisingly stronger than the strong model (+1.7 pp over the strong model's peak mAP) at some operating points with far less compute. Artifacts are available at https://github.com/ViGeng/bgt-ada
- Abstract(参考訳): エッジクラウドの推論コラボレーションは、各フレームをエッジの弱いモデルからクラウドの強いモデルにオフロードするかを決定するルーティング推定器で設計されることが多い。
既存のシステムは、弱い検知器の後に経路推定器を配置するので、弱い前方通過は、後に降ろされるフレーム上でもなお動作する。
本稿では, オフロード予算が変動する場合に, この弱条件設計が最適である可能性について論じる。
まず、原画素からのルーティング信号を抽出し、共通余弱配置の弱条件ベースラインよりも優れた、競争力のある弱散乱推定器(0.153 GFLOPs, 弱検出器の4.49 GFLOPsの約29倍の軽量化)を提案する。
次に,2つのオフライン調整しきい値を用いてオフロード予算を選択可能な予算適応型ルーティングを提案する。
PASCAL VOCでは、当社の予算適応ルータは、運用範囲をまたいだ両固定配置の精度の高いエンベロープをトレースする。
提案手法は,フレームあたりのレイテンシを最大19.1ミリ秒(rho = 0.9で約30%低下)に短縮する。
SOTA法に勝るだけでなく、計算量がはるかに少ないいくつかの演算点において、強いモデル(強いモデルのピークmAPよりも+1.7 pp)よりも驚くほど強い。
Artifactsはhttps://github.com/ViGeng/bgt-adaで入手できる。
関連論文リスト
- A route to damage tolerance exceeding $10\%$ in shuttling-equipped quantum processors [0.0]
これは、固体フォールトトレラント量子コンピューティングにおける損傷に対する高い耐性(欠陥や"ドロップアウト")を提供するアプローチの研究である。
本手法は主に、高速かつ高忠実なシャットリングをサポートすることが示されている半導体電子スピン量子ビット系を対象としている。
論文 参考訳(メタデータ) (2026-07-24T15:49:03Z) - DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? [57.585275546688116]
VLM(Vision-Language Models)は、エンボディエージェントの高レベルプランナーとしてますます普及している。
テストタイムの計算をいつ、どこで使うかを選択することは、実際の世界にフロンティアパフォーマンスをもたらす中心である、と私たちは主張する。
我々はマルチモーダルシーンコンテキストを用いてプロンプト毎に計算を割り当てるルーティングフレームワークであるDIRECTを紹介した。
論文 参考訳(メタデータ) (2026-06-10T17:58:49Z) - CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference [52.849509991178884]
大規模言語モデル(LLM)は集中型クラウドからモバイルエッジ環境に移行する。
軽量オンデバイスモデルとより強力なエッジモデルの間のクエリレベルのルーティングは、このトレードオフをナビゲートするための柔軟なメカニズムを提供する。
既存のルータは、集中クラウド設定とトークンレベルのコストの最適化のために設計されており、無線エッジデプロイメントにおける動的レイテンシとエネルギーオーバーヘッドをキャプチャできない。
論文 参考訳(メタデータ) (2026-05-12T11:50:15Z) - When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search [61.73232505100331]
アクティベーションステアリングは、再トレーニングせずにLSMを制御する軽量な方法を提供するが、その効果は概念によって大きく異なる。
我々は介入層と係数に対する予算制約付き最適化としてランク1ステアリングを定式化する。
操作困難の原因の診断にアクティベーション幾何を利用するグラニュラリティおよび表現認識概念工学フレームワークである textitGRACE を提案する。
論文 参考訳(メタデータ) (2026-05-09T14:26:49Z) - DualTCN: A Physics-Constrained Temporal Convolutional Network for 2 Time-Domain Marine CSEM Inversion [1.2031796234206138]
DualTCNは、時間領域の海洋電磁制御源(MCSEM)過渡データを反転させるための最初のディープラーニングフレームワークである。
このフレームワークは、4つのアースモデルパラメータを回帰し、微分可能なソフトステップデコーダを用いてプロファイルを再構成する。
このフレームワークは、カリキュラムベースの振幅増大によるノイズに対する高い堅牢性を示し、平均$barR2$ 0.858 at $pm2%$ランダム振幅誤差を維持している。
論文 参考訳(メタデータ) (2026-05-06T14:58:17Z) - RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment [57.588738943463646]
大規模言語モデル(LLM)は機械翻訳(MT)において顕著な性能を発揮した
大規模に展開するのは 違法に高価です
モデル内ルータである textbfRouteLMT を提案する。
論文 参考訳(メタデータ) (2026-04-24T13:02:45Z) - ParetoBandit: Budget-Paced Adaptive Routing for Non-Stationary LLM Serving [0.0]
LLMは、しばしば530倍のコスト範囲にまたがるマルチモデルポートフォリオに依存している。
プロバイダは価格を見直し、モデルの品質は静かに回復し、新しいモデルはダウンタイムなしで統合する必要がある。
本稿では,費用対効果を考慮した適応ルータを提案する。
論文 参考訳(メタデータ) (2026-03-31T18:41:53Z) - SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing [77.91660464664615]
Diffusion Transformers (DiTs) はビデオ生成において主要なバックボーンとなっているが、その二次的注意コストは依然として大きなボトルネックとなっている。
本稿では,不足しているコントリビューションをトレーニングなしで回収できることを示す。
パラメータフリーな線形補償分岐であるSVG-EARを導入する。
論文 参考訳(メタデータ) (2026-03-09T22:15:31Z) - BiRQA: Bidirectional Robust Quality Assessment for Images [49.74447451098852]
フル参照画像品質評価(FR IQA)は、画像圧縮、復元、生成モデリングにおいて重要である。
本稿では、双方向の多スケールピラミッド内で4つの高速補完特徴を処理するコンパクトFR IQA計量モデルであるBiRQAを提案する。
5つのパブリックFR IQAベンチマークでは、BiRQAは以前のSOTAモデルよりも3倍高速で動作しながら、以前の状態(SOTA)より優れ、あるいは一致している。
論文 参考訳(メタデータ) (2026-02-23T20:52:56Z) - Skip2-LoRA: A Lightweight On-device DNN Fine-tuning Method for Low-cost Edge Devices [7.219286228148705]
本稿では,深層ニューラルネットワークの軽量微調整手法としてSkip2-LoRAを提案する。
本手法では,ネットワーク表現力を高めるため,最後の層と他の層の間にトレーニング可能なLoRAアダプタを挿入する。
以上の結果から,Skip2-LoRAはトレーニング可能なパラメータの同じパラメータに比べて,微調整時間を平均90.0%削減できることがわかった。
論文 参考訳(メタデータ) (2024-10-28T14:35:12Z) - Adversarial Robustness Limits via Scaling-Law and Human-Alignment Studies [19.100334346597982]
モデルサイズ,データセットサイズ,合成データ品質が,対戦型トレーニングのための最初のスケーリング法則を開発することにより,ロバスト性にどのように影響するかを分析する。
我々のスケーリング法則は、先行技術における非効率性を明らかにし、現場を前進させるための実用的なフィードバックを提供する。
論文 参考訳(メタデータ) (2024-04-14T20:14:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。