論文の概要: PTC-Decoder: Towards Intelligent SLMs on Offline Resource-Constrained Edge Devices
- arxiv url: http://arxiv.org/abs/2609.30836v1
- Date: Fri, 25 Sep 2026 05:30:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.235785
- Title: PTC-Decoder: Towards Intelligent SLMs on Offline Resource-Constrained Edge Devices
- Title(参考訳): PTC-Decoder: オフラインリソース制約エッジデバイス上でのインテリジェントSLMの実現に向けて
- Abstract要約: 小型言語モデル(SLM)は、リモートセンシング衛星のようなオフラインのリソース制約のあるエッジデバイスにデプロイされる。
既存の計画解決パラダイムは、SLMがほとんど完全に無視されていることを示す、プロンプトベースの実施に依存しています。
トレーニング不要のプラグイン・アンド・プレイ・デコーダフレームワークであるPTC-Decoderを提案する。
- 参考スコア(独自算出の注目度): 4.0416952224716765
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Deploying small language models (SLMs) on offline, resource-constrained edge devices such as remote sensing satellites presents a fundamental challenge: their limited reasoning capacity hinders reliable execution of multi-step agent tasks requiring complex tool orchestration. Existing plan-solve paradigms rely on prompt-based enforcement, which our experiments show SLMs almost entirely disregard: weak models fail to invoke the plan. We propose PTC-Decoder (Plan-Tool Constrained Decoder), a training-free, plug-and-play decoder framework that combines (1) a Plan-to-Act paradigm, which elevates planning to an atomic tool and forces its invocation at the first inference step, and (2) TC-Decoder, a deterministic finite automaton that imposes token-level hard constraints on tool names while preserving freedom over parameter generation, thereby retaining SLM reasoning capability. Evaluated on 200 real remote-sensing satellite tasks across 7 SLMs, PTC-Decoder yields a statistically significant mean overall score gain of +1.21 (p<0.01), 95% CI [+1.13, +1.29]), with consistent improvements across models and other datasets. An ablation study that removes TC-Decoder causes substantial performance degradation across all quality metrics without reducing computational cost, confirming TC-Decoder as the primary driver. PTC-Decoder thus offers a lightweight yet effective solution for improving step-level reliability, with final-answer accuracy remaining an open challenge. In essence, we enforce plan adherence by constraining the permissible output vocabulary during inference, without requiring retraining.
- Abstract(参考訳): リモートセンシング衛星のような、オフラインでリソースに制約のあるエッジデバイスに小さな言語モデル(SLM)をデプロイすることは、根本的な課題である。
既存の計画解決パラダイムは、我々の実験でSLMがほとんど無視されていることを示しており、弱いモデルは計画の実行に失敗する。
PTC-Decoder(Plan-Tool Constrained Decoder)は,(1)アトミックツールへの計画を立て,第1の推論ステップでその実行を強制するPlan-to-Actパラダイムと,(2)パラメータ生成の自由を保ちながらツール名にトークンレベルのハード制約を課す決定論的有限オートマトンであるTC-Decoderを組み合わせ,SLM推論能力を維持する訓練自由なプラグイン・アンド・プレイデコーダフレームワークである。
7つのSLMにまたがる200の実際のリモートセンシング衛星タスクで評価され、PTC-Decoder は +1.21 (p<0.01), 95% CI [+1.13, +1.29] の統計学的に有意な平均スコアゲインを得る。
TC-Decoderを除去するアブレーション研究は、計算コストを下げることなく、すべての品質指標に対して大幅なパフォーマンス劣化を引き起こし、TC-Decoderが主要なドライバであることを確認した。
したがって、PTC-Decoderはステップレベルの信頼性を向上させるための軽量で効果的なソリューションを提供する。
本質的には、再訓練を必要とせず、推論中に許容される出力語彙を制限し、プランの遵守を強制する。
関連論文リスト
- Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents [31.006941545235396]
Defer Smart(TSDS)は、軽量収束プローブとパープレキシティに基づく遅延ルールを統合するフレームワークである。
算術的推論(GSM8K)、マルチホップ質問応答(HotpotQA)、コード生成(MBPP)、家庭用ロボットタスクにまたがる4つのReActベンチマーク上でTSDSを評価する。
論文 参考訳(メタデータ) (2026-07-29T12:47:05Z) - EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models [40.37673945173621]
MLLMの推論能力を活性化する新しい枠組みとして内因性連鎖(EndoCoT)を提案する。
EndoCoTは、反復的な思考誘導モジュールを通じて潜在思考状態をブリッジし、その後、これらの状態をDiTの認知プロセスにブリッジする。
様々なベンチマークの総合的な評価は平均92.1%の精度を達成し、最強のベースラインを8.3ポイント上回っている。
論文 参考訳(メタデータ) (2026-03-12T17:58:48Z) - Beyond Test-Time Training: Learning to Reason via Hardware-Efficient Optimal Control [86.63490309209378]
我々は、最適制御として推論を定式化し、推論時に潜在状態に対して有限水平LQR計画を行うテスト時間制御層を導入する。
アーキテクチャ層として最適制御を組み込むことは、テスト時間トレーニングを超えた推論のための効果的でスケーラブルなメカニズムを提供することを実証する。
論文 参考訳(メタデータ) (2026-03-10T05:42:13Z) - Keys in the Weights: Transformer Authentication Using Model-Bound Latent Representations [0.3805935148497361]
ZSDN(Zero-Shot Decoder Non-Transferability)として形式化されたトランスフォーマーオートエンコーダにおけるデコーダ結合特性であるモデル境界遅延交換(MoBLE)を導入する。
同一データで訓練されるが種によって異なるアイソ構造モデルを用いたアイデンティティタスクでは、自己復号法は0.91以上の正確な一致と0.98のトークンの精度を達成する。
MoBLEは、航空やサイバー物理システムを含む安全クリティカルな領域にAIを配置するための、軽量でアクセラレータフレンドリなアプローチを提供する。
論文 参考訳(メタデータ) (2025-11-02T15:29:44Z) - Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning [65.20602712957725]
Cacoは、高品質で検証可能な多様な命令-CoT推論データの合成を自動化する新しいフレームワークである。
我々の研究は、人間の介入なしに自己持続的で信頼できる推論システムを構築するためのパラダイムを確立します。
論文 参考訳(メタデータ) (2025-10-05T07:59:24Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning [94.76546523689113]
CodePlanは、テキストコード形式の計画を生成し、追跡するフレームワークで、高いレベルの構造化された推論プロセスの概要を擬似コードで示します。
CodePlanは、洗練された推論タスク固有のリッチなセマンティクスと制御フローを効果的にキャプチャする。
反応を直接生成するのに比べて25.1%の相対的な改善が達成されている。
論文 参考訳(メタデータ) (2024-09-19T04:13:58Z) - Integrating DeepRL with Robust Low-Level Control in Robotic Manipulators for Non-Repetitive Reaching Tasks [0.24578723416255746]
ロボット工学では、現代の戦略は学習に基づくもので、複雑なブラックボックスの性質と解釈可能性の欠如が特徴である。
本稿では, 深部強化学習(DRL)に基づく衝突のない軌道プランナと, 自動調整型低レベル制御戦略を統合することを提案する。
論文 参考訳(メタデータ) (2024-02-04T15:54:03Z) - CodeRL: Mastering Code Generation through Pretrained Models and Deep
Reinforcement Learning [92.36705236706678]
CodeRLは、事前訓練されたLMと深層強化学習によるプログラム合成タスクのための新しいフレームワークである。
推論中、我々は重要なサンプリング戦略を持つ新しい生成手順を導入する。
モデルバックボーンについては,CodeT5のエンコーダデコーダアーキテクチャを拡張し,学習目標を拡張した。
論文 参考訳(メタデータ) (2022-07-05T02:42:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。