論文の概要: Offline Guidance, Online Reasoning: Reusing LLM Feedback for Small Language Models
- arxiv url: http://arxiv.org/abs/2609.39346v1
- Date: Wed, 30 Sep 2026 09:09:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.505824
- Title: Offline Guidance, Online Reasoning: Reusing LLM Feedback for Small Language Models
- Title(参考訳): オフラインガイダンスとオンライン推論:小言語モデルに対するLLMフィードバックの再利用
- Abstract要約: 大きな言語モデル(LLM)は強力な推論機能を提供するが、しばしば商用APIを通じてアクセスするのにコストがかかる。
小型言語モデル(SLM)は、ローカルにデプロイするのが簡単であるが、推論において弱いままである。
本稿では,SLMのデプロイメントの利点を保ちつつ,LSM機能を用いたSLM推論を改善することを目的とする。
- 参考スコア(独自算出の注目度): 24.38012190833746
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) offer strong reasoning capabilities but are often costly to access through commercial APIs, while small language models (SLMs) are easier to deploy locally yet remain weaker in reasoning. This capability-deployment gap has motivated LLM-SLM collaboration, which aims to improve SLM reasoning using LLM capabilities while preserving the deployment advantages of SLMs. Existing approaches mainly follow two paradigms. Knowledge distillation uses LLM-generated answers and reasoning trajectories to train SLMs offline, but requires parameter updates and additional training. Alternatively, online collaboration routes difficult problems to an LLM or leverages LLM-generated guidance and corrections when an SLM encounters difficulties. Although effective, online collaboration requires repeated LLM access. Moreover, the guidance produced for a particular problem is discarded after inference and cannot benefit subsequent problems involving similar reasoning states. In the paper, we focus on a more constrained setting in which the LLM is accessed only offline, the SLM parameters remain fixed, and online inference is performed solely by the SLM. To this end, we propose Reusable Latent Correction (RLC), which converts one-off natural-language guidance from a black-box LLM into persistent corrective experiences in the hidden space of an SLM. RLC stores these experiences in an external bank and retrieves them according to the SLM's current reasoning state, enabling the SLM to reuse LLM-derived corrections during inference without any online LLM calls. Experiments across multiple reasoning benchmarks and SLM scales show that RLC consistently improves SLM reasoning without parameter updates or online LLM calls. Code is available at https://github.com/ZBH031/reusable-latent-correction.
- Abstract(参考訳): 大きな言語モデル(LLM)は強力な推論機能を提供するが、しばしば商用APIを通じてアクセスするのにコストがかかる。
この能力/デプロイギャップは、LSMのデプロイメントの利点を保ちながら、LSM機能を使用したSLM推論を改善することを目的として、LSM-SLMコラボレーションを動機付けている。
既存のアプローチは主に2つのパラダイムに従う。
知識蒸留では、LSMの生成した回答と推論トラジェクトリを使用してSLMをオフラインでトレーニングするが、パラメータ更新と追加のトレーニングが必要である。
あるいは、オンラインコラボレーションは、難しい問題をLSMにルートするか、LSMが困難に遭遇した場合にLCMが生成したガイダンスと修正を利用する。
効果的ではあるが、オンラインコラボレーションには繰り返しLLMアクセスが必要である。
さらに、特定の問題のために作成されたガイダンスは、推論後に破棄され、同様の推論状態を含むその後の問題に利益をもたらすことができない。
本稿では,LLMがオフラインでのみアクセスされ,SLMパラメータが固定され,オンライン推論がSLMのみで実行されるような,より制約のある設定に焦点をあてる。
この目的のために, ブラックボックス LLM からの1オフ自然言語誘導を, SLM の隠れた空間における永続的な修正経験に変換するReusable Latent Correction (RLC) を提案する。
RLCはこれらの経験を外部の銀行に格納し、SLMの現在の推論状態に従ってそれらを検索し、SLMはオンラインのLCM呼び出しなしで推論中にLSM由来の修正を再利用することができる。
複数の推論ベンチマークとSLMスケールの実験により、RCCはパラメータ更新やオンラインLSM呼び出しなしでSLM推論を一貫して改善している。
コードはhttps://github.com/ZBH031/reusable-latent-correctionで入手できる。
関連論文リスト
- LLM4VV: Evaluating Cutting-Edge LLMs for Generation and Evaluation of Directive-Based Parallel Programming Model Compiler Tests [7.6818904666624395]
本稿では,コンパイラテストの生成にLLMを用いたデュアルLLMシステムと実験について述べる。
LLMは、品質の高いコンパイラテストを生成し、それらを自動的に検証する有望な可能性を持っていることは明らかである。
論文 参考訳(メタデータ) (2025-07-29T02:34:28Z) - Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning [95.44766931218896]
MLLM(Multi-modal large language model)は、テキストベースの推論に遅れを取っている。
本稿では,MLLMの推論コンポーネントをモジュール化し,容易に置き換え可能なパーセプション推論デカップリングを提案する。
本稿では,視覚知覚最適化(VPO)と呼ばれる新しい強化学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-05T02:28:07Z) - LLM-Lasso: A Robust Framework for Domain-Informed Feature Selection and Regularization [59.75242204923353]
LLM-Lassoは大規模言語モデル(LLM)を利用してラッソ回帰における特徴選択を導くフレームワークである。
LLMは各特徴に対してペナルティ因子を生成し、単純でチューニング可能なモデルを用いてラスソペナルティの重みに変換される。
LLMによりより関連づけられた特徴は、より低い罰を受け、最終モデルに保持される可能性を高める。
論文 参考訳(メタデータ) (2025-02-15T02:55:22Z) - Intermittent Semi-working Mask: A New Masking Paradigm for LLMs [13.271151693864114]
マルチターン対話は人間と大規模言語モデル(LLM)の鍵となる対話手法である
これらの問題に対処するために,ISM (Intermittent Semi-working Mask) と呼ばれる新しいマスキング手法を提案する。
論文 参考訳(メタデータ) (2024-08-01T13:22:01Z) - LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks [18.068035947969044]
計画と推論タスクにおけるLLM(Large Language Models)の役割には、かなりの混乱がある。
自己回帰型LSMは、それ自体で計画や自己検証を行うことはできない、と我々は主張する。
本稿では,LLMの強みと外部モデルベース検証器を併用した bf LLM-Modulo Framework のビジョンを提案する。
論文 参考訳(メタデータ) (2024-02-02T14:43:18Z) - Survey on Factuality in Large Language Models: Knowledge, Retrieval and
Domain-Specificity [61.54815512469125]
本調査は,大規模言語モデル(LLM)における事実性の重要課題に対処する。
LLMが様々な領域にまたがる応用を見出すにつれ、その出力の信頼性と正確性は重要となる。
論文 参考訳(メタデータ) (2023-10-11T14:18:03Z) - Check Your Facts and Try Again: Improving Large Language Models with
External Knowledge and Automated Feedback [127.75419038610455]
大規模言語モデル(LLM)は、ダウンストリームタスクの多くに対して、人間のような、流動的な応答を生成することができる。
本稿では,プラグ・アンド・プレイモジュールのセットでブラックボックスのLSMを増強するLSM-Augmenterシステムを提案する。
論文 参考訳(メタデータ) (2023-02-24T18:48:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。