論文の概要: CRAFT: Fine-Tuning Pre-hoc Explainability in AI-native 6G RAN
- arxiv url: http://arxiv.org/abs/2609.00590v1
- Date: Tue, 01 Sep 2026 02:30:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.242852
- Title: CRAFT: Fine-Tuning Pre-hoc Explainability in AI-native 6G RAN
- Title(参考訳): CRAFT: AIネイティブな6G RANにおける微調整前の説明可能性
- Authors: Pranshav Gajjar, Vijay K Shah,
- Abstract要約: 我々はCRAFT(Cold-start Reasoning Alignment)を提案する。
低ランク適応 (LoRA) を用いた検証データ上での CRAFT SLM の微細構造はGRPO 法よりも計算時間と壁面時間を大幅に短縮する。
我々は、CRAFTがGRPOベースのベースラインよりも59%少ないエネルギーを消費していることを示し、6G RANにデプロイ可能で監査可能なAIへの持続的なパスを提供する。
- 参考スコア(独自算出の注目度): 2.2508462342902633
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The next generation of mobile networks is envisioned as fully AI-native, with AI-RAN architectures embedding small language models (SLMs) to perform reasoning over real-time telemetry. The state-of-the-art training paradigms for telecom LLMs, exemplified by RANSTRUCT-style supervised fine-tuning (SFT) on curated instruction data, are limited to post hoc rationalization. Here, the explanations, when produced at all, are generated after or independently of the decision, leaving the decision process unauditable. Pre-hoc reasoning, where a causal reasoning trace is produced before the output label, is preferable, and the broader LLM reasoning literature has made real progress toward it via RL methods such as Group Relative Policy Optimization (GRPO). Here we observe that transplanting this recipe into the telecom setting runs into a cold-start barrier: SLMs either learn to output the desired format or learn to predict the label, but rarely both. We identify this barrier and propose CRAFT, which stands for Cold-start Reasoning Alignment via Fine-Tuning, a data-centric method to autonomously generate a verified dataset of (input, trace, label) triplets. CRAFT fine-tunes SLMs on this verified data using low-rank adaptation (LoRA), requiring substantially less compute and wall-clock time than GRPO-based methods. On the TRACTOR and IC xApp telecom datasets, CRAFT achieves up to 86.5% and 94.6% for accuracy and F1 with no parse failures, while direct GRPO and SFT+GRPO fail to exceed 28% and 53.5% F1 with multiple parse failures. We further show that CRAFT-initialized policies serve as a robust foundation for subsequent GRPO fine-tuning, as under diverse reward functions the performance remains consistent with no parse failures. Finally, we demonstrate that CRAFT consumes 59% less energy than GRPO-based baselines, making it a sustainable path to deployable, auditable AI in 6G RAN.
- Abstract(参考訳): 次世代のモバイルネットワークは、完全なAIネイティブとして構想されており、AI-RANアーキテクチャが小さな言語モデル(SLM)を組み込み、リアルタイムテレメトリの推論を行う。
RANSTRUCTスタイルの教師付き微調整(SFT)によって実証された通信用LDMの最先端の訓練パラダイムは、ポストホックな合理化に限られている。
ここでは、生成された説明は、決定の後に、または独立して生成され、決定プロセスは未確認のままである。
アウトプットラベルより先に因果的推論トレースが生成されるプリホック推論が好まれており,グループ相対政策最適化(GRPO)などのRL手法により,より広範なLCM推論文献が本格化している。
ここでは、このレシピをテレコム環境に移植することは、コールドスタート障壁に陥る: SLMは、望ましいフォーマットの出力を学ぶか、ラベルの予測を学ぶかのいずれかだが、どちらも滅多にない。
我々は、この障壁を特定し、データ中心の手法であるFine-Tuningによるコールドスタート推論アライメント(CRAFT)を提案し、検証済みの(インプット、トレース、ラベル)三重項のデータセットを自律的に生成する。
CRAFT SLMは低ランク適応(LoRA)を用いて,GRPO法よりも計算時間と壁面時間を大幅に短縮する。
TRACTORとIC xAppのテレコムデータセットでは、CRAFTは精度86.5%と94.6%、パース障害のないF1、直接GRPOとSFT+GRPOは28%、多重パース障害のある53.5%のF1を達成している。
さらに,CRAFT初期化ポリシがその後のGRPO微調整の堅牢な基盤となることを示す。
最後に、CRAFTがGRPOベースのベースラインよりも59%少ないエネルギーを消費していることを示し、6G RANにデプロイ可能で監査可能なAIを実現するための持続可能なパスを提供する。
関連論文リスト
- Alpha-RTL: Test-Time Training for RTL Hardware Optimization [5.604484678527336]
大規模言語モデル(LLM)は、機能的に正しいレジスタ・トランスファー・レベル(RTL)のハードウェア設計を生成することへの期待が高まっている。
近年のシステムは、構文、シミュレーション、PPA報酬によるEDA統合強化学習によってさらに改善されている。
我々は,TL最適化のためのLLMポリシーとEDAパイプラインのループを閉じる,設計毎のテスト時間トレーニングフレームワークTTT-RTLを提案する。
論文 参考訳(メタデータ) (2026-06-03T14:51:33Z) - TimeSRL: Generalizable Time-Series Behavioral Modeling via Semantic RL-Tuned LLMs -- A Case Study in Mental Health [10.41600839007471]
TimeSRLは、明示的なセマンティックボトルネックを通じて予測をルーティングするフレームワークである。
クロスコホート一般化をストレステストするために設計されたベンチマーク上で、最先端のパフォーマンスを実現する。
TimeSRLは、異なるセンサーパイプライン間でのクロスベンチマーク転送において、従来の方法よりも大幅に優れている。
論文 参考訳(メタデータ) (2026-05-20T15:25:46Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training [28.00739954235118]
そこで本研究では,モデルにおけるアクティブな学習フロンティアに焦点をあてた,理論的基盤を持つ完全オンラインデータ選択フレームワークを提案する。
リプレイ付きフォワードプルーナーは、永続的に解決されたプロンプトのロールアウト生成をスキップすることで、ウォールクロック時間コストをさらに低減する。
我々の方法は1ステップあたりのトレーニングデータの40%しか保持しないが、完全なデータベースラインにマッチまたは超えている。
論文 参考訳(メタデータ) (2026-05-16T14:01:12Z) - Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection [3.1572670872557196]
Multi-Stage In-Flight Rejection (MSIFR) は軽量でトレーニング不要なフレームワークで、完成前に低品質な世代軌道を終了する。
飛行中の拒否を逐次決定プロセスとして定式化し、非自明な破棄ポリシーが期待されるトークン消費を減少させることを示す。
論文 参考訳(メタデータ) (2026-05-13T19:35:49Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs [0.08594140167290097]
大規模言語モデル(LLM)は、自然言語の生成と推論において顕著な能力を示した。
自動化されたソフトウェアエコシステムへの統合は、しばしば"構造ギャップ"によって妨げられます。
このギャップを埋めるための軽量で効率的な強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-29T04:47:14Z) - A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce [68.99924691391048]
我々はGRPOを強化的なアルゴリズムの観点から再検討し、そのコアコンポーネントを分析する。
単純な拒絶サンプリングベースラインであるRAFTは,GRPOやPPOよりも競争性能が高いことがわかった。
この知見に触発されて、完全に正しくないサンプルと完全に正しいサンプルの両方をフィルタリングするポリシー勾配の最小限の拡張であるReinforce-Rejを提案する。
論文 参考訳(メタデータ) (2025-04-15T16:15:02Z) - Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs [54.05511925104712]
本稿では,Step-DPOと呼ばれるシンプルで効果的でデータ効率のよい手法を提案する。
Step-DPOは、個々の推論ステップを、論理的に回答を評価するのではなく、優先最適化の単位として扱う。
以上の結果から,70B パラメータ以上のモデルでは,10K の選好データペアと500 Step-DPO トレーニングステップ以下では,MATH の精度が約3%向上する可能性が示唆された。
論文 参考訳(メタデータ) (2024-06-26T17:43:06Z) - A Meta-Learning Approach to Predicting Performance and Data Requirements [163.4412093478316]
本稿では,モデルが目標性能に達するために必要なサンプル数を推定する手法を提案する。
モデル性能を推定するデファクト原理であるパワー法則が,小さなデータセットを使用する場合の誤差が大きいことが判明した。
本稿では,2つのデータを異なる方法で処理するPPL法について紹介する。
論文 参考訳(メタデータ) (2023-03-02T21:48:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。