論文の概要: TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications
- arxiv url: http://arxiv.org/abs/2605.09929v1
- Date: Mon, 11 May 2026 03:28:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.494365
- Title: TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications
- Title(参考訳): テレレジリエンスベンチ : 電気通信におけるLCM共振用レジリエンスの定量化
- Authors: Pranshav Gajjar, Emmanuel Ojo, Vijay K Shah,
- Abstract要約: 推論のレジリエンスを定量化するベンチマークであるTeleResilienceBenchを紹介する。
我々は、Qwen3.5、Gemma4、Nemotron-3ファミリーにまたがる8つのモデルを評価する。
その結果、最強モデルでさえ、マクロ平均CFRは29.1%しか達成していないことがわかった。
- 参考スコア(独自算出の注目度): 2.002710796880098
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying large language models in telecommunications requires more than task accuracy. In realistic workflows, a model may inherit partially completed reasoning from a prior step, an upstream agent, or its own earlier generation, and must continue that reasoning even when it is already going wrong. We introduce TeleResilienceBench, a benchmark that quantifies this capability, which we term reasoning resilience, across seven telecom sub-domains drawn from the GSMA Open-Telco LLM suite. Instances are constructed by collecting failures from a weak generator model, truncating the flawed reasoning trace at its midpoint, and asking a target model to continue and correct it. We propose the Correct Flip Rate (CFR) as a direct measure of successful recovery and evaluate eight models spanning the Qwen3.5, Gemma4, and Nemotron-3 families. Our results show that even the strongest model achieves a macro-average CFR of only 29.1%, and scale does not reliably improve resilience within families. Nemotron-3-nano 4b outperforms all Qwen3.5 variants including the 27b model and leads the auxiliary TeleMath numerical evaluation at 23.4% CR%, offering the best resilience-to-cost ratio in the set. A difficulty-stratified analysis further reveals that existing telecom benchmark difficulty labels reflect factual specificity rather than reasoning depth, suggesting that current evaluations measure knowledge coverage more than reasoning ability.
- Abstract(参考訳): 大規模な言語モデルを通信にデプロイするには、タスクの精度以上のものが必要になる。
現実的なワークフローでは、モデルは前ステップや上流エージェント、あるいはそれ以前の世代から部分的に完了した推論を継承する可能性がある。
我々は、GSMA Open-Telco LLMスイートから引き出された7つの通信サブドメインに対して、レジリエンスを推論する、この能力を定量化するベンチマークであるTeleResilienceBenchを紹介する。
インスタンスは、弱いジェネレータモデルから障害を収集し、中間点における欠陥のある推論トレースを切断し、ターゲットモデルを継続して修正するよう要求することで構築される。
そこで本研究では,Qwen3.5ファミリー,Gemma4ファミリー,Nemotron-3ファミリーにまたがる8つのモデルについて,回復率の直接的な指標としてCFR(Correct Flip Rate)を提案する。
以上の結果から,最強モデルでさえ平均CFRは29.1%に過ぎず,スケールは家族内のレジリエンスを確実に改善しないことがわかった。
Nemotron-3-nano 4bは27bモデルを含むQwen3.5の全ての派生モデルより優れており、TeleMathの補助的な数値評価は23.4% CR%であり、このセットで最高のレジリエンスとコストの比率を提供する。
難易度分類分析により、既存のテレコムベンチマークの難易度ラベルは、推論深度よりも実際の特異度を反映していることが明らかとなり、現在の評価は推論能力よりも知識カバレッジを測定することが示唆された。
関連論文リスト
- Enhancing Confidence Estimation in Telco LLMs via Twin-Pass CoT-Ensembling [1.8332654441845688]
大規模言語モデル(LLM)は、複雑な通信タスクにますます適用されている。
LLMが生み出す信頼スコアは、しばしばバイアスを受け、信頼できないものであり、しばしば体系的な過信を示す。
我々は,信頼度推定を改善するための新しいCoT(Twin-Pass Chain of Thought)-Ensembling法を提案する。
論文 参考訳(メタデータ) (2026-04-14T20:03:08Z) - AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents [75.67445299298949]
AgentCPM-Exploreは、知識密度と強力な探索能力を備えたコンパクトな4Bエージェントモデルである。
本稿では,パラメータ空間モデルの融合,報酬信号の復調,文脈情報の改良を特徴とする総合的なトレーニングフレームワークを提案する。
AgentCPM-Exploreは4つのベンチマークで8BクラスのSOTAモデルにマッチまたは超え、また5つのベンチマークでClaude-4.5-SonnetやDeepSeek-v3.2のような大規模モデルよりも優れている。
論文 参考訳(メタデータ) (2026-02-06T08:24:59Z) - Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models [31.422773877490613]
推論 LLM (Reasoning LLMs) はチェーン・オブ・ソート・ジェネレーションを通じて強力な多段階推論を実現する。
RLMの大きなモデルサイズと長いデコードタイムのアウトプットは、リソース制約のある設定にデプロイするのにコストがかかり、不適当である。
我々は、構造化されたプルーニングフレームワークであるRESPを紹介し、プルーニング決定とモデルの推論力学を一致させる。
論文 参考訳(メタデータ) (2025-12-01T20:27:05Z) - Structured Uncertainty guided Clarification for LLM Agents [126.26213027785813]
LLMエージェントは、ツールコール機能を備えた大きな言語モデルを拡張するが、曖昧なユーザ命令は、しばしば誤った呼び出しやタスクの失敗につながる。
本稿では,ツールコールパラメータに対する構造的不確かさの定式化,完全情報の期待値(EVPI)を目標としたPOMDPのモデル化,冗長性防止のためのアスペクトベースコストモデルを提案する。
我々のSAGE-Agentは、この構造化された不確実性を活用し、より優れた効率を達成するために、曖昧なタスクのカバレッジを7~39%増加させ、明確な質問を1.5~2.7$times$に減らした。
論文 参考訳(メタデータ) (2025-11-11T21:50:44Z) - Enhancement Report Approval Prediction: A Comparative Study of Large Language Models [10.243182983724585]
拡張レポート(ER)は、ユーザと開発者の間の重要なコミュニケーションチャネルとして機能し、ソフトウェア改善のための貴重な提案を捉えます。
この課題に対処するために、研究の焦点として強化報告承認予測(ERAP)が登場している。
大規模言語モデル(LLM)の最近の進歩は、予測精度を向上する新たな機会を提供する。
論文 参考訳(メタデータ) (2025-06-18T03:08:04Z) - Reasoning Models Are More Easily Gaslighted Than You Think [85.84943447589511]
我々はOpenAIのo4-mini、Claude-3.7-Sonnet、Gemini-2.5-Flashの3つの最先端推論モデルを評価する。
ガス灯消火プロンプトによる精度低下が認められた。
GaslightingBench-Rは、推論モデルの認識可能性を評価するために設計された新しい診断ベンチマークである。
論文 参考訳(メタデータ) (2025-06-11T12:52:25Z) - Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback [59.078756231841574]
Critique-GRPOは、自然言語と数値フィードバックを統合して効果的なポリシー最適化を行うオンラインRLフレームワークである。
批判-GRPOは、教師付き学習とRLに基づく微調整法を8つの難解な数学、STEM、一般的な推論タスクで一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-06-03T17:39:02Z) - RECSIP: REpeated Clustering of Scores Improving the Precision [0.0]
本稿では,repeated Clustering of Scores Improving the Precision (RECSIP)を紹介する。
RECSIPは大規模言語モデル(LLM)の精度向上に重点を置いており、複数のモデルを並列に問い合わせ、応答のスコア付けとクラスタ化を行い、応答に対する信頼性を高める。
GPT-4o, Claude, Gemini モデルを用いたベンチマーク MMLU-Pro による基準実装の評価では, 使用済みモデルと比較して総合的に5.8% の増加が見られた。
論文 参考訳(メタデータ) (2025-03-15T12:36:32Z) - DeLTa: A Decoding Strategy based on Logit Trajectory Prediction Improves Factuality and Reasoning Ability [3.2561294196141835]
本稿では,事実的精度と推論的推論を両立させる新しい復号法を提案する。
提案手法は,トランスフォーマーの下位層から上位層へのロジットの軌跡を解析することにより,次の確率を調節する。
TruthfulQAの実験では、DeLTaはベースラインよりも4.9%改善されている。
論文 参考訳(メタデータ) (2025-03-04T07:07:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。