論文の概要: Capability Self-Assessment: Teaching LLMs to Know Their Limits
- arxiv url: http://arxiv.org/abs/2606.00251v1
- Date: Fri, 29 May 2026 18:32:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.177983
- Title: Capability Self-Assessment: Teaching LLMs to Know Their Limits
- Title(参考訳): 自己評価の能力: LLMに限界を知るように教える
- Abstract要約: 現代の大規模言語モデルは、体系的に自己評価能力が欠如していることが示される。
モデル本来の能力を維持しつつ自己評価を改善することを目的として,政策学習問題として定式化する。
その結果,強化学習はCSAを効果的に指導し,教師付き微調整よりも優れていた。
- 参考スコア(独自算出の注目度): 54.08927435222828
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The ability to recognize one's own limitations and decide whether to solve a problem or delegate is fundamental for reliable intelligent systems. Yet we show that modern large language models systematically lack this ability: across diverse model families and scales, they overestimate their competence and attempt queries they cannot solve. We refer to this ability as Capability Self-Assessment (CSA) and formulate it as a policy-learning problem, aiming to improve self-assessment while preserving the model's original capabilities. Our results show that reinforcement learning teaches CSA effectively, significantly outperforming supervised fine-tuning while preserving original capabilities. In contrast, supervised fine-tuning severely degrades the capabilities the model is meant to assess. Moreover, learned self-assessment behavior generalizes well out of distribution, suggesting that CSA is a transferable model trait. Finally, CSA is practically useful: it improves local-cloud decision making at inference time and provides a signal for targeted data selection during training.
- Abstract(参考訳): 自分自身の限界を認識し、問題を解決するか、あるいは委譲するかを決める能力は、信頼できるインテリジェントシステムの基本である。
しかし、現代の大規模言語モデルでは、この能力を体系的に欠いていることが示されています。
我々は、この能力を能力自己評価(CSA)と呼び、それを政策学習問題として定式化し、モデルの本来の能力を保ちながら自己評価を改善することを目的としている。
以上の結果から,強化学習はCSAを効果的に指導し,教師付き微調整よりも向上し,元の能力を維持した。
対照的に、教師付き微調整は、モデルを評価しようとする能力を著しく劣化させる。
さらに,学習した自己評価行動は分布からよく一般化し,CSAが伝達可能なモデル特性であることを示唆している。
CSAは、推論時にローカルクラウドの意思決定を改善し、トレーニング中のターゲットデータ選択のための信号を提供する。
関連論文リスト
- Evaluating and Improving LLM Self-Modeling [1.844645605886669]
我々は、素早い編集がモデルの最終的な答えを変えるかどうかなど、検証可能な行動問題に焦点を当てる。
現在のモデルは、非自明だが限定的な自己モデリングスキルを示している。
我々は、自己モデリングトレーニングデータを生成するスケーラブルな合成データパイプラインを開発する。
論文 参考訳(メタデータ) (2026-08-31T15:37:51Z) - Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs [60.80435138270317]
本稿では,メタ認知的フィードバックによる強化学習を忠実な校正問題に適用する。
実験により、RLMFは様々なタスクにおいて汎用的で最先端のFCを実現することが示された。
RLMFは標準のRLを最大63%上回り、モデルの性能限界を評価し表現する能力を高めている。
論文 参考訳(メタデータ) (2026-06-30T17:56:01Z) - The Path of Self-Evolving Large Language Models: Achieving Data-Efficient Learning via Intrinsic Feedback [51.144727949988436]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を高める可能性を実証した。
本研究では,最小限のデータを用いたLLによるLLMの改善について検討する。
データ依存を最小限に抑えるため、自己認識に基礎を置いた2つの新しいメカニズムを導入する。
論文 参考訳(メタデータ) (2025-10-03T06:32:10Z) - Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models [26.897329298659717]
本稿では,タスク固有のキュレーションから本質的な能力分析へ移行するフレームワークであるCapability-Attributed Data Curation(CADC)を紹介する。
CADCは、勾配に基づく学習軌跡から教師なしの方法で本質的な能力を発見する。
オリジナルのデータの5%に過ぎず、CADCはマルチモーダルベンチマークでのフルデータトレーニングを超越している。
論文 参考訳(メタデータ) (2025-09-27T02:57:37Z) - Autonomous Learning From Success and Failure: Goal-Conditioned Supervised Learning with Negative Feedback [2.36462256498849]
Goal-Conditioned Supervised Learningは、自律システムのための自己アニメーション学習を可能にする、潜在的なソリューションとして登場した。
本稿では,GCSLフレームワークに対照的な学習原則を統合し,成功と失敗の両方から学ぶ新しいモデルを提案する。
論文 参考訳(メタデータ) (2025-09-03T10:50:48Z) - TopK Language Models [23.574227495324568]
TopK LMは、モデルサイズ、計算効率、解釈可能性の間の良好なトレードオフを提供する。
これらの機能はTopK LMsを安定させ、言語モデルがどのように概念を学び、表現するかを理解するための信頼性の高いツールにする。
論文 参考訳(メタデータ) (2025-06-26T16:56:43Z) - Can Large Reasoning Models Self-Train? [51.0277533541394]
多数決投票を簡単な自己フィードバック機構として利用し、強化学習において自己学習が持続できるかどうかを検討する。
この基本的なアプローチは、モデルの推論性能だけでなく、次のRLイテレーションでより良い品質フィードバックを生成する能力も改善します。
しかし、我々の分析では、このような自己学習パラダイムの限界も明らかにしています - 自己回帰の長いRLは、報酬のハッキングにつながるため、突然、そして完全なパフォーマンスが崩壊します。
論文 参考訳(メタデータ) (2025-05-27T17:16:00Z) - ReVISE: Learning to Refine at Test-Time via Intrinsic Self-Verification [53.80183105328448]
Refine via Intrinsic Self-Verification (ReVISE)は、LLMが自己検証を通じてアウトプットを自己修正できる効率的なフレームワークである。
様々な推論タスクに関する実験により、ReVISEは効率的な自己補正を実現し、推論性能を大幅に向上することを示した。
論文 参考訳(メタデータ) (2025-02-20T13:50:02Z) - Self-Improvement in Language Models: The Sharpening Mechanism [70.9248553790022]
我々は、レンズを通して自己改善の能力について、新たな視点を提供する。
言語モデルは、正しい応答を生成する場合よりも、応答品質の検証が優れているという観察に感銘を受けて、後学習において、モデル自体を検証対象として、自己改善を形式化する。
SFTとRLHFに基づく自己改善アルゴリズムの2つの自然ファミリーを解析する。
論文 参考訳(メタデータ) (2024-12-02T20:24:17Z) - On the Intrinsic Self-Correction Capability of LLMs: Uncertainty and Latent Concept [36.27550578296276]
大規模言語モデル(LLM)は、自己補正(self-correction)と呼ばれる機能によって、その応答を改善することができる。
内在的な自己補正は、様々な応用で明らかであるが、それが有効である理由や理由は不明である。
内在的な自己補正は徐々に改善され、収束状態に近づくことができることを示す。
論文 参考訳(メタデータ) (2024-06-04T14:55:43Z) - Maximum Likelihood Distillation for Robust Modulation Classification [50.51144496609274]
我々は、より堅牢なAMCシステムを構築するために、知識蒸留のアイデアと敵の訓練に基づいて構築する。
オフライン環境でのAMC問題を解消し,より優れたトレーニングラベルを生成するためのMaximum Likelihood関数を提案する。
論文 参考訳(メタデータ) (2022-11-01T21:06:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。