論文の概要: When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis
- arxiv url: http://arxiv.org/abs/2606.23196v1
- Date: Mon, 22 Jun 2026 11:44:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 23:25:54.291098
- Title: When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis
- Title(参考訳): 内在的自己補正はいつ役に立つか? : タスク感性分析
- Authors: Elroy Stav, Dvir Berlowitz, Maayan Orner, Sarit Kraus,
- Abstract要約: Intrinsic Self-correction (SC) は、外部からのフィードバックなしに、モデルが自身の初期回答を再検討するよう促すことで、大きな言語モデルの出力を改善することを目的としている。
近年の研究はこのアプローチの信頼性を疑問視しており、モデルが最初の反応が正しいかどうかを判断するのに苦慮していることを示している。
- 参考スコア(独自算出の注目度): 14.887282030243185
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Intrinsic self-correction (SC) aims to improve large language model outputs by prompting a model to revisit its own initial answer without external feedback. Recent studies have questioned the reliability of this approach, showing that models often struggle to judge whether their initial responses are correct. In this work, we take a task-sensitive view of SC. Rather than asking whether it works in general, we examine settings where SC may operate through different mechanisms: verifying explicit constraints, revisiting a complex reasoning process, or providing a second opinion over competing strategies in word-game tasks. Across multiple benchmarks and models, we find that SC can yield consistent performance gains when the underlying task structure facilitates these modes of revision. These results suggest that SC is best understood as a task-dependent inference-time strategy whose usefulness depends on the role the revision stage can play in a given task, rather than as a uniformly reliable method for improving initial model outputs.
- Abstract(参考訳): Intrinsic Self-correction (SC) は、外部からのフィードバックなしに、モデルが自身の初期回答を再検討するよう促すことで、大きな言語モデルの出力を改善することを目的としている。
近年の研究はこのアプローチの信頼性を疑問視しており、モデルが最初の反応が正しいかどうかを判断するのに苦慮していることを示している。
本研究では,タスクに敏感なSCについて考察する。
SCが一般に機能するかどうかを問うのではなく、明示的な制約の検証、複雑な推論プロセスの再検討、ワードゲームタスクにおける競合戦略に対する第2の意見の提供など、さまざまなメカニズムを通じてSCが動作可能な設定を検討する。
複数のベンチマークやモデルにまたがって,タスク構造がこれらのリビジョンのモードを促進すると,SCは一貫した性能向上を達成できることがわかった。
これらの結果から、SCは、初期モデル出力を改善する一様信頼性の高い方法ではなく、その修正段階が与えられたタスクで果たす役割に依存するタスク依存推論時戦略として理解されていることが示唆された。
関連論文リスト
- RASPRef: Retrieval-Augmented Self-Supervised Prompt Refinement for Large Reasoning Models [0.0]
本稿では,人間のアノテーションやタスク固有の監督を必要とせず,プロンプトを改善するフレームワークであるRetrieval-Augmented Self-Supervised Prompt Refinement (RASPRef)を紹介する。
RASPRefは、プロンプトを最適化ターゲットとして直接扱い、反復的な検索誘導処理により改善する。
論文 参考訳(メタデータ) (2026-03-27T21:49:21Z) - Structured Reasoning for Large Language Models [59.215789462977206]
本研究では、推論を明示的、評価可能、トレーニング可能なコンポーネントに分解するフレームワークであるStructured Reasoning(SCR)を提案する。
SCRは推論効率と自己検証を大幅に改善する。
既存の推論パラダイムと比較して、出力トークンの長さを最大50%削減する。
論文 参考訳(メタデータ) (2026-01-12T04:04:01Z) - LLM Probing with Contrastive Eigenproblems: Improving Understanding and Applicability of CCS [0.17188280334580197]
最適化されるべきなのは、相対的なコントラスト一貫性である、と私たちは主張する。
我々は CCS を固有確率として再構成し、解釈可能な固有値と複数の変数への自然な拡張を持つ閉形式解を得る。
この結果から,コントラスト整合性の相対性化はCSの理解を向上するだけでなく,より広範な探索や機械的解釈可能性手法の道を開くことが示唆された。
論文 参考訳(メタデータ) (2025-11-03T22:00:37Z) - AURORA: Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation [113.75682363364004]
AURORAは、参照音声視覚セグメント化における真の推論と言語理解を強化するために設計されたフレームワークである。
AURORAはRef-AVSベンチマークの最先端性能を達成し、非参照セグメンテーションに効果的に一般化する。
論文 参考訳(メタデータ) (2025-08-04T07:47:38Z) - Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning [0.42855555838080844]
本研究では,視覚言語モデル(VLM)の空間的推論能力について,Chain-of-Thoughtプロンプトと強化学習を通して検討した。
モデルが解答の前に推論ステップを生成する単純なCoT形式は、モデルの本来の性能を損なう可能性がある。
対照的に、シーングラフ(SceneGraph CoT)に基づく構造化マルチステージプロンプトは空間推論の精度を大幅に向上させる。
論文 参考訳(メタデータ) (2025-07-06T10:51:12Z) - ReVISE: Learning to Refine at Test-Time via Intrinsic Self-Verification [53.80183105328448]
Refine via Intrinsic Self-Verification (ReVISE)は、LLMが自己検証を通じてアウトプットを自己修正できる効率的なフレームワークである。
様々な推論タスクに関する実験により、ReVISEは効率的な自己補正を実現し、推論性能を大幅に向上することを示した。
論文 参考訳(メタデータ) (2025-02-20T13:50:02Z) - Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision [120.40788744292739]
本稿では、推論と批判モデルの役割を分離する2人プレイヤパラダイムを提案する。
まず、批判データを収集する自動化およびスケーラブルなフレームワークであるAutoMathCritiqueを提案する。
テスト時間における難解なクエリに対するアクターのパフォーマンスを,批判モデルが一貫して改善することが実証された。
論文 参考訳(メタデータ) (2024-11-25T17:11:54Z) - Recursive Introspection: Teaching Language Model Agents How to Self-Improve [30.086494067593268]
RISE: Recursive IntroSpEctionは,大規模言語モデルを微調整する手法である。
実験の結果,RISEはLlama2,Llama3,Mistralの各モデルに対して,数学推論タスクのターン数を増やすことで自己改善を可能にすることがわかった。
論文 参考訳(メタデータ) (2024-07-25T17:35:59Z) - Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model [86.9619638550683]
視覚言語基礎モデルは、画像とテキストのペアデータに拡張性があるため、多数の下流タスクで顕著な成功を収めている。
しかし、これらのモデルは、決定ショートカットの結果、きめ細かな画像分類などの下流タスクに適用した場合に重大な制限を呈する」。
論文 参考訳(メタデータ) (2024-03-01T09:01:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。