論文の概要: Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B
- arxiv url: http://arxiv.org/abs/2607.28576v1
- Date: Thu, 30 Jul 2026 17:38:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.702163
- Title: Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B
- Title(参考訳): 余分なリフレクション: 1.5Bから7Bまで、同じコストで繰り返しサンプリングする自己修正と反射損失
- Abstract要約: 言語モデルプランの作成、独自の回答の批判と書き直し、ミスの反映、いくつかの試みのベストの選択、あるいは自分自身のコピーで議論する方法は、ほとんどすべてが、単一の思考の連鎖よりもはるかに多くのテキストを生成する。
より多くのテキストを生成すると、それ自身で精度が上がるので、ある思考の連鎖の利得は、その方法のアイデアを示さない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Methods that make a language model plan, criticise and rewrite its own answer, reflect on mistakes, pick the best of several attempts, or debate with copies of itself nearly all make it generate far more text than a single chain of thought. Because generating more text raises accuracy by itself, a gain over one chain of thought does not show the method's idea is what helped. Wang et al. (2024) reported that a simple baseline, sampling the same question repeatedly and keeping the most common answer, often wins once budgets are comparable, but gave point estimates with no confidence intervals or significance tests. We rerun that comparison as a designed experiment: seven methods, open models of 1.5B, 3B and 7B parameters, two mathematics benchmarks, 150 questions each. We count every generated token, including those spent on critiques, reflections, debate turns and checking, and compare each method against repeated sampling at its own measured cost. All 36 comparisons are paired by question, with bootstrap intervals and multiplicity correction. No method is reliably better than repeated sampling at equal cost anywhere. Ten are reliably worse, all of them methods where the model inspects its own output, and all 18 self-inspection comparisons are negative. The two kinds of self-inspection part company as models grow. Choosing stops hurting: taking Best-of-N's eight samples and just counting the most common answer beats letting the model pick by 8.0 and 11.3 points at 1.5B, but only 2.0 and 1.3 at 7B, no longer distinguishable from zero. Rewriting does not recover: Self-Refine and a forced Reflexion stay 3.6 to 10.1 points below baseline at 7B. Reflexion as published never triggered its own retry on the smallest model. It judged itself correct every time and silently became a single chain of thought. We release code, prompts, all generations, and our verification scripts.
- Abstract(参考訳): 言語モデルプランの作成、独自の回答の批判と書き直し、ミスの反映、いくつかの試みのベストの選択、あるいは自分自身のコピーで議論する方法は、ほとんどすべてが、単一の思考の連鎖よりもはるかに多くのテキストを生成する。
より多くのテキストを生成すると、それ自身で精度が上がるので、ある思考の連鎖の利得は、その方法のアイデアが役に立ったことを示さない。
Wang et al (2024) は、単純なベースラインが、同じ質問を繰り返しサンプリングし、最も一般的な答えを保持し、予算が同等になるとしばしば勝利する、と報告したが、信頼区間や重要度テストのない点推定を与えた。
7つの方法、1.5B、3B、7Bパラメータのオープンモデル、2つの数学ベンチマーク、それぞれ150の質問。
批判、リフレクション、議論の順番とチェックに費やされたトークンを含む、生成されたトークンをカウントし、各メソッドを、それぞれの測定コストで繰り返しサンプリングと比較する。
36の比較はすべて、ブートストラップ間隔と多重度補正によって、質問によってペアリングされる。
どこでも同じコストで繰り返しサンプリングするよりも確実な方法はない。
モデルが自身の出力を検査し、18の自己検査比較がすべて負の手法である。
モデルが成長するにつれて、二種類の自己検査部品会社が成長する。
ベスト・オブ・Nの8つのサンプルを受け取り、最も一般的な解答は1.5Bで8.0と11.3のポイントを選択できるが、7Bで2.0と1.3しか0と区別できない。
セルフリファインと強制リフレクションは7Bでベースラインより3.6から10.1ポイント下にとどまる。
公表された反射は、最小のモデルに対する独自の再試行を引き起こすことはなかった。
それは毎回正しいと判断し、静かに一つの考えの連鎖となった。
コード、プロンプト、すべての世代、検証スクリプトをリリースします。
関連論文リスト
- Does Fault Localization Beat a Fresh Attempt? A Placebo-Controlled Study of Test-Guided Code Repair [0.0]
フォールトローカライゼーションは、失敗したテストが意味するステートメントにコードモデルの修復に集中することができるが、ターゲットの編集が成功するのは、それが小さいためだけである。
我々はこれらの説明を3つの腕で分け、同じ失敗候補に当てはめます。
3つのフリーズ26-32Bモデル、3つのベンチマーク、488の候補が失敗し、3つの結果が続いた。
論文 参考訳(メタデータ) (2026-09-01T07:48:51Z) - Recursive Agentic Reasoning [4.7490116928645065]
反復精製、分解、繰り返しサンプリングといったテスト時間推論手法は、しばしば分離して評価される。
エージェントの推論トレース上の再帰演算子として,これらの手法の統一ビューを導入する。
同一のプロンプト、トークン予算、グレーディングコードを持つ共有ハーネスの下で、3つの演算子全てをシングルパスチェーン・オブ・ソートベースラインに対して評価する。
論文 参考訳(メタデータ) (2026-08-25T01:34:08Z) - Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models [0.0]
Self-repairはコードエージェントの標準コンポーネントであり、ほとんど常にリトライしないベースラインに対して評価されている。
MBPP+を3つのモデルスケールでプラセボ制御した設計を用いて, 整合型再試行条件を4つ比較した。
論文 参考訳(メタデータ) (2026-07-28T16:58:27Z) - Test-Time Scaling for Small VLMs on Multilingual Visual MCQ [0.0]
自己整合性,記述領域とPRM誘導ビームサーチ,およびQwen2.5-VL-7B-インストラクトとQwen3.5-4Bの2つのポストホックセレクタを比較した。
重要なのは、TTSが実行している条件であり、検索や検証の仕組みではない。
論文 参考訳(メタデータ) (2026-07-10T14:09:04Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness [12.183451602438753]
単純な語彙制約(句読解文字または共通単語の禁止)により、命令調整されたLLMが応答を崩壊させることを示す。
ベースモデルでは,同じ制約の下で,小さな,騒々しい,双方向的な効果を伴って,体系的な崩壊を示さないことを示す。
論文 参考訳(メタデータ) (2026-04-14T17:40:01Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning [85.05204262206296]
大きな推論モデル(LRM)は、長い思考の連鎖を生成することによって、強い性能を達成するが、その推論コストは高い。
小型言語モデル(SLM)はより効率的であるが、多段階推論タスクでは困難である。
本研究では, LRM が SLM を選択的かつ簡潔にガイドする推論時協調手法である MentorCollab を提案する。
論文 参考訳(メタデータ) (2026-02-05T04:58:16Z) - Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning [48.14470449860784]
テスト時強化学習(TTRL)は、推論時に合成信号のみを使用してモデルを適応するためのラベルなしパラダイムを提供する。
簡単な直感に基づくフレームワークであるSelf-Harmonyを紹介します。
論文 参考訳(メタデータ) (2025-11-03T03:34:34Z) - Do Repetitions Matter? Strengthening Reliability in LLM Evaluations [0.374750127323442]
LLMのリーダーボードはシングルランに依存することが多いが、信頼できる結論を得るために何回繰り返しが必要なのかは不明だ。
我々は、AI4Mathベンチマークで8つの最先端モデルを再評価し、設定ごとに3つの独立した実行を実行しました。
論文 参考訳(メタデータ) (2025-09-28T21:45:20Z) - Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think [51.0691253204425]
我々は2つの質問に答えるために中間的推論ステップを解析する: 最終的な答えはモデルの最適結論を確実に表すか?
我々のアプローチは、推論トレースを言語的手がかりに基づくシーケンシャルなサブソートに分割することである。
これらの解答を最も頻繁な解(モード)を選択して集約すると、元の完全トレースから得られる解のみに依存するよりも、はるかに高い精度が得られることが判明した。
論文 参考訳(メタデータ) (2025-04-29T12:39:07Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。