論文の概要: Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning
- arxiv url: http://arxiv.org/abs/2608.15065v1
- Date: Sat, 15 Aug 2026 06:32:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.178907
- Title: Funnel of Thoughts: Efficient Test-Time Scaling via Early Voting and Rollout Pruning
- Title(参考訳): 思考のファンネル:早期投票とロールアウト・プルーニングによる効率的なテスト時間スケーリング
- Authors: Chanhee Park, Sungbin Han, Jeongho Yoon, Seongtae Hong, Heuiseok Lim,
- Abstract要約: Funnel of Thoughts (FoT) は、完全な32軌道投票精度を維持しつつ、その注意点FLOPを半減する推論時間法である。
FoTは、これらの病理パターンを捉えた語彙を同定し、プルーンは完成前に軌道に影響した。
FLOPを56.1%減らし、ウォールタイムを37.6%減らした。
- 参考スコア(独自算出の注目度): 18.486321422780087
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Reasoning Models produce diverse, sometimes inconsistent answers across repeated queries on the same problem, so multi-sample inference is a prerequisite for reliable deployment. Majority voting at k rollouts is the standard solution and the de facto accuracy target for this regime, but it is prohibitively expensive at the scale LRMs require. We introduce Funnel of Thoughts (FoT), an inference-time method that preserves the full 32-trajectory voted accuracy while halving its attention FLOPs, a 28.8% reduction in full-model inference cost. Across 115K reasoning trajectories from six LRMs, we find that unproductive trajectories often reveal themselves through repeated hesitation markers such as "Wait", "Actually", and "perhaps." These trajectories are less likely to reach the correct answer and consume disproportionate attention FLOPs, degenerating into no-answer loops in the worst case. Built on this training-free lexical signal, FoT identifies the vocabulary that captures these pathological patterns and prunes affected trajectories before completion, reducing online generation attention FLOPs by 56.1% and wall time by 37.6% without any additional model inference; the same signal transfers without retuning across held-out architectures and out-of-domain tasks.
- Abstract(参考訳): 大規模な推論モデルは、同じ問題に対する繰り返しクエリにまたがる多様な、時には一貫性のない回答を生成するため、マルチサンプル推論は信頼性の高いデプロイメントの前提条件である。
kロールアウトにおける多数決は、この体制の標準解であり、事実上の精度目標であるが、LRMが必要とする規模では非常に高価である。
フルモデル推論コストを28.8%削減したFLOPを半減させながら,全32軌道投票精度を維持する推論時間法であるFunnel of Thoughts(FoT)を導入する。
6つのLRMから115Kの軌道を推理すると、非生産的な軌道はしばしば「待ち」や「アクタリー」、そして「おそらく」のような反復的に発散マーカーを通して明らかになる。
これらの軌道は正しい答えに届かず、不均等な注意 FLOP を消費し、最悪の場合、無解答ループに縮退する。
このトレーニング無しの語彙信号に基づいてFoTは、これらの病理パターンとプルーネが完成した前に軌道に影響した語彙を識別し、オンライン生成注意 FLOP を56.1%、ウォールタイムを37.6%減らし、追加のモデル推論をすることなく、同じ信号転送を保留のアーキテクチャやドメイン外タスクを変更せずに行う。
関連論文リスト
- Stop When Further Reasoning Won't Help: Attention-State Adaptive Generation in Reasoning Models [11.158010513386666]
大規模推論モデル(LRM)は、明確な連鎖推論プロセスによって複雑な問題を解くことができる。
LRMはしばしば過大評価に悩まされ、冗長なトークン出力と劣化した精度をもたらす。
本稿では,モデルの推論状態を推定し,生成戦略を適応的に調整するASAGを提案する。
論文 参考訳(メタデータ) (2026-06-13T02:58:29Z) - ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning [69.64972562984882]
提案するThoughtFoldは,よりきめ細かい選好学習を,効率的な推論のための冗長探索に活用するフレームワークである。
ThoughtFoldは効率を大幅に向上させる。
最先端の精度を維持しつつ、DeepSeek-R1-Distill-Qwen-7Bのトークン使用量を約56%削減する。
論文 参考訳(メタデータ) (2026-06-02T11:21:27Z) - PathCal: State-Aware Reflection-Marker Calibration for Efficient Reasoning [23.11660945127322]
異なるマーカークラスが、異なる方法で精度と生成長に影響を与えることを示す。
PathCalは、マーカーの型を識別することで推論経路を校正する学習不要な復号制御器である。
論文 参考訳(メタデータ) (2026-05-21T22:13:20Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution [79.98699884805636]
Reasoning Execution by Multiple Listeners (REMUL) は多人数の強化学習手法である。
REMULは、推論が他の当事者に従えるかがより忠実になるという仮説に基づいている。
スピーカーは、リスナーにとって明らかな推論を生み出すことで報われます。
論文 参考訳(メタデータ) (2026-02-18T02:55:55Z) - Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning [0.0]
強化推論(Reinforcement Inference)は、モデル自身の不確実性を使用して、第二の、より意図的な推論の試みを選択的に呼び出す。
12,032のMMLU-Pro質問では、DeepSeek-v3.2を使ってゼロショット設定で決定論的デコーディングを行い、Reinforcement Inferenceは精度を60.72%から84.03%に改善した。
論文 参考訳(メタデータ) (2026-02-09T11:08:24Z) - Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization [56.59356959631999]
Gated Perception-Reasoning Optimization (GPRO) は3つの決定経路間で動的に計算をルーティングするメタ推論コントローラである。
GPROは精度と効率を大幅に改善し、最近のスロー思考法よりも優れている。
論文 参考訳(メタデータ) (2026-01-07T23:05:17Z) - Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning [11.179446105672461]
教師付き微調整と強化学習を組み合わせた多段階効率的な推論手法を提案する。
提案手法は,8Bモデルでは平均28%,32Bモデルでは40%の応答長を減少させる。
より複雑な最先端の効率的な推論手法に比べて、優れたトレードオフを実現する。
論文 参考訳(メタデータ) (2026-01-06T12:31:51Z) - What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding [84.42056293290015]
推論モデルと非推論モデルの間のトークンレベルのミスアライメントを分析する。
本稿では,FoReaL-Decodingを提案する。
一般的な4つの数学推論ベンチマークにおいて、FoReaL-Decodingは理論FLOPを30から50%減らし、CoTの長さを最大40%減らした。
論文 参考訳(メタデータ) (2025-06-08T05:08:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。