論文の概要: SanSi: A Looped Typed Decision Model for System 1.5 Thinking
- arxiv url: http://arxiv.org/abs/2610.07730v1
- Date: Tue, 06 Oct 2026 04:28:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.799783
- Title: SanSi: A Looped Typed Decision Model for System 1.5 Thinking
- Title(参考訳): SanSi: システム1.5思考のためのループ型決定モデル
- Abstract要約: 我々は、1つのパスと生成された推論の間に何が存在するかを研究する。
本研究では,事前学習したループ言語モデルを型決定モデルに変換するSanSiを提案する。
59のソースから10,027のテスト判断で、SanSiは72.0%の精度に達した。
- 参考スコア(独自算出の注目度): 25.412761430847365
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Typed decision models answer a declared question without generating text: a decision head returns a probability for each of the declared options in a single forward pass. A single pass is fast, intuitive System 1 thinking. We study what lies between one pass and generated reasoning: looping, in which the same layers are recursively applied several times before one typed readout. Each loop lets the model revise its hidden state before it commits to an answer, without generating a token; we call this System 1.5 thinking. We propose SanSi, which turns a pre-trained looped language model into a typed decision model. The option probabilities are read after every loop, and every loop is trained with a proper scoring rule, so that one model serves every budget from one loop to eight in a single run. On 10,027 test decisions from 59 sources, SanSi reaches 72.0% accuracy: 13.5 points above a non-looped model of the same shape trained with the same recipe, 5.3 points above a newer non-looped model of its size, and 1.8 points below one with three times the parameters. On two depth-controlled tasks, loops extend the solvable depth beyond the depths seen in training, where the larger single-pass model fails. Used as the judge for policy optimization with reinforcement learning, without gold answers, SanSi raises the generator's F1 by 7.7 points.
- Abstract(参考訳): 型付き決定モデルは、テキストを生成することなく宣言された質問に答える: 決定ヘッドは、宣言された各オプションの確率を単一の前方通過で返す。
1つのパスは高速で直感的なシステム1思考です。
1つのパスと生成された推論の間に何が存在するかを調べる:ループ、同じレイヤが1つの型付き読み出しの前に何回か再帰的に適用される。
各ループは、トークンを生成することなく、応答にコミットする前にモデルが隠れた状態を修正します。
本研究では,事前学習したループ言語モデルを型決定モデルに変換するSanSiを提案する。
オプション確率は各ループの後に読み取られ、各ループは適切なスコアリングルールでトレーニングされる。
59ソースからの10,027の試験判定では、SanSiは72.0%の精度に達し、同じレシピでトレーニングされた同じ形状の非ループモデルより13.5ポイント、新しい非ループモデルより5.3ポイント、パラメータの3倍の1.8ポイントである。
2つの深さ制御タスクにおいて、ループは、より大きなシングルパスモデルが失敗する訓練で見られる深さを超えて解ける深さを拡張する。
強化学習による政策最適化の審査員として用いられ、金の答えがないため、サンシは発電機のF1を7.7ポイント引き上げる。
関連論文リスト
- Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering [9.532858656287921]
フリーズ言語モデルにスキルを注入するには、現在100万のパラメータと強化学習パイプラインが必要になる。
動作のクローンによって訓練されたSystem-1決定演算子である Methodを導入し、このコストを約2桁削減する。
23Kパラメータのランク4、最強のスキルオペレータの1/58、検索QAのサフィス、LiveMathのニアサフィスである。
論文 参考訳(メタデータ) (2026-10-03T12:57:57Z) - Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses [6.778374627376906]
System-1決定モデルは、クラス確率で単一のフォワードパスでそのような質問に答える。
オープンウェイト (Laya) モデルとホスト (Jev) System-1 モデルとのペア評価を行った。
論文 参考訳(メタデータ) (2026-10-01T05:57:14Z) - JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated Decisions Models [25.5874772119945]
JevAdvBench は RLCD モデルの最初の敵対的ベンチマークである。
ラベルではなく、モデル自身のクリーンな決定に対して攻撃された各決定をスコア付けし、同じ再実行による変更に対して読み取る。
Jev-1.13.0では、リワードは再実行ベースラインの1.2パーセント以内に留まり、スキーマ外のフィールドはモデルに到達しない。
論文 参考訳(メタデータ) (2026-09-25T11:32:19Z) - RecurTrace: Adaptive Latent Reasoning with Loop-Time Memory [25.81050020222202]
Loop Memory Attentionでは、ループ時間軸に沿った以前のイテレーションから、ループされた各レイヤが自身の状態に参加することができる。
RecurTraceは平均2.0ループで56.9%の精度を達成し、一致した計算で2.2ポイントの最良の固定ループ深さを超えた。
論文 参考訳(メタデータ) (2026-09-03T05:29:24Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - S*: Test Time Scaling for Code Generation [55.11863577956177]
コード生成のための最初のハイブリッドテストタイムスケーリングフレームワークであるS*を提案する。
S*は生成されたコードのカバレッジと選択精度を大幅に改善する。
論文 参考訳(メタデータ) (2025-02-20T09:18:53Z) - Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach [70.44265766483633]
本稿では,潜在空間における暗黙的推論によるテスト時間計算のスケールアップが可能な,新しい言語モデルアーキテクチャについて検討する。
我々のモデルは繰り返しブロックを繰り返すことで動作し、テスト時に任意の深さに展開する。
結果のモデルが推論ベンチマークの性能を劇的に改善できることが示される。
論文 参考訳(メタデータ) (2025-02-07T18:55:02Z) - LoopReg: Self-supervised Learning of Implicit Surface Correspondences,
Pose and Shape for 3D Human Mesh Registration [123.62341095156611]
LoopRegは、スキャンのコーパスを一般的な3Dモデルに登録するエンドツーエンドの学習フレームワークである。
ニューラルネットワークによってパラメータ化された後方マップは、スキャンポイント毎から人間のモデルの表面への対応を予測する。
人間のモデルによってパラメータ化されたフォワードマップは、モデルパラメータ(目的と形状)に基づいて対応するポイントをスキャンに変換する。
論文 参考訳(メタデータ) (2020-10-23T14:39:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。