論文の概要: Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models
- arxiv url: http://arxiv.org/abs/2607.14049v1
- Date: Wed, 15 Jul 2026 17:16:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.840532
- Title: Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models
- Title(参考訳): ディープインタラクション:大規模推論モデルのための効率的なヒューマン・AIインタラクション手法
- Abstract要約: 大規模言語モデル(LLM)における推論誤りを正確に修正するための効率的なヒューマン介入機構を提案する。
提案手法により,元の応答を直接編集し,正確な推論手順を保ちながら誤箇所の修正を可能にする。
本手法は,修正成功率を25%以上改善し,STEMタスク推論においてトークン使用率を約40%削減する。
- 参考スコア(独自算出の注目度): 16.90017128904664
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The emergence of Chain-of-Thought (CoT) reasoning has significantly enhanced the ability of large language models (LLMs) to tackle complex, multi-step tasks. However, when errors occur, current interaction approaches typically involve re-generating another response that may make mistakes again, or users laboriously flag the faulty step in follow-up turns that may get responses <You are right, I made a mistake here> followed by similar errors recurring. To address this issue, we propose an efficient human intervention mechanism for precisely correcting reasoning errors in LLMs, termed Deep Interaction. Our approach enables direct editing of the original response, allowing erroneous parts to be corrected while preserving accurate reasoning steps. We refine the edited CoT into a distilled prompt, which then steers the LLM along the corrected reasoning path. Experimental results show that our method achieves over a 25% improvement in correction success rate and reduces token usage by approximately 40% on STEM tasks reasoning compared to baseline approaches.
- Abstract(参考訳): CoT(Chain-of-Thought)推論の出現により、大規模言語モデル(LLM)の複雑なマルチステップタスクへの対処能力が大幅に向上した。
しかし、エラーが発生した場合、現在のインタラクションアプローチでは、通常、再び失敗する可能性のある別のレスポンスを再生成する。
そこで本研究では,LLMの推論誤りを高精度に補正する,効率的なヒューマン介入機構を提案する。
提案手法により,元の応答を直接編集し,正確な推論手順を保ちながら誤箇所の修正を可能にする。
我々は、編集したCoTを蒸留プロンプトに精製し、修正された推論経路に沿ってLCMを操る。
実験結果から,本手法は修正成功率を25%以上向上し,STEMタスクにおけるトークン使用率をベースライン手法と比較して約40%削減できることがわかった。
関連論文リスト
- A Training-Free Regeneration Paradigm: Contrastive Reflection Memory Guided Self-Verification and Self-Improvement [8.401193963526236]
オフライン処理型コントラストリフレクションメモリ(RM)を利用したトレーニングフリー再生パラダイムを提案する。
推論時に、RM誘導の自己検証を行い、続いて単一のRM誘導の再生を行い、反復補正とマルチサンプル選択の両方を避ける。
実験の結果,提案手法は計算コストを低く抑えつつ,先行手法よりも優れていた。
論文 参考訳(メタデータ) (2026-03-20T19:12:36Z) - InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning [32.274434679047395]
アウトカム・リワード強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上に有効であることが証明された。
標準RLは最終回答のレベルにのみクレジットを割り当て、結果が正しくない場合にすべての推論トレースを罰する。
Invention Training (InT) は、モデルが独自の推論トレースに基づいてきめ細かいクレジット割り当てを行う訓練パラダイムである。
論文 参考訳(メタデータ) (2026-01-20T18:15:38Z) - A model of errors in transformers [14.482123927397135]
決定論的出力を必要とするタスクにおけるLLMの誤り率と,少人数の代替案から引き出されたトークンの繰り返し処理について検討する。
注意機構の小さな誤差がしきい値を超えたときに、誤った予測が生じることを論じる。
エラー率を減らすためにプロンプトを構築する方法を示す。
論文 参考訳(メタデータ) (2026-01-20T17:27:03Z) - Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization [56.59356959631999]
Gated Perception-Reasoning Optimization (GPRO) は3つの決定経路間で動的に計算をルーティングするメタ推論コントローラである。
GPROは精度と効率を大幅に改善し、最近のスロー思考法よりも優れている。
論文 参考訳(メタデータ) (2026-01-07T23:05:17Z) - Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank [71.09032766271493]
大規模言語モデル (LLM) は誤りや幻覚を引き起こす傾向がある。
アウトプットを効果的かつ効率的にチェックする方法は、アプリケーションにとって重要な問題となっている。
論文 参考訳(メタデータ) (2025-10-28T11:01:10Z) - Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs [57.10533368622962]
大規模言語モデル(LLM)の自己補正は、推論性能を高める重要な要素として現れる。
本研究では,自己補正戦略の有効性を評価するためのベンチマークであるCorrectBenchを紹介する。
その結果,1) 自己補正手法は, 複雑な推論タスクにおいて, 精度を向上させることが可能であり, 2) 異なる自己補正戦略の混合により, 効率は低下するものの, さらなる改善がもたらされることが明らかとなった。
論文 参考訳(メタデータ) (2025-10-17T02:40:19Z) - Self-Corrective Task Planning by Inverse Prompting with Large Language Models [9.283971287618261]
InversePromptは,新しい自己修正型タスクプランニング手法である。
提案手法は、明確な解釈可能なフィードバックを提供するための推論ステップを組み込んだものである。
ベンチマークデータセットの結果は、既存のLCMベースのタスク計画手法よりも平均16.3%高い成功率を示している。
論文 参考訳(メタデータ) (2025-03-10T13:35:51Z) - Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing [59.405145971637204]
eRror-Injected Self-Editing (RISE) と呼ばれる新しい好み学習フレームワークを提案する。
RISEは、事前定義された微妙なエラーをピボットトークンに注入する。
RISEの有効性を検証する実験では、Qwen2-7B-Instructでの優先学習により、GSM8Kでは3.0%、MATHでは7.9%が顕著に改善され、トレーニングサンプルは4.5Kに留まった。
論文 参考訳(メタデータ) (2024-10-09T07:43:38Z) - Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification [52.095460362197336]
大規模言語モデル(LLM)は一貫性と正確な推論に苦しむ。
LLMは、主に正しいソリューションに基づいて訓練され、エラーを検出して学習する能力を減らす。
本稿では,CoT(Chain-of-Thought)とPoT(Program-of-Thought)を組み合わせた新しい協調手法を提案する。
論文 参考訳(メタデータ) (2024-10-05T05:21:48Z) - Derailer-Rerailer: Adaptive Verification for Efficient and Reliable Language Model Reasoning [11.765298236504155]
Derailer-Rerailerは推論精度と計算効率のバランスをとる新しいフレームワークである。
提案手法は,従来の検証手法に比べて2~3倍の効率を維持しつつ,大幅な精度向上(8~11%)を実現している。
論文 参考訳(メタデータ) (2024-08-25T21:20:17Z) - Factual Error Correction for Abstractive Summaries Using Entity
Retrieval [57.01193722520597]
本稿では,エンティティ検索後処理に基づく効率的な事実誤り訂正システムRFECを提案する。
RFECは、原文と対象要約とを比較して、原文から証拠文を検索する。
次に、RFECは、エビデンス文を考慮し、要約中のエンティティレベルのエラーを検出し、エビデンス文から正確なエンティティに置換する。
論文 参考訳(メタデータ) (2022-04-18T11:35:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。