論文の概要: TACIT-Switch: Cost-Aware Model Escalation for LLM Agents from Censored Supervision
- arxiv url: http://arxiv.org/abs/2608.27911v2
- Date: Fri, 04 Sep 2026 03:33:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.309802
- Title: TACIT-Switch: Cost-Aware Model Escalation for LLM Agents from Censored Supervision
- Title(参考訳): TACIT-Switch: 補償スーパービジョンによるLCMエージェントのコスト意識モデルエスカレーション
- Abstract要約: より小さな言語モデルバックボーンを持つエージェントは永続的な障害モードにドリフトできるが、より大きなバックボーンを持つエージェントは一般的により信頼性が高いがよりコストがかかる。
この信頼性の高いトレードオフは、より大きなバックボーンを持つエージェントをいつ呼び出すかを決定するルーティングメソッドを動機付けます。
提案手法であるTACIT-SWITCHは,蓄積された軌跡の証拠から永久的ハンドオフポリシーを学習する。
- 参考スコア(独自算出の注目度): 2.681967953218225
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agents with smaller language-model backbones are less expensive but can drift into persistent failure modes, whereas those with larger backbones are generally more reliable but more costly. This reliability-cost trade-off motivates routing methods that decide when to invoke an agent with a larger backbone: before execution, after a fixed trajectory prefix, or locally at individual steps. Our method, TACIT-SWITCH, learns permanent handoff policies from accumulated trajectory evidence and Teacher-Annotated Censored Intervention Times (TACIT). It represents each annotation as an interval-censored observation on a cumulative-risk scale. The resulting mixture-cure threshold model estimates the probability that the paired Strong rollout succeeds and, conditional on success, the handoff threshold; no teacher is required at deployment. In a mechanism-based multi-step simulation, TACIT-SWITCH improves success by 7.4-11.1 percentage points over task-level, step-level, and fixed-prefix routing baselines at comparable cost. Within that controlled simulation, ablations show that task features and cumulative trajectory risk provide complementary information. With operating points selected on development data, TACIT-SWITCH achieves the highest held-out success among learned policies on both ALFWorld (48.5% with 4B Cheap; 45.5% with 9B Cheap) and DABench (73.1%).
- Abstract(参考訳): より小さな言語モデルバックボーンを持つエージェントはコストが安いが、永続的な障害モードにドリフトすることができる。
この信頼性の高いトレードオフは、実行前、固定軌道プレフィックスの後に、あるいは個々のステップでローカルに、より大きなバックボーンを持つエージェントをいつ呼び出すかを決定するルーティングメソッドを動機付けている。
提案手法であるTACIT-SWITCHは,蓄積された軌道証拠とTeacher-Annotated Censored Intervention Times (TACIT)から永久的ハンドオフポリシーを学習する。
これは各アノテーションを累積リスク尺度における間隔式観察として表現する。
得られた混合キューしきい値モデルでは、ペアのStrongロールアウトが成功する確率を推定し、成功を条件にハンドオフしきい値が設定される。
機構ベースのマルチステップシミュレーションでは、TACIT-SWITCHはタスクレベル、ステップレベル、固定プレフィックスのルーティングベースラインを同等のコストで7.4-11.1ポイント向上する。
その制御されたシミュレーションの中で、アブレーションはタスクの特徴と累積軌道リスクが相補的な情報を提供することを示した。
TACIT-SWITCHは、開発データに基づいて選択された運用ポイントによって、ALFWorld(48.5%が4Bチープ、45.5%が9Bチープ)とDABench(73.1%)の両方の学習ポリシーの中で最も成功している。
関連論文リスト
- When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents [62.10623192614306]
過去の成功からスキルを抽出することは、Large Language Model (LLM)エージェントの効率的な進化に不可欠である。
textbfBoundary-Aware Skill Memory (BASM)を提案する。
BASMは、成功度の高いスキルメモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T10:16:06Z) - TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents [22.01777615106231]
Long-Horizon Large Language Model (LLM) エージェントは通常、スパース終端結果に最適化される。
本稿では、ステップレベルの監督を行動誘発遷移から直接引き出すトランジッションワイド・クレジット・アサインメントを提案する。
ALFWorld、WebShop、および7つの検索拡張された質問回答ベンチマークの実験は、評価されたベースラインよりも一貫した改善を示している。
論文 参考訳(メタデータ) (2026-08-17T06:19:12Z) - A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents [0.0]
専門的エージェント軌道上のオープンウェイトLSMの微調整が、有能なコードエージェントを構築するための顕著なアプローチとして現れている。
本稿では,SWEトラジェクトリデータセット上でのQwen2.5-Coder-7B-InstructのLoRA微調整のためのトラジェクトリデータフィルタリングの系統的研究について述べる。
我々は,2軸品質評価フレームワークである効率とスタイルを提案し,戦略,スケール,アブレーション分析にまたがる16の制御実験を通じて評価する。
論文 参考訳(メタデータ) (2026-07-19T11:52:32Z) - Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning [6.365332042924078]
本稿では,ロールアウト後の自己蒸留フレームワークであるStepOPSDについて紹介する。
StepOPSDは、軌跡をアクション中心のステップセグメントに分解し、後見豊かな教師コンテキスト下でそれらを再構成する。
より小さい_clipは広範囲に安定化された局所信頼領域として作用するが、最適な大域混合強度_mixはタスク依存のままである。
論文 参考訳(メタデータ) (2026-05-26T15:07:03Z) - R2V Agent: Teaching SLMs When to Ask for Help [13.959667066774124]
対話型エージェントのためのリスク校正型SLM-LLMルーティングフレームワークである textbfR2V-Agent を紹介する。
R2Vは、蒸留された小型言語モデル (SLM) ポリシー、より強力な教師 LLM、各ステップで候補アクションをスコアする軽量プロセス検証器、およびキャリブレーションされたステップレベルのルータの4つのコンポーネントを組み合わせている。
論文 参考訳(メタデータ) (2026-05-15T20:10:24Z) - Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - Efficient Process Reward Modeling via Contrastive Mutual Information [8.346479730119436]
本稿では,新しい自動報酬表示手法として,CPMI(Contrative Pointwise mutual information)を提案する。
CPMIは、推論ステップがステップと正しいターゲット回答の間の相互情報を増加させる程度を定量化する。
CPMIに基づくラベリングは,MC推定と比較してデータセット構築時間を84%削減し,トークン生成を98%短縮することを示した。
論文 参考訳(メタデータ) (2026-04-12T14:28:35Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning [55.96599486604344]
本稿では,Large Language Models (LLMs) の推論能力向上を目的とした,反復的な選好学習プロセスによるアプローチを提案する。
我々は、MCTS(Monte Carlo Tree Search)を用いて好みデータを反復的に収集し、そのルックアヘッド機能を利用して、インスタンスレベルの報酬をよりきめ細かいステップレベルの信号に分解する。
提案アルゴリズムはDPO(Direct Preference Optimization)を用いて,新たに生成されたステップレベルの優先度データを用いてLCMポリシーを更新する。
論文 参考訳(メタデータ) (2024-05-01T11:10:24Z) - DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based Reasoning [56.887047551101574]
大規模言語モデル(LLM)エージェントとケースベース推論(CBR)を利用した新しいフレームワークであるDS-Agentを提案する。
開発段階では、DS-AgentはCBRフレームワークに従い、自動イテレーションパイプラインを構築する。
デプロイメントの段階では、DS-Agentは、シンプルなCBRパラダイムで低リソースのデプロイメントステージを実装し、LCMの基本能力に対する需要を大幅に削減する。
論文 参考訳(メタデータ) (2024-02-27T12:26:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。