論文の概要: Pistis Technical Report
- arxiv url: http://arxiv.org/abs/2609.28554v1
- Date: Wed, 23 Sep 2026 08:03:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.398066
- Title: Pistis Technical Report
- Title(参考訳): Pistis 技術報告
- Abstract要約: 本稿では,Qwen3.6 と Qwen3.5 上に構築された 27B パラメータと 9B パラメータの多モーダル大言語モデルからなる Pistis モデル群を提案する。
本研究は, オンライン蒸留と強化学習を密に統合した新たなポストトレーニングパラダイムであるInterleaved Distillation and Reinforcement Learning (IDRL)を提案する。
- 参考スコア(独自算出の注目度): 38.58086343786089
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce the Pistis model family, comprising 27B- and 9B-parameter multimodal large language models built on Qwen3.6 and Qwen3.5, respectively, and developed through a general and scalable post-training framework. The framework first establishes a strong foundation through large-scale multimodal supervised fine-tuning (SFT). Building on this SFT foundation, we propose Interleaved Distillation and Reinforcement Learning (IDRL), a novel post-training paradigm that tightly integrates on-policy distillation and reinforcement learning within a single training loop. By alternating between the two objectives, rather than optimizing either in isolation or combining them in a static joint loss, IDRL enables more effective knowledge transfer, greater optimization stability, and more precise credit assignment for long-horizon agentic trajectories, leading to stronger performance while mitigating common capability trade-offs. At both model scales, the framework produces two specialized variants: Pistis-Thinking, designed to strengthen deep multimodal reasoning, and Pistis-Agentic, which additionally incorporates agentic trajectory data to support long-horizon planning, iterative reasoning, and tool use. Pistis-Agentic is particularly strong in multimodal search. Both scales outperform their corresponding base models. Beyond model-parameter optimization, we further introduce Pistis-Auto-Harnessing (PAH), a system-level method that automatically improves the agent's inference harness through iterative optimization. Experiments demonstrate that PAH enhances the model performance without updating the model parameters or increasing the interaction budget.
- Abstract(参考訳): 本稿では,Qwen3.6とQwen3.5をベースとした27Bパラメータと9Bパラメータのマルチモーダルな大規模言語モデルからなるPristisモデル群について述べる。
このフレームワークは、まず、大規模なマルチモーダル教師付き微調整(SFT)を通じて、強力な基盤を確立する。
本研究では,このSFT基盤を基盤として,単一学習ループ内でのオンライン蒸留と強化学習を密に統合する新たなポストトレーニングパラダイムであるInterleaved Distillation and Reinforcement Learning (IDRL)を提案する。
IDRLは、単独で最適化するか、静的な関節損失で組み合わせるかのどちらかではなく、2つの目的を交互に行うことにより、より効果的な知識伝達、より優れた最適化安定性、長距離エージェント軌道に対するより正確なクレジット割り当てを可能にし、共通の能力トレードオフを緩和しながら、パフォーマンスを向上する。
両方のモデルスケールにおいて、このフレームワークは、深いマルチモーダル推論を強化するように設計されたPistis-Thinkingと、長期計画、反復推論、ツール使用をサポートするためにエージェント的軌跡データを付加したPistis-Agenticの2つの特別なバリエーションを生成する。
Pistis-Agenticは特にマルチモーダル検索において強力である。
どちらのスケールも、対応するベースモデルより優れています。
モデルパラメータ最適化以外にも、反復最適化によりエージェントの推論ハーネスを自動的に改善するシステムレベルの手法であるPristis-Auto-Harnessing(PAH)についても紹介する。
実験によると、PAHはモデルパラメータを更新したり、相互作用予算を増やさなくても、モデル性能を向上させる。
関連論文リスト
- AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution [61.593935260052795]
Supervised Fine-Tuning (SFT) とReinforcement Learning (RL) による後学習は多モーダル大規模言語モデル(MLLM)における推論の強化に不可欠である
既存のパラダイムは、静的データの制限により、しばしばパフォーマンスのボトルネックに達する。
我々は,真理に順応したデータキュレーションとモデル進化を統合する新しいパラダイムであるアンカー進化(AnE)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:26:34Z) - Low-Rank Adaptation Redux for Large Models [41.28925127311434]
低ランク適応(LoRA)は、基礎モデルのパラメータ効率微調整(PEFT)のデファクトスタンダードとして登場した。
実証的な成功と変種の普及にもかかわらず、どのアーキテクチャの選択や最適化手法、デプロイの制約が実用的な方法の選択を導くべきかは、いまだ解明されていない。
この概要は、信号処理(SP)のレンズを通してLoRAを再検討し、古典的な低ランクモデリングツールと逆問題で近代的なアダプタ設計をブリッジする。
論文 参考訳(メタデータ) (2026-04-23T17:50:23Z) - AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents [37.232397795331444]
我々は,エージェント実行中に異なる推論能力を持つモデルを動的にコーディネートする,自己駆動型協調推論フレームワークであるAgenCollabを提案する。
外部ルーティングモジュールに頼る代わりに、このフレームワークはエージェント自身の自己反射信号を使用して、現在の推論軌道が有意義な進歩を遂げているかどうかを判断する。
論文 参考訳(メタデータ) (2026-03-27T03:07:34Z) - Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models [65.4947731385794]
基礎画像中心モデルであるInsight-Vから進化した統合多エージェント視覚推論フレームワークを提案する。
空間的時間的推論を強化し、評価ロバスト性を向上させる2つの新しいアルゴリズムST-GRPOとJ-GRPOを導入する。
LLaVA-NeXTやQwen2.5-VLといったベースモデルの実験は、挑戦的な画像とビデオの推論ベンチマーク間で大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-03-18T15:28:07Z) - Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks [48.105258051884384]
本稿では,モデルの自己補正能力を高めるための2段階トレーニングフレームワークを提案する。
最初の段階では、マルチターン対話戦略がモデルをガイドし、長いチェーン・オブ・シント(CoT)データを生成する。
第2段階では、データの分散を動的に最適化する難易度の高い拒絶サンプリング機構を採用している。
論文 参考訳(メタデータ) (2026-01-09T08:19:11Z) - LARES: Latent Reasoning for Sequential Recommendation [96.26996622771593]
本稿では、シークエンシャルレコメンデーションのための新しいスケーラブルなLatent ReasoningフレームワークであるLARESを紹介する。
提案手法では,パラメータの複雑性を増大させることなく推理深度を柔軟に拡張できる再帰的アーキテクチャを用いている。
我々のフレームワークは既存の高度なモデルとのシームレスな互換性を示し、推奨性能をさらに向上させる。
論文 参考訳(メタデータ) (2025-05-22T16:22:54Z) - When Parameter-efficient Tuning Meets General-purpose Vision-language
Models [65.19127815275307]
PETALは、一意のモード近似技術によって達成される全パラメータの0.5%しか必要とせず、トレーニングプロセスに革命をもたらす。
実験の結果,PETALは現状の手法をほとんどのシナリオで上回るだけでなく,完全な微調整モデルよりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-12-16T17:13:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。