論文の概要: Trinity: Self-Evolving Vision-Language Models with a Self-Verifier
- arxiv url: http://arxiv.org/abs/2610.04469v1
- Date: Sat, 03 Oct 2026 12:17:29 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:32:24.079468
- Title: Trinity: Self-Evolving Vision-Language Models with a Self-Verifier
- Title(参考訳): Trinity: 自己検証による自己進化型視覚言語モデル
- Abstract要約: 自己進化型視覚言語モデル(VLM)は、教師なしの方法で推論能力を拡大するエージェントへの有望なルートである。
本稿では,VLMが3つの役割,問合せ,解答,検証の3つを演じるトリニティについて述べる。
Verifierは、画像のグラウンド化のために生成されたすべての質問をスクリーニングし、監督される前に正解する。
- 参考スコア(独自算出の注目度): 54.51233137413308
- License:
- Abstract: Self-evolving vision-language models (VLMs), a form of self-improvement in which a model generates its own training data from unlabeled images, are a promising route toward agents that expand their reasoning capability in an unsupervised manner, without relying on ever-larger annotation budgets. Existing methods pair a Questioner that proposes problems with a Solver that answers them, but reward both roles mainly by agreement among sampled answers. Agreement is a weak proxy for truth: it cannot tell whether a question is grounded in the image, whether the proposed reference answer is right, or whether a confident majority is wrong in the same way. We present Trinity, in which one VLM plays three roles, Questioner, Solver, and Verifier, and the Verifier is a self-verifier: an exponential moving average (EMA) of the policy itself, requiring neither labels nor an external judge. The Verifier screens every generated question for image grounding and answer correctness before it becomes supervision, scores Solver reasoning against the image, and adjudicates disputes between the reference answer and a strong Solver consensus, correcting the reference and penalizing the Questioner when the consensus is right. Trained on images alone, Trinity improves Qwen3-VL-8B on mathematical visual reasoning and on science benchmarks with biology content, for example, +8.6 points on the biology split of SciVQR and +12.8 on MathVerse, and its reward dynamics behave as a healthy self-play curriculum should. These results suggest that a self-evolving multimodal agent can strengthen its scientific reasoning from unlabeled scientific images alone, with the model itself serving as the verifier.
- Abstract(参考訳): 自己進化視覚言語モデル(VLM)は、モデルがラベルのない画像から独自のトレーニングデータを生成する自己改善の形式であり、より大規模なアノテーション予算に頼ることなく、教師なしの方法で推論能力を拡大するエージェントへの有望なルートである。
既存のメソッドは、答えるソルバーに問題を提案する質問者と組み合わせるが、主にサンプリングされた回答間の合意によって、両方の役割に報酬を与える。
ある質問が画像に根拠づけられているかどうか、提案された参照回答が正しいかどうか、あるいは自信のある多数派が同じ方法で間違っているかどうかを判断できない。
本稿では,一つのVLMが3つの役割,問合せ,解答,検証の3つを担い,検証は自己検証であり,ラベルも外部の審査員も必要とせず,政策そのものの指数的移動平均(EMA)であることを示す。
検証者は、監督される前に、画像の根拠付けと正解のための全ての生成された質問をスクリーニングし、画像に対するソルバーの推論をスコアし、基準回答と強いソルバーのコンセンサスの間の紛争を判断し、コンセンサスが正しいときに基準を修正し、質問者を罰する。
画像だけで訓練されたトリニティは、Qwen3-VL-8Bを数学的視覚的推論や生物学的内容を持つ科学ベンチマークで改善し、例えば、+8.6ポイントはMathVerseのSciVQRと+12.8の生物学分割であり、報酬力学は健全なセルフプレイカリキュラムとして振る舞う。
これらの結果から、自己進化型マルチモーダルエージェントは、未ラベルの科学画像のみから科学的推論を強化し、モデル自体がバリデータとして機能することを示唆している。
関連論文リスト
- Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula [0.0]
自己進化的推論フレームワークは、チャレンジャーに、解決者の弱点を明らかにする質問を生成するように訓練する。
既存のアプローチでは、チャレンジャーの報酬として1つのソルバのサンプリングの不確実性を用いる。
モデル容量とサンプリング温度に異なる異種アンサンブルを用いたマルチソルバ不一致報酬を提案する。
論文 参考訳(メタデータ) (2026-08-30T20:49:16Z) - LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning [6.241883798820154]
モデル間コンセンサス(モデル間コンセンサス)について検討し、独立に訓練されたモデル(各モデルが一度解ける程度)が最終解に一致するかを検討した。
パネルをLCM判定として扱い、合意の構造は、他のモデルのスコアではなく、検証信号である。
3つのパネル統計値から平均絶対誤差0.03$までのコンセンサス精度を予測する。
論文 参考訳(メタデータ) (2026-07-11T05:57:54Z) - Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards [52.42920996842378]
視覚的理解と画像生成の両方をサポートするほとんどの統合された大型マルチモーダルモデル(LMM)は、訓練後の監督に頼っている。
本稿では,3つの内部的役割を持つ自己進化型トレーニングフレームワークを提案する。 視覚的質問を生成するプロポーラ, 回答と評価を行うソルバ, 画像を生成するジェネレータである。
画像生成のために,質問文の忠実度とサイクル一貫性キャプションを組み合わせたマルチスケール内部評価手法を設計する。
論文 参考訳(メタデータ) (2026-06-25T17:59:57Z) - Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning [48.14470449860784]
テスト時強化学習(TTRL)は、推論時に合成信号のみを使用してモデルを適応するためのラベルなしパラダイムを提供する。
簡単な直感に基づくフレームワークであるSelf-Harmonyを紹介します。
論文 参考訳(メタデータ) (2025-11-03T03:34:34Z) - DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning [11.952788515297913]
DeFactoは、正確な回答と忠実な推論を共同で実施する、反ファクト的推論フレームワークである。
本研究では,疑問関連証拠を自動的に局所化し,肯定的,反実的,ランダムな変種を構成するパイプラインを開発する。
多様なベンチマークの実験では、DeFactoは回答の正確さと忠実性の推論の両方を大幅に改善している。
論文 参考訳(メタデータ) (2025-09-25T08:58:10Z) - Self-Questioning Language Models [58.73276539661649]
本稿では,提案者がトピックを与えられ,解答者に対する質問を生成する非対称なセルフプレイフレームワークを提案する。
提案者と解答者はともに強化学習を通じて訓練される。
3桁の乗算、OMEGAベンチマークの代数問題、Codeforcesのプログラミング問題である。
論文 参考訳(メタデータ) (2025-08-05T17:51:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。