論文の概要: jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
- arxiv url: http://arxiv.org/abs/2607.18152v1
- Date: Mon, 20 Jul 2026 16:50:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.712866
- Title: jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
- Title(参考訳): jina-reranker-v3.5:ハイブリッド・アテンションと自己蒸留を併用した効率的なリスワイズ・リランカ
- Abstract要約: 半構造化データに対して,ドメインの堅牢性とフラレンシを備えたリストワイズリランカであるjina-reranker-v3.5を提案する。
法的、医療的、財政的、多言語的、構造化された検索にまたがる、キュレートされた多ドメインの混合物を訓練する。
最大の利益は半構造化検索であり、jina-reranker-v3上でnDCG@10を9.6ポイント上げ、同じ大きさのリランカーを導く。
- 参考スコア(独自算出の注目度): 5.931836950993702
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Listwise rerankers are the discriminative core of agentic retrieval pipelines, yet production deployment demands efficiency, domain robustness, and fluency on semi-structured data at the same time. We present jina-reranker-v3.5, a 0.6B-parameter listwise reranker that meets these demands together without sacrificing the cross-document comparison that makes its predecessor jina-reranker-v3 effective. jina-reranker-v3.5 keeps the last-but-not-late (LBNL) interaction of jina-reranker-v3 and reworks it along three axes. It replaces uniform global attention with a hybrid schedule of three sliding-window layers followed by two global layers, pinning the terminal layer to global as LBNL readout requires. It trains on a curated multi-domain mixture that spans legal, medical, financial, multilingual, and structured retrieval. It transfers quality through a three-stage self-distillation recipe in which a full-attention teacher sets an upper bound that a sparse-attention student then recovers under a staged adaptation protocol. jina-reranker-v3.5 reaches 63.20 nDCG@10 on BEIR, matching a 4B model at roughly 7x fewer parameters, and improves over jina-reranker-v3 on MIRACL and RTEB as well. Its largest gains come on semi-structured retrieval, where it lifts nDCG@10 by 9.6 points over jina-reranker-v3 and leads all rerankers of comparable size. The hybrid schedule further cuts listwise inference latency by up to 1.56x. We release the model weights on Hugging Face under a non-commercial license.
- Abstract(参考訳): リストワイズリランカはエージェント検索パイプラインの差別的なコアだが、運用には効率性、ドメインの堅牢性、半構造化データへの流布が同時に必要である。
提案するjina-reranker-v3.5は、従来のjina-reranker-v3を有効にするクロスドキュメント比較を犠牲にすることなく、これらの要求を満たす0.6Bパラメータリストワイドリランカである。
jina-reranker-v3.5は、jina-reranker-v3のLBNL相互作用を保持し、3つの軸に沿って再加工する。
均一なグローバルアテンションを3つのスライディングウインドウ層と2つのグローバルレイヤのハイブリッドスケジュールに置き換え、LBNLの読み出しに必要な終端層をグローバルにピン留めする。
法的、医療的、財政的、多言語的、構造化された検索にまたがる、キュレートされた多ドメインの混合物を訓練する。
フルアテンションの教師がスパースアテンションの学生に上限を設定し、ステージ化された適応プロトコルの下で回復する3段階の自己蒸留レシピを通じて品質を伝達する。
jina-reranker-v3.5 は BEIR で 63.20 nDCG@10 に達し、4B モデルを約7倍のパラメータでマッチングし、MIRACL と RTEB で jina-reranker-v3 よりも改善する。
最大の利益は半構造化検索であり、jina-reranker-v3上でnDCG@10を9.6ポイント上げ、同じ大きさのリランカーを導く。
ハイブリッドスケジュールはさらに、リストワイズ推論のレイテンシを最大1.56倍に削減する。
私たちはHugging Faceのモデルウェイトを非商用ライセンスでリリースします。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees [10.936836651826722]
HARTS (Hybrid-Attention RL over Tree Structures) について述べる。
HarTSは、実際のハイブリッドアテンションモデル上で任意のロールアウトツリープレフィックス共有スピードアップを示す最初のシステムである。
論文 参考訳(メタデータ) (2026-08-28T10:18:54Z) - Empowering Compact LLMs with Fusion of Layer-wise Exits for Recommendation [59.216721553953]
大規模言語モデルベースレコメンデータシステム(LLM-RS)は目覚ましい能力を示しているが、現実の多くのアプリケーションでは計算的に持続不可能である。
本稿では,スケーラブルなフルコーパスランキングを維持しつつ,コンパクトなLLMを向上する識別フレームワークを提案する。
Qwen 3 1.7BとLlama 3.2 3Bの3つの実世界のデータセットの実験では、FLEXRecは高い効率を維持しながら最先端の精度を達成している。
論文 参考訳(メタデータ) (2026-08-18T03:14:28Z) - Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers [54.01042826416009]
ビジュアル生成には高解像度の画像、長いビデオ、マルチモーダルコンテキストが必要である。
原理的なスケーリングレシピを備えたハイブリッドビジュアル拡散バックボーンであるChimeraを紹介した。
密度の高いバックボーンは、一致したフルアテンションWan2.1 2Bベースラインの1.7倍の計算効率を示す。
論文 参考訳(メタデータ) (2026-07-30T17:58:02Z) - Querit-Reranker: Training Compact Multilingual Rerankers via Efficient Label-Free Distribution Adaptation [43.66118282567413]
データ中心のパイプラインでトレーニングされた多言語クロスエンコーダリランカのファミリーであるQuarit-Rerankerを紹介します。
我々のパイプラインはまず、大規模ランキング指向データから一般的な関連性モデリングを学び、次にターゲット分布に適応する。
Querit-Reranker-A0.4B 平均 nDCG@10 は BEIR では 54.11 から 59.28 に、MIRACL では 59.87 から 67.70 に改善されている。
論文 参考訳(メタデータ) (2026-06-17T13:06:47Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - Good Agentic Friends Do Not Just Give Verbal Advice: They Can Update Your Weights [58.27172968382275]
マルチエージェントLLMシステムは、通常自然言語メッセージを交換することで協調する。
送信者のメッセージを受信者のコンテキストに付加する代わりに、送信者の隠された状態を過渡的で受信者固有の重み摂動にコンパイルする。
論文 参考訳(メタデータ) (2026-05-13T17:58:32Z) - ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference [12.04455190856202]
ProxyKVはクロスモデルプロキシプルーニングフレームワークである。
軽量なファミリー内Small-Model Proxyにスコアをオフロードし、Large-Model Targetに非同期に実行する。
Llama-3.1-8B(Dual-GPU; $sim$1.5times$ shared single-GPU)で最大$3.21timesのプリフィルスピードアップを提供し、Qwen-2.5-7Bで最大170kのトークンでスピードアップを継続する。
論文 参考訳(メタデータ) (2026-05-09T13:18:01Z) - Where Should LoRA Go? Component-Type Placement in Hybrid Language Models [0.0]
2つのハイブリッドアーキテクチャにまたがるコンポーネント型LoRA配置について検討する。
注意経路は、トレーニング可能なパラメータを5~10倍少なくすることで、フルモデル適応を一貫して上回ります。
論文 参考訳(メタデータ) (2026-04-24T00:20:29Z) - Generalized Parallel Scaling with Interdependent Generations [58.43994876504917]
本稿では,相互依存応答を並列に生成するブリッジを提案する。
少数の新しいパラメータしか持たず、ブリッジは強化学習による相対平均精度の向上を図っている。
論文 参考訳(メタデータ) (2025-10-01T17:33:35Z) - jina-reranker-v3: Last but Not Late Interaction for Listwise Document Reranking [16.73571462259572]
jina-reranker-v3は0.6Bパラメータの多言語リストワイド・リランカである。
モデルは61.94 nDCG@10で最先端のBEIR性能を達成するが、同等の性能を持つ他のモデルよりも大幅に小さい。
論文 参考訳(メタデータ) (2025-09-29T17:23:54Z) - xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token [108.7069350303884]
xRAGは、検索拡張生成に適した、革新的なコンテキスト圧縮手法である。
xRAGは、言語モデル表現空間に文書の埋め込みをシームレスに統合する。
実験の結果、xRAGは6つの知識集約タスクで平均10%以上の改善を達成していることがわかった。
論文 参考訳(メタデータ) (2024-05-22T16:15:17Z) - HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM
Inference [68.59839755875252]
HiREは2つの新しいコンポーネントから構成される: (i) (i) (i) (i) (i) (i) (i) (i) (i) (i) (ii) DA-TOP-$k$: 効率的なマルチデバイス近似トップ-k$演算子) (i) (i) (i) (i) (i) (i) (i) DA-TOP-$k$演算子) 。
我々は、10億のパラメータモデルにおいて、HiREがソフトマックスとフィードフォワード層の両方に適用され、ほぼ一致した事前学習と下流の精度を実現し、1台のTPUv5eデバイスで1.47Times$の推論遅延を高速化することを示した。
論文 参考訳(メタデータ) (2024-02-14T18:04:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。