論文の概要: Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors
- arxiv url: http://arxiv.org/abs/2608.12746v2
- Date: Tue, 18 Aug 2026 05:51:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.796337
- Title: Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors
- Title(参考訳): 二重ストリーム型クロスアンカー補正接地長形キャプションとオブジェクトレベルアンカーの領域限界
- Authors: Lingkai Bu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Jinyi Liang,
- Abstract要約: 本稿では,Dual-Stream Cross-Anchor Correction (DSCC)を提案する。
後処理の復号処理とは異なり、DSCCは微調整中にオブジェクトレベルの視覚アンカーを言語モデル自体に注入する。
実験は長いカプセル化幻覚、オブジェクト存在差別、ドメイン間の一般化にまたがる。
- 参考スコア(独自算出の注目度): 7.318959551227079
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Object hallucination in multimodal large language models arises when language priors and corpus co-occurrence bias outweigh the visual evidence, with nothing tying an object mention to the image. Most remedies intervene at decoding time, yet under a unified protocol their benefit is confined to short captions; supervised fine-tuning (SFT) on a detail-rich corpus lengthens captions, but over forty percent still name absent objects. This paper proposes Dual-Stream Cross-Anchor Correction (DSCC). Unlike work that post-processes decoding, DSCC injects object-level visual anchors into the language model itself during fine-tuning: a perception stream aligns object-level hidden states at an intermediate layer to frozen text anchors by a bidirectional contrastive objective; a cognition stream lets deeper layers query those anchors by cross-attention at every generation step; and a two-stage curriculum gate couples them, making evidence retrieval a structural constraint on generation. Under one backbone and one scoring protocol, experiments span long-caption hallucination, object-existence discrimination and cross-domain generalisation, with vanilla SFT on the same corpus and schedule as a length- and density-matched control separating the data effect from the architectural gain. DSCC alone reaches the long-caption, low-hallucination region: captions roughly 1.9 times the baseline length at 88.19% precision per object mention, the highest under a density-independent criterion. Ablations expose a synergy: the perception stream alone degrades precision yet reverses sign when stacked on the cognition stream. No universal superiority is claimed: three out-of-domain benchmarks yield a predictable, falsifiable domain-conditionality, the synergy being bound to the anchors' semantic domain and breaking on charts and illusions.
- Abstract(参考訳): マルチモーダルな大言語モデルにおける物体幻覚は、言語先行とコーパス共起バイアスが視覚的証拠よりも優れており、画像に言及する物体とは何の関係もない。
ほとんどの治療法はデコード時に介入するが、統一されたプロトコルの下では、それらの利点は短いキャプションに限られる。
本稿では,Dual-Stream Cross-Anchor Correction (DSCC)を提案する。
認識ストリームは、中間層におけるオブジェクトレベルの隠れた状態を、双方向のコントラスト目的によって凍結されたテキストアンカーに整列させ、認識ストリームは、各世代毎に相互注意によって、より深い層がそれらのアンカーをクエリし、2段階のカリキュラムゲートはそれらを結合させ、エビデンスを生成上の構造的制約として評価する。
1つのバックボーンと1つのスコアリングプロトコルの下では、実験は長いカプセルの幻覚、オブジェクト存在の識別、ドメイン間の一般化にまたがっており、バニラSFTは同一のコーパス上にいて、アーキテクチャ上の利得からデータ効果を分離する長さと密度にマッチした制御としてスケジュールされる。
DSCC単独では、長大で低ハロゲン化領域に到達しており、基準線長の約1.9倍の88.19%の精度で、密度に依存しない基準の下では最高である。
知覚ストリームだけは精度を低下させるが、認識ストリームに積み重ねると符号を逆転させる。
普遍的な優位性は主張されていない: 3つのドメイン外のベンチマークは予測可能で偽りやすいドメイン条件をもたらし、シナジーはアンカーのセマンティックドメインに束縛され、チャートとイリュージョンを破る。
関連論文リスト
- A Dynamic-Semantics Framework for Grounding Human Referring Expressions in Visual Perceptual Data [0.0]
本稿では,パクト状態を3つの明示的で検査可能な参照オブジェクトバインディングに外部化するフレームワークを提案する。
スタンフォード・リピート・レファレンス・ゲーム・コーパス(Stanford Repeated Reference Game corpus)のフレームワークについて検討した。
論文 参考訳(メタデータ) (2026-08-09T12:14:10Z) - Beyond Static Anchors: Bounded Prototype Conditioning for Language-Free Medical Anomaly Detection [52.986874008247554]
本稿では,静的アンカーを入力条件付きビジュアルプロトタイプに置き換える言語フリーフレームワークReCAPを提案する。
ReCAPリセンターは、境界ゲート変調により、各画像の正常と異常なプロトタイプを分離した。
3つのセグメンテーションデータセットで最高のゼロショットレベルのAUROCと、24の複数ショット設定のうち23のゼロショットレベルのAUROCを達成する。
論文 参考訳(メタデータ) (2026-08-01T04:46:55Z) - Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization [69.67186845167568]
Open-vocabulary Audio-visual Event Localization (OV-AVEL) は、音声と視覚のキューを共同でモデル化し、イベントを認識および時間的にローカライズする。
既存の手法は主にユークリッド空間における共同視覚表現を学習する。
音声・視覚イベントの局所化のための階層的セマンティック制約ヘテロジニアスグラフ(HSCHG)を提案する。
論文 参考訳(メタデータ) (2026-06-05T08:23:58Z) - Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models [52.78477729846771]
本稿では,COAST(Contrastive Adaptive Semantic Token Pruning)について紹介する。
COASTはトークン予算をまたいだ強力なプルーニングベースラインを一貫して上回り、複数のLVLMファミリをまたいだ一般化を実現している。
論文 参考訳(メタデータ) (2026-05-10T09:07:04Z) - STAND: Semantic Anchoring Constraint with Dual-Granularity Disambiguation for Remote Sensing Image Change Captioning [23.80607349547519]
リモートセンシング画像変化キャプション(RSICC)は,2つのリモートセンシング画像の違いを説明することを目的としている。
近年、ビデオモデリングの手法が検討されているが、視点、スケール、事前知識の内在する曖昧さを概ね見落としている。
我々は,これらの曖昧さを段階的に解決するために,RSICCのための意味的アンチョリング制約であるSTANDを提案する。
論文 参考訳(メタデータ) (2026-04-25T13:50:11Z) - Explaining, Verifying, and Aligning Semantic Hierarchies in Vision-Language Model Embeddings [10.299190830046872]
本稿では,VLMによって誘発されるセマンティック階層を,特定の子クラスに対して説明し,検証し,調整するためのポストホックフレームワークを提案する。
我々は,効率的な木認識とエッジレベルの整合性尺度を用いて,抽出した木と人間の検索を比較して妥当性を定量化し,説明可能な階層木トラバース推定による有用性を評価する。
論文 参考訳(メタデータ) (2026-03-26T00:38:38Z) - HGNet: Scalable Foundation Model for Automated Knowledge Graph Generation from Scientific Literature [6.001574550157585]
本稿では,スケーラブルでゼロショットの科学知識グラフ構築のための2段階フレームワークを提案する。
階層的関係抽出のためのベンチマークSPHEREをリリースする。
ゼロショット設定では、NERが10.76%、REが26.2%に達する。
論文 参考訳(メタデータ) (2026-03-24T12:35:10Z) - Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech [51.14752758616364]
音声による抑うつ検出 (SDD) は、従来の臨床評価に代わる有望で非侵襲的な代替手段である。
HAREN-CTCは,マルチタスク学習フレームワーク内でのクロスアテンションを用いて,多層SSL機能を統合した新しいアーキテクチャである。
このモデルはDAIC-WOZで0.81、MODMAで0.82の最先端マクロF1スコアを達成し、両方の評価シナリオで先行手法より優れている。
論文 参考訳(メタデータ) (2025-10-05T09:32:12Z) - Bridging the Gap between Object and Image-level Representations for
Open-Vocabulary Detection [54.96069171726668]
オープンボキャブラリ検出(OVD)で使用される2種類の弱いスーパービジョンには、事前訓練されたCLIPモデルと画像レベルの監視が含まれる。
本稿では,CLIPモデルから言語埋め込みをオブジェクト中心でアライメントすることでこの問題に対処することを提案する。
上記の2つの対物配向戦略の橋渡しを,新しい重み伝達関数を用いて行う。
論文 参考訳(メタデータ) (2022-07-07T17:59:56Z) - Language-Bridged Spatial-Temporal Interaction for Referring Video Object
Segmentation [28.472006665544033]
ビデオオブジェクトセグメンテーションの参照は、ビデオ内の自然言語表現によって参照されるオブジェクトのフォアグラウンドラベルを予測することを目的としている。
従来の手法は3D ConvNetsに依存するか、さらに2D ConvNetsをエンコーダとして組み込んで、複雑な時空間の特徴を抽出する。
本稿では,言語を中間ブリッジとして利用するLBDT(Language-Bridged Duplex Transfer)モジュールを提案する。
論文 参考訳(メタデータ) (2022-06-08T10:12:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。