論文の概要: RelateAnything: Real-Time Open-Vocabulary Relation Prediction From Any Inputs
- arxiv url: http://arxiv.org/abs/2609.12552v1
- Date: Fri, 11 Sep 2026 07:57:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.674077
- Title: RelateAnything: Real-Time Open-Vocabulary Relation Prediction From Any Inputs
- Title(参考訳): RelateAnything:任意の入力からのリアルタイムオープン語彙関係予測
- Abstract要約: RelateAnythingは、任意のソースからイメージとリージョンを取得し、文字列として推論時に供給される述語語彙に関するスコア付き関係を返す。
19,103以上の述語を訓練するには、正のラベルなしの監督と、アントロニムを分離するテキストエンコーダが必要である。
3つのクロスデータセットのベンチマークと4番目のゼロショットでは、RelateAnythingは2.3-3.5倍の最大規模のオープンボキャブラリメソッドをリコールする。
- 参考スコア(独自算出の注目度): 0.40611352512781873
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Open-vocabulary detection accepts any class list at inference, and promptable segmentation returns regions without class names: the taxonomy has left the model and become an input. Relation prediction has not. Scene-graph models are still trained and evaluated on the 50 or 56 predicates of one annotation style, their relation head conditioned on object labels and so tied to one detector. Three obstacles explain this, none primarily modelling: no relation corpus is both free-text and verified, a label-conditioned architecture cannot accept a vocabulary it was not trained on, and the standard metric rewards agreement with the training corpus, so a larger vocabulary scores as a regression. We present RelateAnything, a 53M-parameter model taking an image and regions from any source and returning scored relations over a predicate vocabulary supplied at inference as strings. Object labels are never an input, so the region source can change without retraining, and the vocabulary is a bank of text embeddings, not a learned classifier. It runs at 20 ms/frame. Training over 19,103 predicates requires positive-unlabeled supervision and a text encoder that separates antonyms, which contrastive encoders embed at cosine 0.95. To supply the supervision we build RA-4M, 474k images and 4.3M relations over 10,102 free-text predicates, generated against numbered box markers and geometrically verified. To measure it we build OV-SGG-Bench, six axes scored across datasets that the priors standard recall rewards cannot satisfy. On three cross-dataset benchmarks and a fourth zero-shot, RelateAnything has 2.3-3.5x the mean recall of the strongest open-vocabulary method of comparable scale, margins that survive a real detector, and leads a 3B-VLM scene-graph model on both metrics at under 2% of its parameters. In-domain measurement overstates transfer gains ~5x. Model, corpus and benchmark are public.
- Abstract(参考訳): Open-vocabulary Detectionは推論時に任意のクラスリストを受け取り、クラス名を含まない領域を返す。
関係予測はしていない。
シーングラフモデルは、あるアノテーションスタイルの50または56の述語、それらの関係ヘッドをオブジェクトラベルに条件付けし、1つの検出器に結び付けるように訓練され、評価されている。
関係コーパスは自由テキストと検証の両方であり、ラベル条件付きアーキテクチャはトレーニングされていない語彙を受け入れることができず、標準メートル法はトレーニングコーパスと合意するので、より大きなボキャブラリは回帰として得点する。
提案するRelateAnythingは,任意のソースから画像と領域を抽出し,文字列として推論された述語語彙に関するスコア付き関係を返す53Mパラメータモデルである。
オブジェクトラベルは決して入力ではないため、リージョンソースは再トレーニングせずに変更可能であり、語彙は学習された分類子ではなく、テキスト埋め込みのバンクである。
動作速度は20ms/frame。
19,103以上の述語を訓練するには、正のラベルのない監督と、対照的なエンコーダがコサイン0.95に埋め込まれるアントロニムを分離するテキストエンコーダが必要である。
RA-4M,474k画像,4.3M関係を10,102自由テキスト述語上に構築し,ボックスマーカー数に対して生成し,幾何学的に検証した。
測定するために、OV-SGG-Benchを構築しました。
3つのクロスデータセットのベンチマークと4番目のゼロショットでは、RelateAnythingは2.3-3.5倍の大きさの最大開語彙法、実際の検出器を生き残るマージン、両方のパラメータの2%以下で3B-VLMシーングラフモデルを生成する。
ドメイン内測定オーバーステートの転送は5倍になる。
モデル、コーパス、ベンチマークが公開されている。
関連論文リスト
- Reification as a Transferable Vocabulary: Zero-Shot Link Prediction with Vanilla GNNs [0.033842793760651545]
ULTRAのような知識グラフ基盤モデルは、転送機構をハードコードする専用アーキテクチャを通じて、目に見えないグラフのゼロショットリンク予測を実現する。
この作業では、入力グラフを具現化することにより、そのメカニズムをアーキテクチャから表現に移します。
5つの教科書GNNは、1つのNVIDIA A100で4,245トリプルの知識グラフを30分間トレーニングし、ゼロショットを40のインダクティブリンク予測ベンチマークに転送する。
論文 参考訳(メタデータ) (2026-09-10T10:26:09Z) - Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention [0.0]
我々は, 事前学習をせずに, 450-700Kパラメータの分類に基づく強いベースラインと, バイトレベルのアテンションフリーアーキテクチャを一致させることができることを示した。
我々は「テキストのように読む」ための非パラメトリックなゲーム抵抗楽器FORM DISTANCEを紹介する。
また,4つのアーキテクチャ追加が役に立たないことを報告し,その5分の1のパラメータで,学習テーブルのトップ1の精度の94%に達する計算辞書を作成した。
論文 参考訳(メタデータ) (2026-08-05T10:44:26Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - RelWitness: Open-Vocabulary 3D Scene Graph Generation with Visual-Geometric Relation Witnesses [1.3468350096927395]
不完全な関係管理の下で提案したRGB-Dシークエンスからオープン語彙の3Dシーングラフを生成するフレームワークを提案する。
重要なコンセプトは関係の証人であり、キャプチャーされたシーンで関係を観察できる具体的な視覚幾何学的キューである。
RelWitnessはRGBビュー、深度マップ、再構成された3D幾何、ロールセンシティブなテキスト、オブジェクト-プリアヌルビュー、マルチビュー一貫性から関係証記録を構築する。
論文 参考訳(メタデータ) (2026-05-20T07:18:56Z) - DataDignity: Training Data Attribution for Large Language Models [8.195274857647782]
我々は3,537個のウィキペディア風記事のベンチマークであるFakeWikiを紹介した。
FakeWikiにはQAプローブ、ソース保存のパラフレーズ、レトロ生成の変種、解答クリティカルな事実を取り除きながら、極端に類似した硬いアンチドキュメントが含まれている。
我々は,7つの検索ベースライン,トレーニング不要なアクティベーション・ステアリング・検索・フュージョン法,SteerFuse,および教師付きコントラスト・プロファイランス・ローダであるScoringModelを評価した。
論文 参考訳(メタデータ) (2026-05-07T05:27:45Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z) - Paloma: A Benchmark for Evaluating Language Model Fit [112.481957296585]
言語モデル (LM) の評価では、トレーニングから切り離されたモノリシックなデータに難易度が報告されるのが一般的である。
Paloma(Perplexity Analysis for Language Model Assessment)は、546の英語およびコードドメインに適合するLMを測定するベンチマークである。
論文 参考訳(メタデータ) (2023-12-16T19:12:45Z) - Telling Left from Right: Identifying Geometry-Aware Semantic Correspondence [80.6840060272386]
本稿では,意味的対応のための幾何学的認識の重要性を明らかにする。
この情報を活用することで,意味的対応性能が著しく向上することを示す。
提案手法は,SPair-71kデータセット上で,65.4(ゼロショット)と85.6(教師)のPCK@0.10スコアを達成する。
論文 参考訳(メタデータ) (2023-11-28T18:45:13Z) - Retrieval-based Disentangled Representation Learning with Natural
Language Supervision [61.75109410513864]
本稿では,VDR(Vocabulary Disentangled Retrieval)を提案する。
提案手法では,両エンコーダモデルを用いて語彙空間におけるデータと自然言語の両方を表現する。
論文 参考訳(メタデータ) (2022-12-15T10:20:42Z) - Quark: Controllable Text Generation with Reinforced Unlearning [68.07749519374089]
大規模言語モデルは、しばしばユーザの期待に合わない振る舞いを学ぶ。
本稿では,(不必要な)特性を定量化する報酬関数を最適化するアルゴリズムQuarkを紹介する。
未学習の毒性、ネガティブな感情、反復について、我々の実験はQuarkが強いベースラインと最先端の強化学習法の両方より優れていることを示している。
論文 参考訳(メタデータ) (2022-05-26T21:11:51Z) - Fast and Robust Unsupervised Contextual Biasing for Speech Recognition [16.557586847398778]
明示的な文脈言語モデルを必要としない代替手法を提案する。
学習コーパスからシステム語彙の各単語に対するバイアススコアを導出する。
関連するコンテキストが利用できる場合,認識精度が大幅に向上することを示す。
論文 参考訳(メタデータ) (2020-05-04T17:29:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。