論文の概要: Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology
- arxiv url: http://arxiv.org/abs/2605.09152v1
- Date: Sat, 09 May 2026 20:30:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.089616
- Title: Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology
- Title(参考訳): Meow-Omni 1:猫のエソロジーのための多モーダル大言語モデル
- Abstract要約: 動物の意図を解読することは、計算倫理学における根本的な課題である。
Meow-Omni 1は、計算倫理のために開発された最初のオープンソースのクアッドモーダルMLLMである。
- 参考スコア(独自算出の注目度): 21.226533005288754
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deciphering animal intent is a fundamental challenge in computational ethology, largely because of semantic aliasing, the phenomenon where identical external signals (e.g., a cat's purr) correspond to radically different internal states depending on physiological context. Existing Multimodal Large Language Models (MLLMs) are blind to high-frequency biological time-series data, restricting them to superficial behavioural pattern matching rather than genuine latent-state reasoning. To bridge this gap, we introduce Meow-Omni 1, the first open-source, quad-modal MLLM purpose-built for computational ethology. It natively fuses video, audio, and physiological time-series streams with textual reasoning. Through targeted architectural adaptation, we integrate specialized scientific encoders into a unified backbone and formalize intent inference via physiologically grounded cross-modal alignment. Evaluated on MeowBench, a novel, expert-verified quad-modal benchmark, Meow-Omni 1 achieves state-of-the-art intent-recognition accuracy (71.16%), substantially outperforming leading vision-language and omni-modal baselines. We release the complete open-source pipeline including model weights, training framework, and the Meow-10K dataset, to establish a scalable paradigm for inter-species intent understanding and to advance foundation models toward real-world veterinary diagnostics and wildlife conservation.
- Abstract(参考訳): 動物の意図を解読することは、主にセマンティックエイリアス(英: semantic aliasing)、つまり同一の外部信号(例えば猫のプラー)が生理的文脈によって根本的に異なる内部状態に対応する現象である。
既存のMLLM(Multimodal Large Language Models)は、高頻度の生物学的時系列データに盲目であり、真の潜在状態推論ではなく、表面的な行動パターンマッチングに制限されている。
このギャップを埋めるために、計算倫理のために構築された最初のオープンソースのクアッドモーダルMLLMである Meow-Omni 1 を紹介する。
ビデオ、オーディオ、生理的時系列ストリームをテキストによる推論で融合させる。
目的とするアーキテクチャ適応を通じて,特殊な科学的エンコーダを統一されたバックボーンに統合し,生理的基盤を持つクロスモーダルアライメントを通じて意図推論を定式化する。
MeowBenchは、専門家が検証した新しいクアッドモーダルベンチマークであり、Meow-Omni 1は最先端の意図認識精度(71.16%)を達成する。
モデルウェイト、トレーニングフレームワーク、および Meow-10K データセットを含む完全なオープンソースパイプラインをリリースし、種間関係理解のためのスケーラブルなパラダイムを確立し、現実世界の獣医学診断と野生生物保護に向けた基礎モデルを前進させる。
関連論文リスト
- Speaking the Language of Science: Toward a General-Purpose Generative Foundation Model for the Natural Sciences [89.71422932447423]
LOGOSは、自然科学における異種タスクを統一する科学生成言語モデルである。
空間的接触パターンと制約パターンを離散トークンとして表現することにより、モデルは純粋にシーケンシャルな方法で複雑な構造的相互作用をキャプチャする。
多様なタスクにわたって、LOGOSは一貫してドメイン固有のベースラインにマッチまたは性能を向上する。
論文 参考訳(メタデータ) (2026-06-15T16:14:53Z) - MIRAGE: Adaptive Multimodal Gating for Whole-Brain fMRI Encoding [6.746244420038093]
MIRAGEは脳全体のfMRI応答を自然な聴覚刺激に予測するための脳符号化フレームワークである。
その結果、ネイティブなマルチモーダルな特徴は、独立なユニモーダルな特徴のポストホックアグリゲーションよりも一貫して優れていた。
論文 参考訳(メタデータ) (2026-05-28T12:30:51Z) - OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning [51.33849811496781]
大規模言語モデル (LLM) は例外的な論理的推論能力を示しているが、部分微分方程式 (PDE) による連続力学としばしば競合する。
OMNIFLOWは, 領域固有のパラメータ更新を必要とせず, 基本物理法則で凍結LDMを基底として設計したマルチモーダルシンボリックアーキテクチャである。
我々は, 微視的乱流, 理論的ナビエ・ストークス, マクロ的世界天気予報のベンチマークでこれを評価した。
論文 参考訳(メタデータ) (2026-03-16T18:29:01Z) - Beyond Language Modeling: An Exploration of Multimodal Pretraining [125.34714978184638]
我々は、制御されたオフスクラッチ事前学習実験を通して経験的明瞭度を提供する。
我々はトランスフュージョン・フレームワークを採用し、言語と視覚の拡散を次々に予測する。
我々は、MoEアーキテクチャが、言語によって要求される高いモデル容量を提供することにより、このスケーリング非対称性を調和させることを実証する。
論文 参考訳(メタデータ) (2026-03-03T18:58:00Z) - Physiologically Informed Deep Learning: A Multi-Scale Framework for Next-Generation PBPK Modeling [5.007023403094322]
メカニスティックリガーとデータ駆動の柔軟性を橋渡しするSciML(SciML)フレームワークを提案する。
1) 薬物動態予測をシーケンスモデリングタスクとして扱う基盤PBPK変換器,(2) 生理的制約付き拡散モデル(PCDM),(3) 生物学的に適合した仮想患者集団を合成するための物理インフォームドロスを用いた生成アプローチ,(3) ニューラルネットワークとニューラルネットワークを組み合わせたハイブリッドアーキテクチャであるニューラルアロメトリー,などを紹介する。
論文 参考訳(メタデータ) (2026-02-09T00:26:01Z) - Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs [85.69785384599827]
人間と物体の相互作用(Human-object Interaction、HOI)の検出は、人と物体のペアとそれらの相互作用を局在させることを目的としている。
既存のメソッドはクローズドワールドの仮定の下で動作し、タスクを未定義の小さな動詞集合上の分類問題として扱う。
本稿では,閉集合分類タスクから開語彙生成問題へのHOI検出を再構成する新しい生成推論・ステアブル知覚フレームワークGRASP-HOを提案する。
論文 参考訳(メタデータ) (2025-12-19T14:41:50Z) - DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation [1.1708207558288541]
DiffPose-Animalは,トップダウン動物ポーズ推定のための新しい拡散型フレームワークである。
従来の熱マップ回帰法とは異なり、DiffPose-Animal は拡散モデルの生成的枠組みの下でデノナイジング過程として推定する。
論文 参考訳(メタデータ) (2025-08-12T09:37:09Z) - CodeBrain: Towards Decoupled Interpretability and Multi-Scale Architecture for EEG Foundation Model [52.466542039411515]
EEGファウンデーションモデル(EFM)は、タスク固有のモデルのスケーラビリティ問題に対処するために登場した。
このギャップを埋めるために設計された2段階のEMFであるCodeBrainを紹介します。
第1段階では、異種時間・周波数の脳波信号を離散トークンに分解するTFDual-Tokenizerを導入する。
第2段階では、構造化されたグローバル畳み込みとスライディングウインドウの注意を結合したマルチスケールEEGSSMアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-06-10T17:20:39Z) - BriLLM: Brain-inspired Large Language Model [40.47939901030644]
BriLLMは、機械学習の基礎を再定義する、脳にインスパイアされた大きな言語モデルである。
BriLLMは2つの重要な神経認知原理を取り入れている。(1) 静的な意味マッピング、(2) トークンは皮質領域に類似した特定のノードにマッピングされ、(2) 脳活動で観察される電気生理学的情報ダイナミクスをシミュレートする動的信号伝達である。
このアーキテクチャは、自然なマルチモーダル互換性、ノードレベルでの完全なモデル解釈可能性、コンテキスト長の独立スケーリング、言語タスクのための脳に似た情報処理のグローバルなシミュレーションなど、複数の革新的なブレークスルーを可能にする。
論文 参考訳(メタデータ) (2025-03-14T11:08:30Z) - Benchmarking Large Language Models for Image Classification of Marine Mammals [4.274291455715579]
我々は65種類の海洋哺乳類の1,423種類の画像を用いたベンチマークデータセットを構築した。
各動物は、種レベルから中レベル、グループレベルまで、それぞれ異なるレベルに分類される。
我々はこれらの海洋哺乳動物を分類するためのいくつかのアプローチを評価する。
論文 参考訳(メタデータ) (2024-10-22T01:49:49Z) - Cetacean Translation Initiative: a roadmap to deciphering the
communication of sperm whales [97.41394631426678]
最近の研究では、非ヒト種における音響コミュニケーションを分析するための機械学習ツールの約束を示した。
マッコウクジラの大量生物音響データの収集と処理に必要な重要な要素について概説する。
開発された技術能力は、非人間コミュニケーションと動物行動研究を研究する幅広いコミュニティにおいて、クロス応用と進歩をもたらす可能性が高い。
論文 参考訳(メタデータ) (2021-04-17T18:39:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。