論文の概要: Tactus: Open-Vocabulary Object Recognition from Low-Cost Pressure Arrays
- arxiv url: http://arxiv.org/abs/2608.04043v1
- Date: Tue, 04 Aug 2026 06:08:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.401108
- Title: Tactus: Open-Vocabulary Object Recognition from Low-Cost Pressure Arrays
- Title(参考訳): Tactus: 低コスト圧力アレイによる開語彙物体認識
- Authors: Abdul Basit Tonmoy,
- Abstract要約: 圧力データのみからテキストクエリに回答するオープンモデルであるTactusを提示する。
187のトレーニング記録、144kの未ラベルの同センサーフレームで事前トレーニングされたマスク付きオートエンコーダ、センサー独自のキャリブレーションアフィン。
重み、コード、モデルがプラグインするメモリ層は、オープンにリリースされる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Resistive pressure arrays are the cheapest and most widely shipped tactile sensors, yet tactile representation learning has concentrated on optical sensors that image a deforming gel. We present Tactus, an open model that answers text queries from pressure data alone: on the STAG benchmark (27 objects, held-out recordings), it reaches 0.771 +/- 0.062 top-1 over four runs (top-3 0.935), matching, and at best exceeding, the dataset's supervised closed-set CNN at 0.76, with no trained classifier head. The recipe is small-data: 187 training recordings, masked-autoencoder pretraining on 144k unlabeled same-sensor frames, and the sensor's own calibration affine, which recovered more accuracy than every architecture change combined. The released model's errors concentrate in a few contact-ambiguous classes, are uncorrelated with text-target geometry (Spearman rho <= 0.05 over 702 class pairs), and survive paraphrased and even bare-name queries within one point; two diverse frames recover 89% of eight-frame accuracy. Failures are reported with equal precision: cross-sensor pretraining pooling gave no gain, vision co-training degraded touch, and a mis-normalized input pipeline silently discarded 97% of the sensor's dynamic range while producing plausible intermediate results. Weights, code, and the memory layer the model plugs into are released openly.
- Abstract(参考訳): 抵抗圧アレイは、最も安価で最も広く出荷されている触覚センサーであるが、触覚表現学習は、変形するゲルをイメージする光学センサーに集中している。
STAGベンチマーク(27のオブジェクト、保留記録)では、4回のラン(トップ-3 0.935)で0.771 +/- 0.062のトップ-1に到達し、マッチし、最大で言えば、データセットの教師付きクローズドセットCNNは0.76で、訓練されたクラシファイアヘッドが存在しない。
187のトレーニング記録、144kの未ラベルの同センサーフレームで事前訓練されたマスク付きオートエンコーダ、センサーのキャリブレーションアフィン。
リリースされたモデルのエラーはいくつかの接触あいまいなクラスに集中しており、テキストターゲット幾何学とは無関係である(Spearman rho <= 0.05 over 702 class pairs)。
クロスセンサー・プレトレーニング・プールは利得を得られず、視覚的コトレーニング・デグレード・タッチと誤正常な入力パイプラインは、もっともらしい中間結果を生み出しながら、センサーのダイナミックレンジの97%を静かに破棄した。
重み、コード、モデルがプラグインするメモリ層は、オープンにリリースされる。
関連論文リスト
- A Model-Based Decoupling Strategy for Proprioception and Contact Sensing in an Architected Soft Manipulator [49.225033144914214]
軟構造セグメントに埋め込まれた流体圧センサから, 受容・接触信号を分離するモデルベース戦略を提案する。
単一ITHセグメントでは, 相対曲げ誤差0.11+/-0.02, 接触検出率97%で, 主観的形状推定が可能である。
論文 参考訳(メタデータ) (2026-07-17T03:03:19Z) - A Masked Autoencoder Approach to Unsupervised Steel Surface Defect Recognition [0.0]
トランスフォーマーをベースとしたMasked Autoencoderを用いて,非教師なしグループ化のための鋼表面欠陥の表現を学習する。
デコーダは構造的類似点0.92、平均2乗誤差0.47に達する。
論文 参考訳(メタデータ) (2026-07-14T18:26:36Z) - OctoSense: Self-Supervised Learning for Multimodal Robot Perception [50.20346079739425]
ステレオカメラとイベントカメラ、LiDAR、サーマルカメラ、慣性測定ユニット、プロプリセプション(車からのCANバスデータ、四足歩行ロボットの関節角度)を備えたオープンソースのセンサプラットフォームであるOctoSenseについて述べる。
匿名のOctoSenseデータセットには、59時間の時間同期駆動データが含まれている。
このような実世界のデータを用いて,センサの表現,周波数,レイテンシ,ノイズの異なるマルチモーダル自己教師型学習を実演する。
論文 参考訳(メタデータ) (2026-06-25T17:30:49Z) - TacVerse: A Multi-Sensor Dataset and Benchmark for Cross-Sensor Vision-Based Tactile Perception [7.968185063285978]
マルチセンサー・データセットと、クロスセンサー・ビジョンに基づく触覚知覚のためのベンチマークであるTacVerseを提案する。
データセットには、7つの視覚ベースの触覚センサーから106,800枚の触覚イメージが含まれている。
全てのタスクに対して強いセンサー内性能は、収集された触覚観察が対象の目的に対して有益であることを示している。
論文 参考訳(メタデータ) (2026-06-24T14:22:48Z) - iSAGE: A Human-in-the-Loop Framework for Remote Sensing Semantic Segmentation via Sparse Point Supervision [0.1749935196721634]
既存のHuman-in-the-loopフレームワークは、余分なクリックを補助機械を介して密集した監視に拡張する。
本稿では, 任意の画素ではなく, 信頼度の高いモデル誤差をターゲットとした, 専門家によるクリックが, 厳密な監督と一致させるのに十分である,という仮説を立てる。
iSAGEは補助機械を使わずに動作する唯一の反復型人間-イン-ザ-ループフレームワークである。
論文 参考訳(メタデータ) (2026-06-08T20:09:35Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Symbolic Augmentation Closes a Canonical-Equivalence Blind Spot in Neural Fact-Checkers [1.7844382164707184]
我々は,5種類の型付き誤り分類と1500石のベンチマークを導入する。
このベンチマークで微調整されたModernBERTエンコーダはマクロF1 = 0.899に達する。
本稿では,ラベル保存型強化トレーニングデータを生成するために,シンボル検証器のモジュールを逆向きに動作させる訓練時フレームワークであるSybolic Augmentationを提案する。
論文 参考訳(メタデータ) (2026-05-19T15:58:00Z) - Design and Validation of a Lightweight 1D CNN for Affective Touch Classification in Soft Plush Companions [59.49967357689445]
ソフトなセンサー付きコンパニオンは、社会的支援技術のための物理的に安全で感情的に直感的なインターフェースを提供する。
本研究では,ソフト・インタラクティブ・コンパニオンにおける感情的触覚認識のためのディープラーニングモデルの開発と検証を目的とした,オープンソースで拡張されたリアルタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-16T10:20:05Z) - No Dense Tensors Needed: Fully Sparse Object Detection on Event-Camera Voxel Grids [0.3823356975862005]
イベントカメラは、小型で高速で動くドローンを検出するのに適した、非同期で高ダイナミックなストリームを生成する。
ほとんどの事象ベースの検出器はスパース事象ストリームを密度の高いテンソルに変換し、ニューロモルフィックセンシングの表現効率を放棄する。
SparseVoxelDetは,バックボーンの特徴抽出,ピラミッド融合,検出ヘッドがすべて占有されたボクセル位置のみで動作する,イベントカメラ用初の完全スパース物体検出器である。
論文 参考訳(メタデータ) (2026-03-23T07:12:14Z) - Camouflage is all you need: Evaluating and Enhancing Language Model
Robustness Against Camouflage Adversarial Attacks [53.87300498478744]
自然言語処理(NLP)における敵攻撃の意義
本研究は、脆弱性評価とレジリエンス向上という2つの異なる段階において、この課題を体系的に探求する。
結果として、パフォーマンスとロバスト性の間のトレードオフが示唆され、いくつかのモデルは、ロバスト性を確保しながら、同様のパフォーマンスを維持している。
論文 参考訳(メタデータ) (2024-02-15T10:58:22Z) - Deep Soft Procrustes for Markerless Volumetric Sensor Alignment [81.13055566952221]
本研究では、より堅牢なマルチセンサ空間アライメントを実現するために、マーカーレスデータ駆動対応推定を改善する。
我々は、幾何学的制約を終末的に典型的なセグメンテーションベースモデルに組み込み、対象のポーズ推定タスクと中間密な分類タスクをブリッジする。
実験により,マーカーベースの手法で同様の結果が得られ,マーカーレス手法よりも優れ,またキャリブレーション構造のポーズ変動にも頑健であることがわかった。
論文 参考訳(メタデータ) (2020-03-23T10:51:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。