論文の概要: Toten: A Knowledge-Based System For Structure-Preserving Representation Of Physical Quantities And Technical Notation In Brazilian Portuguese
- arxiv url: http://arxiv.org/abs/2606.19626v2
- Date: Wed, 24 Jun 2026 13:29:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:29.952058
- Title: Toten: A Knowledge-Based System For Structure-Preserving Representation Of Physical Quantities And Technical Notation In Brazilian Portuguese
- Title(参考訳): Toten:ブラジルポルトガル語における物理量と技術的表記の構造保存のための知識ベースシステム
- Abstract要約: 技術的テキストを定量的に処理するAIパイプラインは、物理量、数、単位、記号表現が無傷である入力に依存する。
入力表現が各技術エンティティ全体を型付き単位として保存する知識ベースシステムTOTENを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI pipelines that reason quantitatively over technical text depend on input where physical quantities, numbers, units, and symbolic expressions arrive intact; when these entities fragment at tokenization, errors propagate downstream. Byte-Pair Encoding, optimized for vocabulary compression, is blind to such entities and fragments them into arbitrary subwords -- a problem aggravated in technical Brazilian Portuguese. We present TOTEN, a knowledge-based system whose input representation preserves each technical entity as a whole, typed unit: vocabulary is not derived statistically but classified declaratively under a formal ontology of engineering entities (OEE). The core is the triple <O, classify, {inst_tau}>: types, principles, and invariants; a classifier mapping raw text into typed regions; and instantiators yielding a self-descriptive representation. Integrity rests on deterministic coupling to three external authorities: Pint (dimensional), Unicode Character Database (typographic), and RSLP (Portuguese morphology). We evaluate four properties verifiable by construction -- atomicity, dimensional equivalence, typographic robustness, numerical reconstruction -- on an internal benchmark (EngQuant, N=800) and four Brazilian Portuguese external corpora (N=1771 eligible cases), and report detection recall. Against eight state-of-the-art baselines, TOTEN reaches unit atomicity in all contrasts and reconstruction of 0.775-0.904 externally vs. 0.627-0.703 for the best (Quantulum3); on EngQuant, 0.780 vs. 0.340. Differences are significant (McNemar, Holm-corrected). Spearman correlation between internal and external rankings confirms concurrent validity of the control benchmark. TOTEN shows statistical parity with Pint in dimensional equivalence. The result is a structurally faithful, auditable, low-cost input layer for intelligent systems on technical knowledge, without generative models.
- Abstract(参考訳): 技術的テキストを定量的に処理するAIパイプラインは、物理量、数、単位、記号表現が無傷である入力に依存する。
語彙圧縮に最適化されたByte-Pair Encodingは、このようなエンティティに盲目であり、任意のサブワードにフラグメントする。
入力表現が各技術エンティティ全体を型付き単位として保存する知識ベースシステムであるTOTENについて述べる。
コアは、3つの<O, classify, {inst_tau}>: type, principles, and invariants, a classifier, a raw text mapping to typed region, and instantiator yield a self-descriptive representation。
積分性は、ピント(次元)、Unicode文字データベース(タイポグラフィ)、RSLP(ポルトガル語形態学)の3つの外部当局との決定論的結合に依存している。
内部ベンチマーク (EngQuant, N=800) とブラジルの4つの外部コーパス (N=1771例) を用いて, 構築により検証可能な4つの特性(原子性, 次元等価性, タイポグラフィロバスト性, 数値再構成)を評価し, レポート検出のリコールを行った。
最先端の8つのベースラインに対して、TOTENは全てのコントラストにおいて単位原子性に達し、外部では0.775-0.904、外部では0.627-0.703、EngQuantでは0.780、0.340となっている。
違いは大きい(McNemar, Holm-corrected)。
内部ランクと外部ランクのスピアマン相関は、制御ベンチマークの同時妥当性を確認する。
TOTENは次元同値性においてピントと統計的に同値である。
その結果は、構造的に忠実で監査可能で低コストで、生成モデルなしで、技術的知識に基づくインテリジェントなシステムのための入力層となる。
関連論文リスト
- Does Syntax Matter? A Graph-Augmented Variational Topic Model for Computational Social Sciences [51.56484100374058]
本稿では、構文依存関係をトピック推論に組み込んだアーキテクチャである、構造的文脈確率的トピックモデル(SCPTM)を紹介する。
本研究では,レジスタ構造と談話構造が異なる4つのコーパスのトピックモデリング手法について検討した。
その結果, SCPTMのニューラルアーキテクチャは, 生成的ベースラインよりも文書・トピックアライメントが著しく向上していることが示唆された。
論文 参考訳(メタデータ) (2026-09-07T17:39:06Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision [8.253092044813593]
テキストガイド型異常検出(TGAD)は,3つのシナリオにまたがる言語機能の役割を段階的に向上させる構造化ベンチマークである。
提案手法は, 大規模視覚言語, 学習自由識別, 組込み適応識別の1つの代表的なモデルである。
論文 参考訳(メタデータ) (2026-06-01T09:50:30Z) - CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context [8.678622777553267]
CAPITUは、ブラジルポルトガル語でLLM(Large Language Models)の命令追従能力を評価するためのベンチマークである。
ベンチマークは59の命令タイプを7つのカテゴリに分類し、すべて自動的に検証できるように設計されている。
シングルターンおよびマルチターン設定における18の最先端モデルを評価する。
論文 参考訳(メタデータ) (2026-03-23T21:16:54Z) - Logics-Parsing-Omni Technical Report [18.897248420641386]
本稿では,断片化タスク定義の課題とマルチモーダル解析における非構造化データの均一性に対処するOmni Parsingフレームワークを提案する。
このフレームワークの重要な利点は、そのエビデンスアンカー機構であり、ハイレベルなセマンティック記述と低レベルな事実の厳密な一致を強制する。
これにより、エビデンスに基づく'論理的帰納化が可能となり、構造化されていない信号を、位置可能で、エナメル性があり、トレース可能な標準化された知識に変換する。
論文 参考訳(メタデータ) (2026-03-10T13:46:32Z) - Diagnostic Benchmarks for Invariant Learning Dynamics: Empirical Validation of the Eidos Architecture [0.0]
Eidosアーキテクチャは、PolyShapes-Ideal(PSI)データセット上で99%の精度を達成する。
構造的に制約されたアーキテクチャにおける一般化は、統計スケールではなく幾何学的整合性の性質である。
論文 参考訳(メタデータ) (2026-02-10T22:04:44Z) - Optimal Turkish Subword Strategies at Scale: Systematic Evaluation of Data, Vocabulary, Morphology Interplay [4.061135251278187]
トークン化は、形態学的にリッチな言語におけるニューラル言語モデリングのための重要な設計選択である。
トルコ語サブワードのトークン化に関する、最初の包括的で原則化された研究を提示する。
論文 参考訳(メタデータ) (2026-02-06T18:41:14Z) - A Geometric Taxonomy of Hallucinations in LLMs [0.2538209532048866]
大きな言語モデルにおける「幻覚」という用語は、埋め込み空間における異なる幾何学的シグネチャと異なる現象を混同している。
本稿では,不信感,信頼感,事実的誤りの3つのタイプを識別する分類法を提案する。
この貢献は、埋め込みに基づく検出の範囲を明確にした幾何学的分類法である。
論文 参考訳(メタデータ) (2026-01-26T22:07:09Z) - COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes [83.84578306665976]
大規模な言語モデルは、創造的な文章、特に非英語の文脈において体系的な欠陥を示す。
提案するCOIG-Writerは,多種多様なアウトプットと,その基盤となる思考プロセスの両方をキャプチャする,中国のクリエイティブな文章データセットである。
論文 参考訳(メタデータ) (2025-10-16T15:01:19Z) - KELPS: A Framework for Verified Multi-Language Autoformalization via Semantic-Syntactic Alignment [5.295540405828356]
KELPSは、非公式データを形式言語に翻訳、合成、フィルタリングするための反復的なフレームワークである。
まず、自然言語を知識方程式(KEs)に翻訳する。
次に、構文構造と意味的意味の両方を保持する厳密に定義された規則により、ターゲット言語に変換する。
このプロセスは6万以上の問題からなる並列コーパスを生み出した。
論文 参考訳(メタデータ) (2025-07-11T15:05:06Z) - Learning Interpretable Representations Leads to Semantically Faithful EEG-to-Text Generation [52.51005875755718]
我々は脳波からテキストへの復号に焦点をあて、後部崩壊のレンズを通して幻覚の問題に対処する。
脳波とテキスト間の情報容量のミスマッチを認め、デコードタスクをコア意味のセマンティックな要約として再設計する。
パブリックなZuCoデータセットの実験では、GLIMが一貫して、流動的なEEG基底文を生成することが示されている。
論文 参考訳(メタデータ) (2025-05-21T05:29:55Z) - A New HOPE: Domain-agnostic Automatic Evaluation of Text Chunking [44.47350338664039]
文書チャンキングは検索強化世代(RAG)に根本的に影響する
現在、さまざまなチャンキングメソッドの影響を分析するためのフレームワークはありません。
本稿では,チャンキングプロセスの本質的特徴を3段階に定義する新しい手法を提案する。
論文 参考訳(メタデータ) (2025-05-04T16:22:27Z) - Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge [10.721272718226848]
サブワードトークン化のための内在的・外在的評価フレームワークを提案する。
Intrepidの評価は、私たちの新しいUniMorph Labellerツールに基づいており、サブワードのトークン化を形態学または異星人として分類する。
実験の結果、UniMorph Labellerの精度は98%であり、異種トークン化はより低い一般化をもたらすことがわかった。
論文 参考訳(メタデータ) (2024-04-20T06:49:15Z) - Enriching Disentanglement: From Logical Definitions to Quantitative Metrics [59.12308034729482]
複雑なデータにおける説明的要素を遠ざけることは、データ効率の表現学習にとって有望なアプローチである。
論理的定義と量的指標の関連性を確立し, 理論的に根ざした絡み合いの指標を導出する。
本研究では,非交叉表現の異なる側面を分離することにより,提案手法の有効性を実証的に実証する。
論文 参考訳(メタデータ) (2023-05-19T08:22:23Z) - Retrieval-based Disentangled Representation Learning with Natural
Language Supervision [61.75109410513864]
本稿では,VDR(Vocabulary Disentangled Retrieval)を提案する。
提案手法では,両エンコーダモデルを用いて語彙空間におけるデータと自然言語の両方を表現する。
論文 参考訳(メタデータ) (2022-12-15T10:20:42Z) - Nested Named Entity Recognition as Holistic Structure Parsing [92.8397338250383]
本研究は,文中の全入れ子NEを全体構造としてモデル化し,全体構造解析アルゴリズムを提案する。
実験により、我々のモデルは、最先端にアプローチしたり、あるいは達成したりするような、広く使われているベンチマークで有望な結果が得られることが示された。
論文 参考訳(メタデータ) (2022-04-17T12:48:20Z) - TextFlint: Unified Multilingual Robustness Evaluation Toolkit for
Natural Language Processing [73.16475763422446]
NLPタスク(TextFlint)のための多言語ロバスト性評価プラットフォームを提案する。
普遍的なテキスト変換、タスク固有の変換、敵攻撃、サブポピュレーション、およびそれらの組み合わせを取り入れ、包括的な堅牢性分析を提供する。
TextFlintは、モデルの堅牢性の欠点に対処するために、完全な分析レポートとターゲットとした拡張データを生成します。
論文 参考訳(メタデータ) (2021-03-21T17:20:38Z) - GO FIGURE: A Meta Evaluation of Factuality in Summarization [131.1087461486504]
本稿では,現実性評価指標を評価するメタ評価フレームワークGO FIGUREを紹介する。
10個の実測値のベンチマーク分析により、我々のフレームワークが堅牢で効率的な評価を提供することが明らかとなった。
また、QAメトリクスは、ドメイン間の事実性を測定する標準的なメトリクスよりも一般的に改善されているが、パフォーマンスは、質問を生成する方法に大きく依存していることも明らかにしている。
論文 参考訳(メタデータ) (2020-10-24T08:30:20Z) - Learning Cross-Context Entity Representations from Text [9.981223356176496]
本稿では,テキストコンテキストからエンティティのコンテキスト独立表現を学習するための補間タスクの利用について検討する。
ニューラルネットワークの大規模トレーニングによって,高品質な実体表現を学習できることが示される。
我々のグローバルな実体表現は、スコットランドのサッカー選手のようなきめ細かい型カテゴリをエンコードし、トリビアの質問に答えることができます。
論文 参考訳(メタデータ) (2020-01-11T15:30:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。