論文の概要: Differentiable Fuzzy Inference Layer: A Monotone, Compositional Ordinal Reasoning Head for Large Language Models
- arxiv url: http://arxiv.org/abs/2609.26113v1
- Date: Mon, 17 Aug 2026 21:13:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.880617
- Title: Differentiable Fuzzy Inference Layer: A Monotone, Compositional Ordinal Reasoning Head for Large Language Models
- Title(参考訳): 微分可能なファジィ推論層:大言語モデルのための単調合成順序推論ヘッド
- Abstract要約: ほとんどの学生が通った」と解釈するよう求められた言語モデルは、通常「最も多い」と答えるが、「最も多い」の2つの例は「ある」に近くなる。
標準分類器ヘッドは順序圏を独立ラベルとして扱い、それらの自然順序を尊重したり代数的に構成する機構を持たない。
本稿では,二経路予測ヘッドである差分ファジィ推論層 (DFIL) について紹介する。
- 参考スコア(独自算出の注目度): 3.6503889532208045
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A state-of-the-art language model asked to interpret "most of most students passed" typically answers "most," though composing two instances of "most" yields a proportion closer to "some." We trace this failure to an architectural choice rather than a data deficit: standard classifier heads treat ordinal categories as independent labels, with no mechanism to respect their natural ordering or compose them algebraically. We introduce the Differentiable Fuzzy Inference Layer (DFIL), a dual-path prediction head pairing a standard classifier with a scalar-bottlenecked branch grounded in a bank of ordered membership functions. DFIL supplies two structural primitives that a label-only head cannot inherit: monotonicity in the underlying quantity, and compositional reasoning via t-norm operations without any compositional training data. The scalar branch additionally provides an interpretable interface for analyzing residual errors. We instantiate DFIL on ordinal natural-language tasks across diverse LLM families.
- Abstract(参考訳): 最先端の言語モデルでは、「ほとんどの生徒が通った」と解釈するよう求められたが、一般的には「最も多い」と答えるが、「最も多い」の2つの例は「一部」に近づいた。
標準分類器ヘッドは、それらの自然順序を尊重し、代数的に構成するメカニズムを持たない独立ラベルとして順序カテゴリーを扱います。
本稿では,二経路予測ヘッドである差分ファジィ推論層 (DFIL) について紹介する。
DFILは、ラベルのみの頭部が継承できない2つの構造的プリミティブを提供する。
また、スカラーブランチは残差を解析するための解釈可能なインターフェースを提供する。
DFILを多種多様なLLMファミリーにまたがる日常的な自然言語タスクでインスタンス化する。
関連論文リスト
- Learning Constituent Headedness [9.025809029628247]
頭頂部は構文解析において組織化装置として広く用いられているが、選挙区のツリーバンクはそれを明示的に符号化することは滅多にない。
我々は、各構成元を依存関係スパンヘッドとして定義することにより、整列した構成元と依存性アノテーションに対する教師付き予測タスクとして学習し、監督を誘導する。
一致した英語と中国語のデータでは、結果のモデルは内在性に近い精度を達成し、コリンズ式規則に基づくパーコレーションを著しく上回る。
論文 参考訳(メタデータ) (2026-03-16T02:39:41Z) - Bidirectional Logits Tree: Pursuing Granularity Reconcilement in Fine-Grained Classification [89.20477310885731]
本稿では,粒度分類タスクにおけるグラニュラリティコンペティションの課題について述べる。
既存のアプローチは通常、共通のベースエンコーダから抽出された共有特徴に基づいて、独立した階層認識モデルを開発する。
グラニュラリティ再構成のための双方向ロジットツリー(BiLT)と呼ばれる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-17T10:42:19Z) - Sometimes I am a Tree: Data Drives Unstable Hierarchical Generalization [22.743918211989605]
初期の訓練では、LMはn-gramモデルのように振る舞うことができるが、最終的には木に基づく構文規則を学び、階層的に分布から一般化する。
制御された文法学習タスク(質問形成と時制インフレクション)を用いて、このシフトを研究する。
これらの結果は、学習データの一般化形成における中心的な役割を強調し、なぜ競合戦略が不安定な結果をもたらすのかを説明する。
論文 参考訳(メタデータ) (2024-12-05T21:12:37Z) - Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers [74.96551626420188]
自然言語データに基づいて訓練されたトランスフォーマーは、その階層構造を学習し、目に見えない構文構造を持つ文に一般化することが示されている。
本研究では,変圧器モデルにおける帰納バイアスの発生源と,そのような一般化行動を引き起こす可能性のあるトレーニングについて検討する。
論文 参考訳(メタデータ) (2024-04-25T07:10:29Z) - How to Plant Trees in Language Models: Data and Architectural Effects on
the Emergence of Syntactic Inductive Biases [28.58785395946639]
事前学習は、微調整後にタスクを実行する際に、階層的な構文的特徴に依存するように言語モデルを教えることができることを示す。
アーキテクチャの特徴(深さ、幅、パラメータ数)と、事前学習コーパスのジャンルとサイズに焦点を当てる。
論文 参考訳(メタデータ) (2023-05-31T14:38:14Z) - Recursive Neural Networks with Bottlenecks Diagnose
(Non-)Compositionality [65.60002535580298]
データの構成性の定量化は難しい課題であり、主に短い発話のために研究されている。
モデルにおけるデータの表現とボトルネックの有無を比較することで,構成性の測定値が得られることを示す。
本手法は、合成データを用いた算術式の評価と、自然言語データを用いた感情分類に適用する。
論文 参考訳(メタデータ) (2023-01-31T15:46:39Z) - ORCHARD: A Benchmark For Measuring Systematic Generalization of
Multi-Hierarchical Reasoning [8.004425059996963]
本稿では,Transformer と LSTM のモデルが体系的一般化において驚くほど失敗することを示す。
また、階層間の参照の増加に伴い、Transformerはランダムにしか動作しないことを示す。
論文 参考訳(メタデータ) (2021-11-28T03:11:37Z) - Approximation and generalization properties of the random projection classification method [0.4604003661048266]
ランダムな一次元特徴を閾値付けした低複素度分類器群について検討する。
特定の分類問題(例えば、大きな羅生門比を持つもの)に対して、ランダムにパラメータを選択することにより、一般化特性において潜在的に大きな利得がある。
論文 参考訳(メタデータ) (2021-08-11T23:14:46Z) - Hierarchical Poset Decoding for Compositional Generalization in Language [52.13611501363484]
出力が部分的に順序付けられた集合(命題)である構造化予測タスクとして人間の言語理解を形式化する。
現在のエンコーダ・デコーダアーキテクチャは意味論のポーズ構造を適切に考慮していない。
本稿では,言語における合成一般化のための新しい階層型ポーズデコーディングパラダイムを提案する。
論文 参考訳(メタデータ) (2020-10-15T14:34:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。