論文の概要: A Systematic Study of Small Language Models on Abstract Reasoning Tasks
- arxiv url: http://arxiv.org/abs/2610.08680v1
- Date: Tue, 06 Oct 2026 17:01:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.134978
- Title: A Systematic Study of Small Language Models on Abstract Reasoning Tasks
- Title(参考訳): 抽象推論課題における小言語モデルの体系的研究
- Abstract要約: ARC-TGIベンチマークを用いて,小言語モデルの区別について検討した。
我々は、教師付き微調整下でデコーダのみ、エンコーダ-デコーダ、およびMix of-expertsモデルファミリをプロファイルする。
全体として、抽象推論スコアはモデル、適応方式、評価分布、応答形式に条件付きである。
- 参考スコア(独自算出の注目度): 5.870990919877351
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Endpoint accuracy on abstract-reasoning benchmarks does not reveal whether a language model has acquired a transferable rule or fit distribution-specific regularities. We study this distinction in small language models on the ARC-TGI benchmark, which organizes abstract grid transformations into controllable task families and supports resampling, spatial shifts, and cross-benchmark transfer. Across more than 1,000 runs, we profile decoder-only, encoder--decoder, and mixture-of-experts model families under supervised fine-tuning. We examine the efficiency and stability of skill acquisition, robustness beyond the training distribution, interactions with model family and task formulation, and layer-wise attention signatures that accompany behavioral differences. Substantial in-distribution accuracy is attainable, but acquisition is sensitive to optimization and unevenly distributed across task families. Performance deteriorates sharply outside the training distribution, including when the rule is retained but grid scale changes. Greater training-set depth and breadth yield uneven gains, while the effect of additional in-context examples depends on model family. Executable-rule induction also yields correct solutions not observed under direct grid generation. On selected tasks, attention diagnostics show distinct concentration and context-dependence profiles, but do not establish general causal mechanisms. Overall, abstract-reasoning scores are conditional on the model, adaptation regime, evaluation distribution, and response format.
- Abstract(参考訳): 抽象推論ベンチマークのエンドポイント精度は、言語モデルが転送可能なルールを取得したか、分布固有の正規性に適合したかを明らかにしていない。
ARC-TGIベンチマークでは、制御可能なタスクファミリへの抽象グリッド変換を編成し、再サンプリング、空間シフト、クロスベンチマーク転送をサポートする。
1000回以上の実行で、教師付き微調整の下でデコーダのみ、エンコーダ-デコーダ、およびMixix-of-expertsモデルファミリをプロファイルする。
本研究では, スキル獲得の効率性と安定性, トレーニング分布を超えた堅牢性, モデルファミリとのインタラクション, タスクの定式化, 行動の違いに伴うレイヤワイドアテンションシグネチャについて検討する。
実質的な分配精度は達成可能だが、獲得は最適化に敏感であり、タスクファミリ間で不均一に分散する。
トレーニングディストリビューションの外では,ルールが保持されているがグリッドスケールが変更されるなど,パフォーマンスが著しく低下する。
トレーニングセットの深度と広さは不均一な利得をもたらすが、追加の文脈内サンプルの効果はモデルファミリに依存する。
実行可能ルール誘導はまた、直接格子生成下では観測されない正しい解を与える。
選択されたタスクにおいて、注意診断は、異なる濃度と文脈依存プロファイルを示すが、一般的な因果メカニズムは確立しない。
全体として、抽象推論スコアはモデル、適応方式、評価分布、応答形式に条件付きである。
関連論文リスト
- Representation-Aligned Auxiliary Supervision for Language Model Adaptation [91.62292288058904]
チェスにおいて、モデルが構造化されたタスクの表現を処理する程度である表現の互換性について検討する。
本稿では,環境依存型タスクを適合表現で表現し,構造ドメインへの適応性を向上させるための,表現整合型補助監視手法を提案する。
論文 参考訳(メタデータ) (2026-10-02T22:04:12Z) - Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance [92.72779885657373]
本稿では,視覚エンコーダの内部関数力学におけるモデル選択の基盤となるフレームワークを提案する。
提案手法は,各タスクをレイヤワイドコンダクタンスにより表現し,エントロピー正規化アライメントによる目標条件付きブロック重要度分布を導出する。
そこで本研究では,DCD(Directional Conductance Divergence)という,ソースタスクが対象の機能ブロックをいかに効果的にカバーするかを定量化する非対称な指標を提案する。
論文 参考訳(メタデータ) (2026-02-01T17:29:43Z) - Did Models Sufficient Learn? Attribution-Guided Training via Subset-Selected Counterfactual Augmentation [61.248535801314375]
Subset-Selected Counterfactual Augmentation (SS-CA)
我々は,モデル予測を選択的に変更可能な最小空間領域集合を識別するために,対実的LIMAを開発した。
実験により,SS-CAは分布内テストデータ(ID)の一般化を改善し,分布外ベンチマーク(OOD)において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-15T08:39:22Z) - Verifier-free Test-Time Sampling for Vision Language Action Models [46.54221299065429]
Masking Distribution Guided Selection (MG-Select)はVision-Language-Actionモデルのための新しいテスト時間スケーリングフレームワークである。
実験の結果,MG-Selectは大幅な性能向上を実現していることがわかった。
論文 参考訳(メタデータ) (2025-10-07T08:38:08Z) - SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignment [49.86376148975563]
大規模言語モデル(LLM)は、様々なタスクを理解し実行する能力を通じて自然言語処理に革命をもたらした。
教師付き微調整、特にRetrieval-Augmented Generation (RAG)のシナリオでは、しばしば破滅的な忘れが生じる。
本稿では,モデルのセマンティック分布を保存するために,入力シーケンスロジットをアライメントする自己分布アライメント手法であるSelfAugを提案する。
論文 参考訳(メタデータ) (2025-09-04T06:50:47Z) - Enhancing Robustness of Foundation Model Representations under
Provenance-related Distribution Shifts [8.298173603769063]
分布シフト下における基礎モデルに基づくモデルの安定性について検討する。
我々は,多施設データセットの文脈に現れる分布シフトの形式である,証明によるコンバウンディングに焦点をあてる。
その結果, 基礎モデルでは, コンバウンド・バイ・プロビデンス関係の分布シフトに対して, ある程度の頑健性を示すが, 調整により改善できることがわかった。
論文 参考訳(メタデータ) (2023-12-09T02:02:45Z) - IW-GAE: Importance Weighted Group Accuracy Estimation for Improved Calibration and Model Selection in Unsupervised Domain Adaptation [13.796664304274643]
グループ精度を推定することにより,モデルの校正とモデル選択に対処する新たな視点を提案する。
実験の結果,モデルキャリブレーションタスクでは22%,モデル選択タスクでは14%,最先端性能では22%向上した。
論文 参考訳(メタデータ) (2023-10-16T17:35:29Z) - Distributionally Robust Post-hoc Classifiers under Prior Shifts [31.237674771958165]
本研究では,クラスプライヤやグループプライヤの分布の変化による変化に頑健なトレーニングモデルの問題点について検討する。
本稿では,事前学習モデルからの予測に対するスケーリング調整を行う,非常に軽量なポストホック手法を提案する。
論文 参考訳(メタデータ) (2023-09-16T00:54:57Z) - Predicting with Confidence on Unseen Distributions [90.68414180153897]
ドメイン適応と予測不確実性文学を結びつけて、挑戦的な未知分布のモデル精度を予測する。
分類器の予測における信頼度(DoC)の差は,様々な変化に対して,分類器の性能変化を推定することに成功した。
具体的には, 合成分布と自然分布の区別について検討し, その単純さにもかかわらず, DoCは分布差の定量化に優れることを示した。
論文 参考訳(メタデータ) (2021-07-07T15:50:18Z) - Estimating Generalization under Distribution Shifts via Domain-Invariant
Representations [75.74928159249225]
未知の真のターゲットラベルのプロキシとして、ドメイン不変の予測器のセットを使用します。
結果として生じるリスク見積の誤差は、プロキシモデルのターゲットリスクに依存する。
論文 参考訳(メタデータ) (2020-07-06T17:21:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。