論文の概要: CoTu at EXACT 2026: Neuro-Symbolic Reasoning for Transparent Educational QA
- arxiv url: http://arxiv.org/abs/2607.14735v1
- Date: Thu, 16 Jul 2026 09:01:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.051389
- Title: CoTu at EXACT 2026: Neuro-Symbolic Reasoning for Transparent Educational QA
- Title(参考訳): EXACT 2026におけるCoTu : 透明教育QAのためのニューロシンボリック推論
- Abstract要約: EXACT 2026はこの問題を具体化している。
それは、大学規則に対する論理的推論と、多段階の物理学的問題解決の2つのタスクを組み合わせている。
チームコツが両方の問題に対処するために開発したシステムについて述べる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transparent educational question answering asks for answers that are not only correct but explainable, and doing so with small models rules out the reasoning power of the largest proprietary systems. The EXACT 2026 competition poses this problem concretely: open-weight language models of at most 8B parameters, self-hosted, with a natural-language explanation for every answer. It pairs two tasks: logical reasoning over university regulations, and multi-step physics problem solving. We describe the system that team \cotu{} developed to address both, a neuro-symbolic Program-of-Thought pipeline in which a 4B backbone writes a program rather than stating an answer directly: for regulation queries it emits a Z3 encoding whose entailment verdict grounds the deduction, and for physics it emits numerical Python, both wrapped in a shared self-correction loop and a unified explained-JSON output. Answer-type routing, distillation-based task fine-tuning, and a latency-aware serving stack -- SGLang with speculative decoding -- keep the system within the 60-second per-query limit. The system achieved a \textbf{perfect score} on the physics task in both automated selection rounds and obtained the \textbf{highest final-round technical score} of any team -- $13.44/15$, combining automated answer evaluation with expert-judged reasoning depth -- with the equally weighted presentation score included, \cotu{} placed 3rd overall. Grounding answers in a symbolic solver yields correct, verifiable deductions at the 4B scale, and the residual difficulty lies in premise selection rather than the deduction itself.
- Abstract(参考訳): 透明な教育的な質問応答は、正しいだけでなく説明可能な答えを求め、それを小さなモデルで行うことで、最大のプロプライエタリなシステムの推論能力が排除される。
EXACT 2026コンペティションは、少なくとも8Bパラメータのオープンウェイト言語モデルで、答えごとに自然言語で説明されている。
それは、大学規則に対する論理的推論と、多段階の物理学的問題解決の2つのタスクを組み合わせている。
そこで本研究では,4Bバックボーンが直接答えを述べるのではなく,プログラムを記述する,ニューロシンボリックなプログラム・オブ・ソート・パイプラインであるTeam \cotu{}を開発したシステムについて述べる。
アンサー型のルーティング、蒸留ベースのタスクの微調整、および遅延対応のサービススタック -- 投機的デコーディングを備えたSGLang – は、システムをクエリ毎に60秒の制限内に保持する。
このシステムは、両方の自動選考ラウンドで物理学のタスクで \textbf{perfect score} を達成し、あらゆるチームの \textbf{highest final-round technical score} -- 13.44/15$ -- を入手した。
記号解法における解答のグラウンド化は、4Bスケールで検証可能な導出を正し、残りの難しさは、導出そのものよりも前提選択にある。
関連論文リスト
- The Equilibrium Is the Initialization: Lazy Identity Collapse in Physics-Structured Deep Equilibrium Reasoning [0.0]
深い平衡モデルは入力適応型暗黙計算を約束する。
ポート・ハミルトニアンDEQの学習的推論課題に対する注意深い研究を報告する。
標準ゼロ化アブレーションが確立され, 種子依存的な回答が得られた。
論文 参考訳(メタデータ) (2026-07-13T05:45:35Z) - INFUSER: Influence-Guided Self-Evolution Improves Reasoning [54.101135873140066]
2つの共進化的役割を持つ反復的協調学習フレームワークを導入する。
解答器は、生成元が提供する回答に対して標準正当性報酬で訓練される。
8B INF共進化ジェネレータは、数学とコーディングにおいて凍った32B思考ジェネレータより優れている。
論文 参考訳(メタデータ) (2026-06-08T05:40:36Z) - When Attention Beats Fourier: Multi-Scale Transformers for PDE Solving on Irregular Domains [0.0]
msatは複素幾何学問題に対する最先端の一般化を実現する。
textbfMulti-Scale Attention Transformer (msat)は、ソリューション履歴をトークンシーケンスとしてエンコードし、エンドツーエンドにトレーニングする。
論文 参考訳(メタデータ) (2026-05-08T15:23:13Z) - Self-Questioning Language Models [58.73276539661649]
本稿では,提案者がトピックを与えられ,解答者に対する質問を生成する非対称なセルフプレイフレームワークを提案する。
提案者と解答者はともに強化学習を通じて訓練される。
3桁の乗算、OMEGAベンチマークの代数問題、Codeforcesのプログラミング問題である。
論文 参考訳(メタデータ) (2025-08-05T17:51:33Z) - GNN2R: Weakly-Supervised Rationale-Providing Question Answering over
Knowledge Graphs [13.496565392976292]
本稿では,グラフニューラルネットワークを用いた2段階推論モデル(GNN2R)を提案する。
GNN2Rは、最終回答の根拠として最終回答と推論部分グラフの両方を、弱い監督力で効率的に提供することができる。
論文 参考訳(メタデータ) (2023-12-04T19:58:07Z) - Learn to Explain: Multimodal Reasoning via Thought Chains for Science
Question Answering [124.16250115608604]
本稿では,SQA(Science Question Answering)について紹介する。SQA(Science Question Answering)は,21万のマルチモーダルな複数選択質問と多様な科学トピックと,それに対応する講義や説明による回答の注釈からなる新しいベンチマークである。
また,SQAでは,数ショットのGPT-3では1.20%,微調整のUnifiedQAでは3.99%の改善が見られた。
我々の分析は、人間に似た言語モデルは、より少ないデータから学習し、わずか40%のデータで同じパフォーマンスを達成するのに、説明の恩恵を受けることを示している。
論文 参考訳(メタデータ) (2022-09-20T07:04:24Z) - Limits of an AI program for solving college math problems [0.0]
ニューラルネットワークは、人間のレベルでのプログラム合成と少数ショット学習によって、大学の数学問題を解き、説明し、生成する。
彼らが記述したシステムは確かに印象的だが、上記の記述は非常に過大評価されている。
問題を解決する作業はニューラルネットワークではなく、シンボリック代数パッケージSympyによって行われる。
論文 参考訳(メタデータ) (2022-08-14T20:10:14Z) - Neural-Symbolic Solver for Math Word Problems with Auxiliary Tasks [130.70449023574537]
我々のNS-rは、問題を読み取り、問題をエンコードする問題リーダーと、記号方程式を生成するプログラマと、答えを得るシンボリックエグゼキュータから構成される。
また, 目的表現の監督とともに, 4つの新たな補助的目的によって, 異なる記号的推論を強制的に行うように最適化した。
論文 参考訳(メタデータ) (2021-07-03T13:14:58Z) - Logically Consistent Loss for Visual Question Answering [66.83963844316561]
ニューラルネットワークに基づく視覚質問応答(VQA)の現在の進歩は、同じ分布(すなわち、d)の仮定による一貫性を保証することができない。
マルチタスク学習フレームワークにおける論理的一貫した損失を定式化することにより,この問題に対処するための新しいモデルに依存しない論理制約を提案する。
実験により、提案された損失公式とハイブリッドバッチの導入により、一貫性が向上し、性能が向上することを確認した。
論文 参考訳(メタデータ) (2020-11-19T20:31:05Z) - Multi-hop Question Generation with Graph Convolutional Network [58.31752179830959]
マルチホップ質問生成(Multi-hop Question Generation, QG)は,異なる段落から散在する複数の証拠を集約・推論することで,回答に関連する質問を生成することを目的とする。
複数のホップでコンテキストエンコーディングを行うMulQG(Multi-Hop volution Fusion Network for Question Generation)を提案する。
提案モデルでは,高い完全性を有する流動的な質問を生成することができ,マルチホップ評価において,最強のベースラインを20.8%向上させることができる。
論文 参考訳(メタデータ) (2020-10-19T06:15:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。