論文の概要: TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B
- arxiv url: http://arxiv.org/abs/2607.01927v1
- Date: Thu, 02 Jul 2026 09:22:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.75857
- Title: TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B
- Title(参考訳): TUDUM:Qwen3.5-27B用のトルコ製シンキングリソンパイプライン
- Abstract要約: 本稿では,トルコの推論に対してQwen- Family 27B思考モデルを適用するためのプロジェクトパイプラインであるTUDUMについて述べる。
中心的な問題はトルコにおけるトルコのプロンプトに答えるだけでなく、トルコ自体に明確な理由を辿ることである。
この貢献は、技術的に正直なトルコの推論パイプラインと評価であり、最先端のトルコの推論の主張ではない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents TUDUM (Türkçe Düşünen Üretken Model), a project pipeline for adapting a Qwen-family 27B thinking model toward Turkish reasoning. The central problem is not only to answer Turkish prompts in Turkish, but to make the explicit reasoning trace itself Turkish. A thinking model may translate a Turkish prompt into an English-centered internal or visible scratchpad, solve the problem mostly in English, and only localize the final answer. TUDUM instead treats the generated <think>...</think> block as a trainable behavior. The pipeline starts from the project base checkpoint unsloth/Qwen3.5-27B, applies supervised fine-tuning (SFT) on 15,991 Turkish reasoning examples using LoRA adapters, and then applies GRPO-family reinforcement learning on a proxy-filtered Turkish mathematics environment. The results are mixed. SFT made the model shorter and more consistently Turkish in its reasoning behavior, with large reductions in average response length and thinking exhaustion, but reduced benchmark accuracy. RL recovered some mathematical performance, especially AIME24 at the best early checkpoint, yet did not uniformly improve all benchmarks and did not exceed the base model on the reported Macro-6 average. The contribution is therefore best framed as a technically honest Turkish-thinking reasoning pipeline and evaluation, not as a claim of state-of-the-art Turkish reasoning. The released step-50 model is publicly available.
- Abstract(参考訳): 本稿では,トルコの推論に対してQwenファミリー27B思考モデルを適用するためのプロジェクトパイプラインであるTUDUMについて述べる。
中心的な問題はトルコにおけるトルコのプロンプトに答えるだけでなく、トルコ自体に明確な理由を辿ることである。
思考モデルは、トルコのプロンプトを英語中心の内的または可視的なスクラッチパッドに変換し、この問題を主に英語で解決し、最終回答のみをローカライズする。
TUDUMは代わりに生成された<think>...</think>ブロックをトレーニング可能な振る舞いとして扱う。
パイプラインは、プロジェクトベースチェックポイントUnsloth/Qwen3.5-27Bから始まり、15,991個のトルコの推論例をLoRAアダプタを使って教師付き微調整(SFT)に適用し、その後、プロキシフィルタリングされたトルコの数学環境にGRPO系列の強化学習を適用した。
結果はまちまちだ。
SFTは平均応答長と思考疲労を大幅に削減するが、ベンチマークの精度は低下した。
RLはいくつかの数学的な性能、特にAIME24を最初期のチェックポイントで回復させたが、全てのベンチマークを均一に改善することはなく、報告されたマクロ-6平均のベースモデルを超えなかった。
したがって、この貢献は、技術的に正直なトルコの推論パイプラインと評価であり、最先端のトルコの推論の主張ではない。
リリースされたStep-50モデルは一般公開されている。
関連論文リスト
- Is Code Better Than Language for Algorithmic Reasoning [58.86873062890482]
ツール拡張言語モデルでは、中間表現と実行機構の両方を変えるため、自然言語推論とコード実行パイプラインを比較することは困難である。
モデルは、その推論を実行可能なコードとして表現し、言語モデルは、そのコードを文脈でシミュレートして、回答を生成する。
中間介入は自然言語の推論と有意に異なるものではない(+0.15pp)。
論文 参考訳(メタデータ) (2026-06-14T04:17:21Z) - Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models [38.84286306535778]
第1の正しい接頭辞の停止は、標準的推論よりも21%の精度向上を示す。
早期停止のような一般的な効率戦略は、冗長な過度な考えを著しく減らすが、有害な過度な過度な考えを軽減できない。
我々の研究結果は言語のみの推論ベンチマークに一般化され、より広範な信頼性リスクとして有害な過ちを浮き彫りにしている。
論文 参考訳(メタデータ) (2026-06-01T19:59:27Z) - Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning [59.74608632210439]
そこで本研究では,ツール使用の自然な動作を,ツールなし推論能力を犠牲にすることなく,強力な思考モデルに注入する方法を示す。
提案手法は,オープンソースモデル間のベンチマークにおいて,最先端のパフォーマンスを実現するモデルを生成する。
論文 参考訳(メタデータ) (2026-05-07T14:23:21Z) - RAGTurk: Best Practices for Retrieval Augmented Generation in Turkish [0.0]
トルコ語ウィキペディアとCulturaXから派生した包括的トルコ語RAGデータセットを構築した。
RAGパイプラインの7つのステージをベンチマークし、クエリ変換から、タスク固有の微調整を使わずに、改善に答えるように再ランク付けする。
論文 参考訳(メタデータ) (2026-02-03T15:35:11Z) - BIRDTurk: Adaptation of the BIRD Text-to-SQL Dataset to Turkish [0.0]
我々は、BIRDベンチマークの最初のトルコ適応であるBIRDTurkを紹介する。
BirderTurkは、スキーマ識別子をトルコ語に適応させる制御された翻訳パイプラインによって構築される。
我々は推論に基づくプロンプト、エージェント多段階推論、教師付き微調整を評価する。
論文 参考訳(メタデータ) (2026-02-03T15:21:00Z) - Your Models Have Thought Enough: Training Large Reasoning Models to Stop Overthinking [50.97239453902612]
大規模推論モデル(LRM)は、困難なタスクにおいて顕著なパフォーマンスを達成したが、その深い推論はしばしばかなりの計算コストを発生させる。
Evidence Accumulation Modelsにインスパイアされて、LEMは推論の初期段階で十分な情報を蓄積し、さらなる推論ステップを冗長にすることがわかった。
不要な推論を積極的に終了させるためにモデルを訓練するJust-Enough Thinking (JET)を提案する。
論文 参考訳(メタデータ) (2025-09-27T16:25:06Z) - Turk-LettuceDetect: A Hallucination Detection Models for Turkish RAG Applications [0.0]
本稿では,トルコのRAGアプリケーションに特化して設計された幻覚検出モデルの最初のスイートであるTurk-LettuceDetectを紹介する。
これらのモデルは、質問応答、データ・トゥ・テキスト生成、要約タスクを含む17,790のインスタンスを含むRAGTruthベンチマークデータセットの機械翻訳バージョンでトレーニングされた。
実験の結果,ModernBERTをベースとしたモデルでは,F1スコアの0.7266が完全なテストセットで達成され,特に構造化タスクにおいて高い性能が得られた。
論文 参考訳(メタデータ) (2025-09-22T12:14:11Z) - Don't "Overthink" Passage Reranking: Is Reasoning Truly Necessary? [60.725923225442095]
我々は、推論に基づくポイントワイドリランカ(ReasonRR)と、同じ訓練条件下での標準、非推論ポイントワイドリランカ(StandardRR)を比較した。
ReasonRR-NoReasonはReasonRRよりも驚くほど効果的であることがわかった。
論文 参考訳(メタデータ) (2025-05-22T16:41:37Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - TurkishMMLU: Measuring Massive Multitask Language Understanding in Turkish [54.51310112013655]
本稿では,最初のマルチタスク,複数選択のトルコQAベンチマーク,トルコMMLUを紹介する。
トルコMMLUには1万以上の質問があり、トルコの高校教育カリキュラムとは9つの異なるテーマをカバーしている。
多言語オープンソース(Gemma、Llama、MT5)、クローズドソース(GPT 4o、Claude、Gemini)、トルコ適応モデル(Trendyolなど)を含む20以上のLLMを評価した。
論文 参考訳(メタデータ) (2024-07-17T08:28:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。