Fugu-MT 論文翻訳(概要): OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning

論文の概要: OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning

arxiv url: http://arxiv.org/abs/2412.16849v1
Date: Sun, 22 Dec 2024 04:21:30 GMT
ステータス: 翻訳完了
システム内更新日: 2024-12-24 19:42:48.136929
Title: OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning
Title（参考訳）: OpenRFT:Reinforcement Fine-Tuningを用いたドメイン固有タスクに対するReasoning Foundationモデルの適用
Authors: Yuxiang Zhang, Yuqi Yang, Jiangming Shu, Yuhang Wang, Jinlin Xiao, Jitao Sang,
Abstract要約: OpenAIは先日、Reinforcement Fine-Tuning (RFT)を導入した。本稿では,ドメイン固有タスクに対する一般推論モデルを微調整するemphOpenRFTを提案する。評価はSciKnowEval上で行われ、OpenRFTは各タスクに対してわずか100ドルのドメイン固有のサンプルで顕著なパフォーマンス向上を達成している。
参考スコア（独自算出の注目度）: 21.931666005603553
License: http://creativecommons.org/licenses/by/4.0/
Abstract: OpenAI's recent introduction of Reinforcement Fine-Tuning (RFT) showcases the potential of reasoning foundation model and offers a new paradigm for fine-tuning beyond simple pattern imitation. This technical report presents \emph{OpenRFT}, our attempt to fine-tune generalist reasoning models for domain-specific tasks under the same settings as RFT. OpenRFT addresses two key challenges of lacking reasoning step data and the limited quantity of training samples, by leveraging the domain-specific samples in three ways: question augmentation, synthesizing reasoning-process data, and few-shot ICL. The evaluation is conducted on SciKnowEval, where OpenRFT achieves notable performance gains with only $100$ domain-specific samples for each task. More experimental results will be updated continuously in later versions. Source codes, datasets, and models are disclosed at: https://github.com/ADaM-BJTU/OpenRFT
Abstract（参考訳）: OpenAIが最近導入したReinforcement Fine-Tuning (RFT)は、基礎モデルの推論の可能性を示し、単純なパターン模倣を超えたファインチューニングのための新しいパラダイムを提供する。本稿では,RFTと同一条件下でのドメイン固有タスクに対する一般化的推論モデルを微調整する試みである \emph{OpenRFT} について述べる。 OpenRFTは、推論ステップデータと限られたトレーニングサンプルの量を欠いている2つの主要な課題に対処し、ドメイン固有のサンプルを3つの方法で活用する。評価はSciKnowEvalで行われ、OpenRFTは各タスクに対してわずか100ドルのドメイン固有サンプルで顕著なパフォーマンス向上を達成している。さらなる実験結果は、後のバージョンで継続的に更新される。ソースコード、データセット、モデルは、https://github.com/ADaM-BJTU/OpenRFTで公開されている。

関連論文リスト

A Llama walks into the 'Bar': Efficient Supervised Fine-Tuning for Legal Reasoning in the Multi-state Bar Exam [38.71998082580061]
法的な推論タスクは、ドメイン固有の知識と推論プロセスの複雑さのために、大きな言語モデル(LLM)に固有の課題を示す。本稿では,Llama 2 7B と Llama 3 8B の小さい言語モデルが,MBE (Multi-state Bar Examination) の限られたデータセットを用いて,いかに効果的に微調整できるかを検討する。
論文参考訳（メタデータ） (2025-04-07T11:31:22Z)
START: Self-taught Reasoner with Tools [51.38785489790888]
ツール統合長チェーン・オブ・シークレット(CoT)推論LSMであるSTART(Self-Taught Reasoner with Tools)を紹介する。 STARTは複雑な計算、自己チェック、多様な方法の探索、そして自己老化を行うことができる。基礎となるQwQ-32Bを著しく上回り、最先端のオープンウェイトモデルR1-Distill-Qwen-32Bに匹敵する性能を達成する。
論文参考訳（メタデータ） (2025-03-06T17:11:51Z)
Visual-RFT: Visual Reinforcement Fine-Tuning [75.20572976629646]
OpenAI o1のような大規模推論モデルにおける強化ファインチューニング(RFT)は、回答に対するフィードバックから学ぶ。 Visual-RFTはさらに、視覚タスクにおけるRTTの適用領域を拡張している。
論文参考訳（メタデータ） (2025-03-03T18:16:32Z)
SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-Tuning [3.4023074295549014]
Subtask-oriented Reinforced Fine-Tuning (SoRFT) は, LLMの問題解決能力を高めるための新しいトレーニング手法である。 SWE-Bench Verified と SWE-Bench Lite を用いたSORFT訓練モデルの評価を行い,オープンソースモデル間でのSOTA(State-of-the-art)性能を実現する。
論文参考訳（メタデータ） (2025-02-27T14:19:45Z)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models [61.14336781917986]
大規模言語モデル(LLM)の推論能力を高めるためのオープンソースのフレームワークであるOpenRを紹介する。 OpenRは、データ取得、強化学習トレーニング、非自己回帰デコーディングを凝集性ソフトウェアプラットフォームに統合する。私たちの研究は、OpenAIのo1モデルのコア技術と強化学習を探求する、オープンソースのフレームワークを初めて提供するものです。
論文参考訳（メタデータ） (2024-10-12T23:42:16Z)
FsPONER: Few-shot Prompt Optimization for Named Entity Recognition in Domain-specific Scenarios [0.5106912532044251]
FsPONERは、少数ショットプロンプトを最適化するための新しいアプローチであり、ドメイン固有のNERデータセットの性能を評価する。 FsPONERは、ランダムサンプリングとTF-IDFとの組み合わせに基づく3つのショット選択法で構成されている。データ不足を考慮した実世界のシナリオでは、TF-IDFを用いたFsPONERは、F1スコアで約10%の微調整モデルを上回っている。
論文参考訳（メタデータ） (2024-07-10T20:32:50Z)
Fine-Tuning or Fine-Failing? Debunking Performance Myths in Large Language Models [0.8399688944263842]
大きな言語モデル(LLM)は、入力クエリから人間のようなテキストを理解し、生成する能力を持つ。本研究では、この概念を、レトリーバル拡張生成(RAG)パイプライン内のLLMの統合に拡張する。データ抽出と文脈理解における微調整がLLMの能力に与える影響を評価する。
論文参考訳（メタデータ） (2024-06-17T04:35:17Z)
Comparative Analysis of Different Efficient Fine Tuning Methods of Large Language Models (LLMs) in Low-Resource Setting [0.0]
我々は、大規模言語モデル(LLM)の様々な微調整戦略の理解を深めようとしている。我々は,2つのデータセット(COLAとMNLI)で事前学習したモデルに対して,バニラファインチューニングやPBFT(Pattern-Based Fine-Tuning)のような最先端の手法を比較した。以上の結果から,バニラFTやPBFTに匹敵する領域外一般化が期待できる可能性が示唆された。
論文参考訳（メタデータ） (2024-05-21T20:08:52Z)
Beyond Scaling: Predicting Patent Approval with Domain-specific Fine-grained Claim Dependency Graph [28.13334909565348]
本稿では,特許データ内の本質的な依存関係を用いて,ドメイン固有グラフ法がモデルより優れていることを示す。本稿では, 精密な特許データ解析により, 微細粒度cLAim depeNdency (FLAN)グラフを提案する。
論文参考訳（メタデータ） (2024-04-22T17:22:31Z)
RAFT: Adapting Language Model to Domain Specific RAG [75.63623523051491]
本稿では、ドメイン内の「オープンブック」設定において、モデルが質問に答える能力を改善するためのトレーニングレシピであるRetrieval Augmented FineTuning(RAFT)を紹介する。 RAFTは、質問に答える助けとなる関連文書から、動詞の正しいシーケンスを引用することで、これを達成します。 RAFTは、PubMed、HotpotQA、Gorillaデータセット全体のモデルのパフォーマンスを一貫して改善する。
論文参考訳（メタデータ） (2024-03-15T09:26:02Z)
Fine Tuning vs. Retrieval Augmented Generation for Less Popular Knowledge [15.553942864736989]
言語モデル(LM)は膨大な事実知識を記憶し、様々なタスクやドメインにまたがって強力なパフォーマンスを示す。低頻度トピックにおけるLMの性能を高めるための2つの顕著なアプローチは、検索型拡張生成(RAG)と合成データに対する微調整(FT)である。本稿では,質問応答タスクにおける低周波エンティティ処理におけるLMのカスタマイズに対するRAGとFTの影響について検討し,評価する。
論文参考訳（メタデータ） (2024-03-03T08:07:55Z)
FedRA: A Random Allocation Strategy for Federated Tuning to Unleash the Power of Heterogeneous Clients [50.13097183691517]
実世界のフェデレーションシナリオでは、様々な計算と通信資源を持つ多種多様なクライアントが存在することが多い。本稿では,新しいフェデレーションチューニングアルゴリズムであるFedRAを提案する。各通信ラウンドにおいて、FedRAはランダムにアロケーション行列を生成する。アダプタを用いてアロケーション行列とファインチューンに基づいて、元のモデルから少数のレイヤを再編成する。
論文参考訳（メタデータ） (2023-11-19T04:43:16Z)
MinPrompt: Graph-based Minimal Prompt Data Augmentation for Few-shot Question Answering [64.6741991162092]
オープンドメイン質問応答のための最小限のデータ拡張フレームワークMinPromptを提案する。我々は、生テキストをグラフ構造に変換し、異なる事実文間の接続を構築する。次に、グラフアルゴリズムを適用して、原文のほとんどの情報をカバーするのに必要な最小限の文の集合を識別する。同定された文サブセットに基づいてQAペアを生成し、選択した文に基づいてモデルをトレーニングし、最終モデルを得る。
論文参考訳（メタデータ） (2023-10-08T04:44:36Z)
Pushing the Limits of Simple Pipelines for Few-Shot Learning: External Data and Fine-Tuning Make a Difference [74.80730361332711]
コンピュータビジョンにおいて、ほとんどショット学習は重要かつトピック的な問題である。単純なトランスフォーマーベースのパイプラインは、標準ベンチマークで驚くほど優れたパフォーマンスが得られることを示す。
論文参考訳（メタデータ） (2022-04-15T02:55:58Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。