論文の概要: Snugi-AI-v2 @ eRisk 2026 Task 2: Early Depression Detection via a Learned Stopping Policy with Sustained Confidence Gate
- arxiv url: http://arxiv.org/abs/2609.08161v1
- Date: Tue, 08 Sep 2026 02:45:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 17:09:39.268953
- Title: Snugi-AI-v2 @ eRisk 2026 Task 2: Early Depression Detection via a Learned Stopping Policy with Sustained Confidence Gate
- Title(参考訳): Snugi-AI-v2 @ eRisk 2026 Task 2: 持続信頼ゲートによる学習停止ポリシによる早期抑うつ検出
- Abstract要約: Snugi-AI-v2のeRisk 2026 Task 2への提出について説明する。
私たちの中心的な貢献は、ERDE50を直接最適化するように訓練された学習された停止ポリシーです。
2つの変種,4つの停止戦略,3つのゲート値にまたがる5つのランにまたがる系統的アブレーションを報告した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We describe the Snugi-AI-v2 submission to eRisk 2026 Task 2, the second edition of contextualized early depression detection from Reddit discussions. Our central contribution is a learned MLP stopping policy trained to directly optimize ERDE50, replacing the fixed and tiered threshold strategies used in all prior eRisk Task 2 submissions. Combined with a sustained confidence gate that commits only after N=3 consecutive rounds of high policy confidence, the system reduces false positives caused by transient emotional posts without sacrificing recall. The pipeline encodes each discussion thread with a frozen MentalRoBERTa model, maps the accumulated representation to a depression probability via an MLP classifier, and delegates the timing decision to the learned policy. Our best run achieves F1 = 0.73 (Run 1) and F_latency = 0.70 (Runs 0 and 3), with a median alert round of 8 out of 500, completing the full evaluation in 1 hour 26 minutes, the fastest among all complete-submission teams. We report a systematic ablation across five runs spanning two encoder variants, four stopping strategies, and three gate values, along with negative results from GRPO policy training, BDI-II post filtering, MentalLongformer encoding, and DeBERTa ensembling. Code: https://github.com/chiuyuwen91/erisk-2026
- Abstract(参考訳): Snugi-AI-v2のeRisk 2026 Task 2への提出について説明する。
私たちの中心的なコントリビューションは、ERDE50を直接最適化するために訓練された学習MLP停止ポリシーであり、以前のeRisk Task 2の全てのサブミッションで使用される固定およびタイトされたしきい値戦略を置き換えるものです。
高信頼度N=3連続ラウンド後にのみコミットする持続的信頼ゲートと組み合わせることで、リコールを犠牲にすることなく、過渡的な感情的ポストによって引き起こされる偽陽性を低減させる。
パイプラインは、各スレッドを凍結した MentalRoBERTa モデルでエンコードし、蓄積した表現を MLP 分類器を介して抑うつ確率にマッピングし、タイミング決定を学習ポリシーに委譲する。
私たちのベストランは、F1 = 0.73 (Run 1) と F_latency = 0.70 (Runs 0 and 3) を達成します。
2つのエンコーダの変種、4つの停止戦略、3つのゲート値、およびGRPOポリシートレーニング、BDI-IIポストフィルタリング、MentalLongformerエンコーディング、DeBERTaアンサンブルによる負の結果を含む5つのランにまたがる系統的アブレーションを報告する。
コード:https://github.com/chiuyuwen91/erisk-2026
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - TTPO: Test-Time Policy Optimization [53.81524570216593]
テストタイムポリシー最適化(TTPO)は、OPSDを介してロールアウトに同意し、Grouped RLと不一致なロールアウトを罰する非対称な目的である。
TTPOは5つの競合レベルのベンチマークでラベル管理されたOPSDと一致し、Qwen3-1.7Bは38.0%から45.2%まで上昇し、思考せずに+25.2%から+36.4%に上昇し、クロスタスクの一般化を示す。
論文 参考訳(メタデータ) (2026-08-27T17:58:10Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies [0.576537956677604]
本稿では,凍結したDINOv3バックボーン上の因果変換器であるValueFormerを紹介する。
障害エピソードには、障害ステージ前の成功曲線を保存するステージ認識、成功テーマデカイリターンとラベル付けされ、単一の障害時間ではなく、ミス間隔から検出が監視される。
論文 参考訳(メタデータ) (2026-08-03T23:46:39Z) - When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - Sequential Planning via Anchored Robotic Keypoints [3.176338968032152]
トレーニング不要なニューロシンボリック操作システムであるSPARK(Anchored Robotic Keypoints, SPARK)について述べる。
単一のGeminiコールは、構成可能なキネマティックプリミティブの型付き振舞いツリー(BT)としてプランを構成する。
2つ目のGeminiコールでは、オブジェクトごとに3つの代替テキストプロンプトが提案され、SAM3がそれぞれを評価します。
代替のプロンプトは、空間スイートに+27.7、オブジェクトスイートに+10.0、全体のリカバリループに+5.0を加算する。
論文 参考訳(メタデータ) (2026-06-29T17:48:01Z) - Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training [2.743683637024251]
自己改善は、コードトレーニング後のREINFORCEで自己回帰できる。
本研究は,Qwen-2.5-3BとQwen-2.5-7Bを用いたマルチシードテストベッドで行った。
論文 参考訳(メタデータ) (2026-06-17T18:03:06Z) - Self-Supervised On-Policy Distillation for Reasoning Language Models [9.324642081509756]
emphSelf-Supervised On-Policy Distillation (SSOPD)
コードはhttps://github.com/tzq 1999/SSOPD.comでリリースされる。
論文 参考訳(メタデータ) (2026-05-17T15:14:24Z) - See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection [51.59559387222532]
エンドツーエンド自動運転の最近の進歩は、パッチアライメント機能で訓練されたポリシーが、アウト・オブ・ディストリビューション(OOD)よりも一般化していることを示している。
我々は、より堅牢で、一般化可能で、効率的な学習ポリシーのためのシンプルで効果的なアプローチである2.4-Patch-Selection(SPS)を提案する。
論文 参考訳(メタデータ) (2026-01-15T18:58:33Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z) - COMAL: A Convergent Meta-Algorithm for Aligning LLMs with General Preferences [57.70902561665269]
本稿では,言語モデルアライメントのためのメタアルゴリズムである Convergent Meta Alignment Algorithm (COMAL) を提案する。
我々は, メタアルゴリズムが最終回において正確なナッシュポリシーに収束する理論解析を行い, 一連の合成および選好最適化データセット上での有効性を実証する。
論文 参考訳(メタデータ) (2024-10-30T17:13:02Z) - Complete Policy Regret Bounds for Tallying Bandits [51.039677652803675]
政策後悔は、適応的な敵に対してオンライン学習アルゴリズムのパフォーマンスを測定するという、よく確立された概念である。
我々は,不完全な政策後悔を効果的に最小化できる敵の制限について検討する。
我々は、$tildemathcalO(mKsqrtT)$の完全なポリシーを後悔するアルゴリズムを提供し、$tildemathcalO$表記は対数要素だけを隠す。
論文 参考訳(メタデータ) (2022-04-24T03:10:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。