論文の概要: Comparative Analysis of AutoML and BiLSTM Models for Cyberbullying Detection on Indonesian Instagram Comments
- arxiv url: http://arxiv.org/abs/2604.26229v1
- Date: Wed, 29 Apr 2026 02:14:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.223343
- Title: Comparative Analysis of AutoML and BiLSTM Models for Cyberbullying Detection on Indonesian Instagram Comments
- Title(参考訳): インドネシアのInstagramコメントにおけるサイバーバブル検出のためのAutoMLとBiLSTMモデルの比較分析
- Abstract要約: この研究は、インドネシア語のInstagramコメントで、サイバーいじめ検出のための機械学習とディープラーニングのアプローチを比較した。
Bullying and Non-Bullyingとラベル付けされた650コメントのバランスの取れたデータセットを使用して、この調査は、TF-IDF機能を備えたNaive Bayes、Logistic Regression、Support Vector Machineを評価する。
インドネシアの非公式テキストに合わせた前処理パイプラインが適用され、スラング正規化、ストップワード除去、スリーミングが含まれる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This study compares machine learning and deep learning approaches for cyberbullying detection in Indonesian-language Instagram comments. Using a balanced dataset of 650 comments labeled as Bullying and Non-Bullying, the study evaluates Naive Bayes, Logistic Regression, and Support Vector Machine with TF-IDF features, as well as BiLSTM and BiLSTM with Bahdanau Attention. A preprocessing pipeline tailored to informal Indonesian text is applied, including slang normalization, stopword removal, and stemming. The results show that Logistic Regression performs best among the machine learning models, while BiLSTM with Attention achieves the strongest overall deep learning performance. The findings highlight the value of domain-specific preprocessing and show that although deep learning captures contextual patterns more effectively, machine learning remains a competitive option for resource-constrained deployments.
- Abstract(参考訳): この研究は、インドネシア語のInstagramコメントで、サイバーいじめ検出のための機械学習とディープラーニングのアプローチを比較した。
Bullying and Non-Bullyingとラベル付けされた650コメントのバランスの取れたデータセットを使用して、この研究は、Naive Bayes、Logistic Regression、そしてTF-IDF機能を備えたSupport Vector Machine、Bahdanau AttentionによるBiLSTMとBiLSTMを評価する。
インドネシアの非公式テキストに合わせた前処理パイプラインが適用され、スラング正規化、ストップワード除去、スリーミングが含まれる。
その結果、ロジスティック回帰は機械学習モデルの中で最高のパフォーマンスを示し、BiLSTM with Attentionは総合的に最も高いディープラーニング性能を達成した。
この調査結果は、ドメイン固有の事前処理の価値を強調し、ディープラーニングがコンテキストパターンをより効果的にキャプチャする一方で、機械学習はリソース制約されたデプロイメントにおいて競争力のある選択肢であることを示している。
関連論文リスト
- A Comparative Analysis of Classical Machine Learning and Deep Learning Approaches for Sentiment Classification on IMDb Movie Reviews [0.0]
本稿では,IMDb映画レビューデータセットを用いて,感情分類のための古典的機械学習手法とディープラーニング手法の比較検討を行う。
機械学習パイプラインは、TF-IDF機能とPyCaret AutoMLを使用して、ロジスティック回帰、Nave Bayes、Support Vector Machineを評価する。
ディープラーニングパイプラインは、注意機構を備えたBiLSTMとBiLSTMを実装している。
論文 参考訳(メタデータ) (2026-05-08T14:44:36Z) - Sentiment Analysis of Indonesian Spotify Reviews Using Machine Learning and BiLSTM [0.0]
本稿では,インドネシアのSpotifyレビューの3クラス評価分類において,機械学習とディープラーニングのアプローチをベンチマークする。
BiLSTMは全体の感情検出に強く、SMOTEによる機械学習はよりバランスの取れた3クラスのパフォーマンスを提供する。
論文 参考訳(メタデータ) (2026-05-05T07:28:42Z) - Evaluating Extremely Low-Resource Machine Translation: A Comparative Study of ChrF++ and BLEU Metrics [69.2321983942375]
本研究では,n-gram-based metricであるBLEUと,文字-based metricであるChrF++を比較して,EMRL設定におけるMT評価を行う。
本研究は,3つのELRL(Magahi,Bhojpuri,Chhattisgarhi)にまたがる幻覚,反復,原文複写,ダイアクリティック(textitmatra)の変化など,各指標が翻訳物にどう反応するかを検討する。
最近の研究はChrF++にのみ依存することが多いが、BLEUは絶対スコアが低いにもかかわらず、解釈可能性を改善するための補完的な語彙精度の洞察を提供する。
論文 参考訳(メタデータ) (2026-02-19T14:56:42Z) - Beyond Many-Shot Translation: Scaling In-Context Demonstrations For Low-Resource Machine Translation [49.82863380286994]
In-context Learningは、低リソース機械翻訳にLarge Language Modelsを適用する新しい方法を提供するかもしれない。
本研究では,Long-context モデルを用いた数千例のサンプルに対して,数ショット設定以上の低リソース機械翻訳ICLのスケーリングについて検討する。
JavaneseとSundaneseに関する我々の実験は、追加のコンテキストからのゲインがすばやく飽和し、最大コンテキストウィンドウの近くで分解可能であることを示している。
論文 参考訳(メタデータ) (2026-02-04T17:02:22Z) - AI Generated Text Detection [0.0]
本稿では,従来の機械学習モデルとトランスフォーマーベースアーキテクチャの両方を含む,AIテキスト検出手法の評価を行う。
我々は、HC3とDAIGT v2という2つのデータセットを使用して、統一されたベンチマークを構築し、情報漏洩を防止するためにトピックベースのデータ分割を適用する。
その結果、文脈モデリングは語彙的特徴よりもはるかに優れていることが示され、話題記憶の緩和の重要性が強調された。
論文 参考訳(メタデータ) (2026-01-07T11:18:10Z) - LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs [73.27182315028021]
LANPOは、フィードバックの役割をきれいに分離するフレームワークである。
我々の研究は、歴史体験をLLM RLループに統合する堅牢な方法を提供し、より効果的でデータ効率のよい学習エージェントを作成します。
論文 参考訳(メタデータ) (2025-10-18T15:51:19Z) - KIT's Low-resource Speech Translation Systems for IWSLT2025: System Enhancement with Synthetic Data and Model Regularization [64.1520245849231]
本稿では,KIT の低リソーストラック IWSLT 2025 への提出について述べる。
ケースドシステムとエンド・ツー・エンド(E2E)音声翻訳システムを開発した。
事前訓練されたモデルに基づいて、リソースを効率的に活用するためのさまざまな戦略でシステムを微調整します。
論文 参考訳(メタデータ) (2025-05-26T08:38:02Z) - Semantic and Contextual Modeling for Malicious Comment Detection with BERT-BiLSTM [1.5845117761091052]
BERTとBiLSTMを組み合わせたディープラーニングモデルを提案する。
BERTモデルは、事前トレーニングを通じて、テキストの深いセマンティックな特徴をキャプチャし、BiLSTMネットワークはシーケンシャルなデータを処理するのに優れている。
Jigsaw Unintended Bias in Toxicity Classificationデータセットの実験結果は、BERT+BiLSTMモデルが悪意のあるコメント検出タスクにおいて優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2025-03-14T04:51:36Z) - Three-Class Text Sentiment Analysis Based on LSTM [0.0]
本稿では,Long Short-Term Memory (LSTM) ネットワークを用いたWeiboコメントの3クラス感情分類手法を提案する。
実験の結果、優れた性能を示し、精度は98.31%、F1スコアは98.28%に達した。
論文 参考訳(メタデータ) (2024-12-23T07:21:07Z) - Active Learning for Neural Machine Translation [0.0]
NMTツールキットのJoey NMTにActive Learningと呼ばれるテクニックを組み込んで、低リソース言語翻訳の十分な精度と堅牢な予測を行った。
この研究は、トランスフォーマーベースのNMTシステム、ベースラインモデル(BM)、フルトレーニングモデル(FTM)、アクティブラーニング最小信頼ベースモデル(ALLCM)、アクティブラーニングマージンサンプリングベースモデル(ALMSM)を用いて、英語をヒンディー語に翻訳する。
論文 参考訳(メタデータ) (2022-12-30T17:04:01Z) - Improving Classifier Training Efficiency for Automatic Cyberbullying
Detection with Feature Density [58.64907136562178]
言語支援の異なる特徴前処理手法を用いて特徴密度(FD)の有効性を検討した。
データセットの複雑さを推定することで、必要な実験の数を削減できると仮定する。
データセットの言語的複雑さの違いにより、言語的に支援された単語前処理の有効性を議論することが可能になる。
論文 参考訳(メタデータ) (2021-11-02T15:48:28Z) - Revisiting LSTM Networks for Semi-Supervised Text Classification via
Mixed Objective Function [106.69643619725652]
我々は,単純なBiLSTMモデルであっても,クロスエントロピー損失でトレーニングした場合に,競争的な結果が得られるようなトレーニング戦略を開発する。
いくつかのベンチマークデータセット上で,テキスト分類タスクの最先端結果について報告する。
論文 参考訳(メタデータ) (2020-09-08T21:55:22Z) - Bidirectional Encoder Representations from Transformers (BERT): A
sentiment analysis odyssey [0.0]
本研究は,(1)高度で広く使用されている4つの感情分析技術の相対的有効性,(2)テキストデータからの感情分析における事前学習型深層学習 BERT モデルの有効性について考察した。
我々は、インターネット映画データベース(IMDB)に投稿された5万本の映画レビューのコーパスを、Sent WordNetレキシコン、ロジスティック回帰、LSTM、BERTを用いて解析するために公開している。
論文 参考訳(メタデータ) (2020-07-02T14:23:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。