Logo Lanfrica

Indonesian YouTube Comments Dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Fan
Éditeur:
Zenodo
Hôte:avatar
Dataset ini berisi 5.291 komentar YouTube berbahasa Indonesia yang telah melalui tahapan preprocessing dan pelabelan otomatis untuk tugas deteksi sarkasme. Dataset digunakan dalam penelitian deteksi sarkasme dengan model IndoBERT (IndoNLU dan IndoLEM) serta evaluasi berbagai strategi mitigasi ketidakseimbangan kelas. Struktur dataset:- Dataset utama (imbalanced): 5.291 komentar (1.555 sarkas, 3.736 non-sarkas)- Split untuk skenario imbalanced dan class weighting (85/15 stratified)- Split untuk skenario under sampling (balanced pada data latih) Pelabelan dilakukan dengan model GPT-4o berdasarkan kriteria sarkasme yang telah didefinisikan (lihat Bab 3 tesis terkait). Dataset ini dirancang untuk penelitian akademis dan non-komersial. File disediakan dalam satu zip (indonesian-youtube-sarcasm-dataset.zip) dengan folder:- dataset/sarcasm_dataset.csv- splits/imbalance/train.csv, splits/imbalance/eval.csv- splits/under_sampling/train.csv, splits/under_sampling/eval.csv- README.md Format CSV: id, text, label (0=non-sarkas, 1=sarkas). Lisensi: CC BY-NC 4.0.