The ORIN Lyrics dataset provides a comprehensive corpus of song lyrics from Nigeria, spanning diverse languages (Yoruba, English, Nigerian Pidgin, and multilingual combinations), genres, and styles prevalent in Nigerian popular and traditional music. The dataset contains 862 carefully curated entries, each accompanied by detailed metadata including Artist, Title, Album, Year, Genre, Subgenre, Region, Language, Group, and Source URLs. Compiled through a hybrid method involving web scraping from popular music platforms and subsequent manual verification and metadata enrichment, ORIN Lyrics is tailored specifically for research purposes, particularly in natural language processing (NLP), sentiment analysis, music information retrieval (MIR), computational ethnomusicology, and cultural AI applications.
This dataset is particularly valuable for researchers and practitioners working with low-resource languages, cultural text mining, and cross-lingual NLP tasks.