
This dataset accompanies a study of English–Arabic code-mixing in Saudi digital discourse on TikTok and X. It includes cleaned TikTok comment data, lexical classification and code-mixing analysis outputs, English and Arabicized-English word lists used in the analysis, automated sentiment-analysis results for X comments, manual sentiment classifications, and the Python code used for data cleaning.