Logo Lanfrica

Urdu Alpaca

Domaine:

natural language processing

Type de record:

dataset
Créateur:
PRO
Hôte:
This dataset is an Urdu language translation of the Stanford Alpaca instruction tuning dataset, filtered to 28,910 rows. Each entry contains an instruction, optional input, and output translated into Urdu, covering a broad range of task types including question answering, summarization, creative writing, classification, and reasoning. The dataset is designed to support instruction-tuning of Urdu language large language models, extending Alpaca style instruction data to a low resource language.