Logo Lanfrica

Amharic LLM Training Dataset

Domain:

natural language processing

Record type:

dataset
Creator:
Yos
Host:
Complete production-ready Amharic dataset for large language model training and deployment. from datasets import load_dataset # Load the complete dataset dataset = load_dataset("YoseAli/amharic-llm-training-data") # Access splits train_data = dataset["train"] # 761,501 samples test_data = dataset["test"] # 84,612 samples print(f"Training samples: {len(train_data):,}")