Complete production-ready Amharic dataset for large language model training and deployment.
from datasets import load_dataset
# Load the complete dataset
dataset = load_dataset("YoseAli/amharic-llm-training-data")
# Access splits
train_data = dataset["train"] # 761,501 samples
test_data = dataset["test"] # 84,612 samples
print(f"Training samples: {len(train_data):,}")