SemRel24STS
An MTEB dataset
Massive Text Embedding Benchmark
SemRel2024 is a collection of Semantic Textual Relatedness (STR) datasets for 14 languages, including African and Asian languages. The datasets are composed of sentence pairs, each assigned a relatedness score between 0 (completely) unrelated and 1 (maximally related) with a large range of expected relatedness values.
Task category
t2t
Domains
Spoken, Written