MIRACLRetrieval
An MTEB dataset
Massive Text Embedding Benchmark
MIRACL (Multilingual Information Retrieval Across a Continuum of Languages) is a multilingual retrieval dataset that focuses on search across 18 different languages.
Task category
t2t
Domains
Encyclopaedic, Written
Reference
miracl.ai
You can evaluate an embedding model on this dataset using the following code:
import mteb