mteb-retrieval-15-beir-datasets
IN premise — summaries/2026/08/24/muennighoff-2022-mteb-s4-additional-modalities-text-embeddings-are.md
Created 2026-08-25T02:58:20+00:00
MTEB's retrieval task includes 15 publicly available BEIR datasets: ArguAna, ClimateFEVER, CQADupstack, DBPedia, FEVER, FiQA2018, HotpotQA, MSMARCO, NFCorpus, NQ, Quora, SCIDOCS, SciFact, Touche2020, TRECCOVID
Summary
This pins down exactly what the MTEB retrieval benchmark covers: a fixed set of 15 real-world search and question-answering tasks spanning domains like law, medicine, science, and general web search. It matters because any claim about retrieval quality in this system is being measured against that specific scope, so it defines the boundary of what "good performance" actually means here.