sgpt-bloom-7b-underperforms
IN premise — summaries/2026/08/24/muennighoff-2022-mteb-s4-results.md
Created 2026-08-25T02:58:22+00:00
SGPT-BLOOM-7.1B-msmarco underperforms SGPT-5.8B-msmarco on MTEB retrieval, attributed to BLOOM's multilingual pre-training diluting English retrieval capability
Summary
A larger embedding model can actually retrieve English documents worse than a smaller one when the bigger model was trained across many languages, because its capacity gets spread thinner across languages instead of focusing on English. This means that for a specific English retrieval task, picking the biggest available model is not automatically the right call; training-data design matters as much as raw parameter count.