CCMatrix — это самый крупный датасет параллельных текстов для обучения моделей машинного перевода. Данные включают в себя 4.5 миллиарда параллельных предложений на 576 пар языков. Предложения собирали из открытого датасета с веб-страницами CommonCrawl. Чтобы решить задачу поиска переводов среди предложений из CommonCrawl исследователи использовали параллельную обработку и библиотеку FAISS для поиска близких предложений.