Hugging Face выпустила SmolLM — семейство языковых моделей на 135 миллионов, 360 миллионов и 1,7 миллиарда параметров. Авторы связали проект с интересом к локальному выполнению и снижению требований к оборудованию. Вместе с моделями был представлен SmolLM-Corpus, чтобы сделать подготовку обучающих материалов более прозрачной.
Корпус объединил синтетические учебные тексты Cosmopedia v2, образовательные примеры Python и отобранные веб-материалы FineWeb-Edu. В публикации команда объяснила, как подбирала темы, фильтровала данные и сравнивала варианты обучения. Результаты оценивались на задачах рассуждения и общих знаний. Релиз давал разработчикам компактные модели и подробности об их подготовке, позволяя изучать связь между качеством данных и возможностями небольших систем.