Какие локальные модели ИИ выбрать для MacBook Air и Pro с 8–128 ГБ памяти
Конкретные GGUF и MLX: размеры файлов, осторожный выбор по RAM, запас для macOS и контекста. Для русского чата, кода и документов на Apple Silicon.
- Система
- macOS 27.0
- Программы
- LM Studio 0.4.23+1
Подробности проверки
- Сохранённый тест LM Studio 0.4.23+1 на macOS 27.0 arm64 с 24 GiB: заранее загруженная пользователем qwen/qwen3.8-27b, отображаемая как MLX 4bit, sizeBytes 16081678492 (16.08 GB), context 4096, parallel 4, thinking on.
- Raw lms ls и наблюдение My Models подтвердили формат и размер этой реальной пользовательской конфигурации.
- Они не переносятся на GGUF-файлы, остальные строки RAM-таблицы или рекомендации статьи
- 14 рекомендаций остаются расчётными.
- Параллельная нагрузка, скорость и расход памяти не измерялись.
Какую локальную модель выбрать для MacBook с 8, 24 или 128 ГБ памяти, чтобы она оставляла место для работы? Начинать стоит с конкретного файла весов и короткого контекста. Ниже — подборка для Apple Silicon, от компактного русского чата до моделей для кода и документов. «Разумный старт» означает нашу осторожную оценку памяти; это не результат испытаний на каждом перечисленном Mac.
Файлы и карточки сверены 9 сентября 2026 года. В подборке есть Qwen3.5, Qwen3.8 и Gemma 4, а также более ранние Qwen3 и gpt-oss с доступными сборками. Новизна названия сама по себе не определяет полезность. Проверенного общего рейтинга русского языка, качества кода и скорости этих квантизаций у нас нет.
Какая память действительно бывает у MacBook
Таблица относится к MacBook Air и Pro с чипами Apple M1 и новее. Apple указывает объёмы объединённой памяти как GB; для расчёта ниже используем физическую RAM в GiB. Уточните её в «Об этом Mac», а при необходимости — командой ниже: результат будет в байтах. Не переносите десятичную сноску Apple о вместимости SSD на оперативную память.
sysctl -n hw.memsizeAir M1 выпускался с 8 или 16 ГБ. В актуальной спецификации Air M5 перечислены 16, 24 и 32 ГБ: Air с 48–128 ГБ в этой линейке нет. У Pro варианты зависят от чипа: M3 Pro — 18/36 ГБ; M3 Max с 14 ядрами CPU — 36/96 ГБ, с 16 ядрами — 48/64/128 ГБ. У M2 Pro есть 16/32 ГБ, у M2 Max — 32/64 ГБ и 96 ГБ при 38 ядрах GPU.
В текущей линейке Pro базовый M5 имеет 16/24/32 ГБ, M5 Pro — 24/48 ГБ и до 64 ГБ с 20 ядрами GPU; M5 Max — 36 ГБ с 32 ядрами GPU либо 48/64/128 ГБ с 40 ядрами. Это примеры реальных сочетаний, а не возможность заказать любую память с любым процессором. Для старого или подержанного ноутбука сверяйте спецификацию именно его года и чипа.
Intel Mac — отдельный случай: таблица к нему неприменима. LM Studio сейчас не поддерживает Intel Mac, а MLX LM рассчитан на Apple Silicon. Возможность CPU-запуска в другом движке требует отдельной проверки; наличие 32 ГБ у Intel не делает его эквивалентом M-серии с той же RAM.
Почему размер загрузки меньше нужной памяти
Веса — сохранённые числовые коэффициенты модели. Квантизация уменьшает точность их хранения: Q4_K_M, Q8_0 и MLX 4-bit обозначают разные конкретные представления. Нельзя считать, что каждый параметр Q4 занимает ровно четыре бита: есть блоки, масштабы, метаданные и тензоры другой точности. Размер реального файла полезнее произведения «параметры × биты».
При работе нужны также KV-кеш — промежуточные данные внимания о контексте, другие состояния модели и вычислительные буферы. В гибридных архитектурах устройство кеша отличается от обычного трансформера. История чата, документ, инструкция и будущий ответ расходуют контекст; несколько параллельных запросов увеличивают потребление памяти. Для мультимодального режима добавляются соответствующие компоненты и обработка входных данных. Объединённая RAM не означает, что весь её объём доступен GPU: учитывайте ограничения Metal и самого движка.

Для первого отбора оставим macOS и обычным приложениям условный резерв: 4 GiB при 8–18 GiB RAM; 6 при 24; 8 при 32–36; 10 при 48; 12 при 64; 16 при 96–128. Это редакционное допущение, не норматив Apple. Из остатка после весов ещё оплачиваются кеши и буферы. Если открыт тяжёлый проект, браузер или видеоредактор, резерв придётся увеличить.
Единицы также важны: 1 GB — 1 000 000 000 байт, 1 GiB — 1 073 741 824. Например, файл Qwen3.8-27B Q4_K_M размером 16 810 714 336 байт занимает 16,81 GB, или 15,66 GiB. На машине с 24 GiB после него и нашего резерва 6 GiB остаётся лишь 2,34 GiB для остальных расходов. Поэтому этот вариант здесь пограничный, хотя меньшая сборка той же модели могла работать.
С чего начать при 8–128 GiB RAM
Условия таблицы: одна модель, один запрос, текстовый ввод и начальный контекст 2048 токенов на 8 GiB либо 4096 на остальных конфигурациях. Это короткая проба чата, а не режим воспроизведения бенчмарков или заявленного максимального контекста. Для Qwen3.5/3.8 сложное длинное рассуждение при таком ограничении может обрываться. Все размеры ниже относятся только к весам.
| RAM | Разумный старт | Что учитывать |
|---|---|---|
| 8 GiB | Qwen3-1.7B Q8_0 · 1,71 GiB | Простой текст; Qwen3.5-4B Q4_K_M — следующий опыт, не исходная рекомендация. |
| 16 GiB | Qwen3-8B Q4_K_M · 4,68 GiB | Для меньшего расхода — Qwen3.5-4B Q4_K_M, 2,52 GiB. |
| 18 GiB | Qwen3-14B Q4_K_M · 8,38 GiB | При тяжёлых приложениях вернитесь к 8B; 18 GiB бывают у M3 Pro. |
| 24 GiB | Qwen3-14B Q5_K_M · 9,79 GiB | Gemma 4 12B Q4_0 — альтернатива, 6,72 GiB; Qwen3.8-27B Q4 — пограничный. |
| 32 GiB | Qwen3.8-27B Q4_K_M · 15,66 GiB | Для кода — Coder-30B-A3B Q4_K_M, 17,35 GiB, после оценки движка. |
| 36 GiB | Qwen3.8-27B Q4_K_M · 15,66 GiB | Coder-30B-A3B Q4_K_M; Qwen3-32B Q4_K_M, 18,40 GiB — текстовая альтернатива. |
| 48 GiB | Qwen3.8-27B Q8_0 · 27,05 GiB | Можно оставить Q4 и отдать запас документам; Q8 не обещает лучшего ответа. |
| 64 GiB | Qwen3.8-27B Q8_0 · 27,05 GiB | Для кода Coder Q8_0, 30,25 GiB; Qwen3-32B Q8_0 — 32,43 GiB. |
| 96 GiB | gpt-oss-120b MXFP4 · 59,03 GiB | Для проб сложных текстовых задач; простой чат разумно оставить на 27B. |
| 128 GiB | gpt-oss-120b MXFP4 · 59,03 GiB | Больше запаса для контекста; это не гарантия скорости и не совет занять всю RAM. |
Строки не образуют лестницу качества. На 64 GiB вполне разумно пользоваться моделью из строки 16 GiB, если её ответы устраивают. Наоборот, gpt-oss-120b на 64 GiB не рекомендуем: один файл занимает 59,03 GiB, оставляя меньше нашего резерва даже без кеша. Обход ограничений памяти движка не превращает такую конфигурацию в удобную.
Какие именно файлы искать
Имя модели недостаточно: откройте репозиторий и вкладку Files, сравните полное имя файла. Размеры проверены по метаданным Hugging Face; сами многогигабайтные веса для этой статьи не скачивались. Ссылки на карточки и репозитории перечислены в источниках; точные ревизии и байтовые размеры сохранены в редакционном отчёте.
| Репозиторий / файл | GB / GiB |
|---|---|
| Qwen/Qwen3-1.7B-GGUF / Qwen3-1.7B-Q8_0.gguf | 1,83 / 1,71 |
| lmstudio-community/Qwen3.5-4B-GGUF / Qwen3.5-4B-Q4_K_M.gguf | 2,71 / 2,52 |
| Qwen/Qwen3-8B-GGUF / Qwen3-8B-Q4_K_M.gguf | 5,03 / 4,68 |
| Qwen/Qwen3-14B-GGUF / Qwen3-14B-Q4_K_M.gguf | 9,00 / 8,38 |
| Qwen/Qwen3-14B-GGUF / Qwen3-14B-Q5_K_M.gguf | 10,51 / 9,79 |
| ggml-org/gemma-4-12B-it-GGUF / gemma-4-12B-it-Q4_0.gguf | 7,22 / 6,72 |
| lmstudio-community/Qwen3.8-27B-GGUF / Qwen3.8-27B-Q4_K_M.gguf | 16,81 / 15,66 |
| lmstudio-community/Qwen3.8-27B-GGUF / Qwen3.8-27B-Q8_0.gguf | 29,05 / 27,05 |
| lmstudio-community/Qwen3-Coder-30B-A3B-Instruct-GGUF / Qwen3-Coder-30B-A3B-Instruct-Q4_K_M.gguf | 18,63 / 17,35 |
| lmstudio-community/Qwen3-Coder-30B-A3B-Instruct-GGUF / Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf | 32,48 / 30,25 |
| Qwen/Qwen3-32B-GGUF / Qwen3-32B-Q4_K_M.gguf | 19,76 / 18,40 |
| Qwen/Qwen3-32B-GGUF / Qwen3-32B-Q8_0.gguf | 34,82 / 32,43 |
| ggml-org/gpt-oss-120b-GGUF / gpt-oss-120b-MXFP4.gguf | 63,39 / 59,03 |
Официальные GGUF Qwen3 здесь опубликованы аккаунтом Qwen. Сборки Qwen3.5 и Qwen3.8 — работа LM Studio team; Coder в lmstudio-community квантизировал bartowski. GGUF Gemma и gpt-oss конвертирует ggml-org. Это первоисточники конкретных файлов, но не независимая проверка их качества и не авторы исходных моделей.
Отдельный вариант — mlx-community/Qwen3.8-27B-4bit: три файла model-00001-of-00003.safetensors, model-00002-of-00003.safetensors и model-00003-of-00003.safetensors вместе дают 16,05 GB / 14,95 GiB. Нужны также конфигурация, токенизатор и совместимый движок. Это не GGUF; переименование расширения не конвертирует модель. Карточка указывает конвертацию через mlx-vlm 0.6.8, а не подтверждённую скорость на вашем Mac.
Русский чат, программирование и документы
- Для русского чата начните с выбранного компактного Qwen: попросите переписать собственный абзац, сохранить имена и числа, ответить без англицизмов. Многоязычность заявлена разработчиком; аккуратность русского именно в вашей задаче проверяется отдельно.
- Для кода от 32 GiB рассмотрите Qwen3-Coder-30B-A3B-Instruct. По карточке это 30,5 млрд параметров всего и 3,3 млрд активных; работает без thinking-блоков. Просите небольшое изменение и проверяйте его тестами. Модель сама по себе не получает доступ к проекту и терминалу.
- Для документов важны сохранение цитат и отсутствие выдумок. Сначала дайте короткий текст с известным ответом, затем спросите о том, чего там нет. Длинный PDF дополнительно требует извлечения текста либо OCR; поисковый механизм приложения может передавать модели только часть документа.
- Для изображений у Qwen3.5/3.8 нужна поддержка зрения конкретным движком. В выбранных GGUF-репозиториях есть отдельные mmproj: у 4B — 0,68 GB, у 27B — 0,93 GB. Их нет в таблице текстовых весов. Gemma 4 12B заявляет также аудио; карточка не доказывает работу аудио и видео в выбранной версии LM Studio.
MoE означает смесь экспертов: на очередном токене работают лишь некоторые части модели, но в обычном локальном размещении хранятся веса всей модели. Поэтому A3B в названии Coder не означает файл размером как у 3B. Аналогично gpt-oss-120b имеет 117 млрд параметров всего и 5,1 млрд активных; MXFP4 относится к представлению его MoE-весов. Объём RAM сам по себе ничего не говорит о времени ответа. Для gpt-oss движок должен правильно применять формат диалога Harmony; обычный текстовый шаблон не является заменой.

Как проверить выбор на своём Mac
- Зафиксируйте чип, физическую память, версию приложения и точный файл с квантизацией. На диске должно хватать места для всего комплекта файлов, а не одного шарда.
- Если модель уже скачана и CLI LM Studio доступен, получите её ключ через lms ls. Выполните оценку ниже с этим ключом. Флаг estimate-only по документации не загружает модель; результат всё равно остаётся оценкой.
- Для пробного запуска выберите короткий контекст и один запрос. Посмотрите в «Мониторинге системы» вкладку «Память»: важны нагрузка на память, сжатие и изменение swap, а не одна цифра свободной RAM.
- Проверьте свою задачу на коротком известном примере. Сравните фактический ответ с исходником или выполните тест кода. Затем увеличивайте документ и контекст по одному параметру, наблюдая память и отзывчивость компьютера.
lms ls
lms load --estimate-only "MODEL_KEY" --context-length 4096MODEL_KEY заменяется ключом из lms ls. Для 8 GiB замените 4096 на 2048. Команды lms приведены по актуальной документации; исполнение CLI в рамках нашего теста не воспроизводилось. Если при реальном запуске растёт swap и компьютер становится неотзывчивым, уменьшите контекст или выберите меньшие веса. Не увеличивайте системные лимиты памяти только ради зелёного индикатора загрузки.
Что проверено редакцией
9 сентября 2026 года другой редакционный запуск проверил LM Studio 0.4.23+1 на macOS 27.0 arm64 с 24 GiB RAM. Уже загруженная владельцем qwen/qwen3.8-27b с отображаемым размером 16.08 GB ответила на простое сложение и три вопроса по небольшому TXT, включая отсутствие указанного бюджета. В отчёте записаны контекст 4096 и parallel 4; параллельная нагрузка не испытывалась.
Дополнительная сверка raw lms ls и My Models уточнила эту конкретную тестовую конфигурацию: qwen/qwen3.8-27b отображалась как MLX 4bit с sizeBytes 16081678492 (16.08 GB). Это наблюдение относится к реально загруженному пользователем файлу, а не к GGUF-строкам или MLX-варианту в таблице. Оно не меняет расчёты и не подтверждает ни одну из 14 рекомендаций: их по-прежнему нужно проверять для конкретного файла и Mac.