Руководство по выпуску · 26 августа 2026

M6 Mac mini против M5 Mac Studio для локального ИИ

M6 Mac mini и M5 Max/Ultra Mac Studio от Apple обещают значительный рост возможностей ИИ. Вот что изменяют чипы, какие модели подходят и какие заявления нуждаются в доказательстве.

Время чтения
16 мин
Проверено
26 августа 2026 г.
Мак мини из бумаги, вырезанный вручную, и более высокий Mac Studio сортируют небольшие и очень большие локальные наборы моделей ИИ по дорожкам памяти разной ширины
Та же идея локального ИИ охватывает мини за 899 долларов и Studio с 512 ГБ; память определяет, где заканчивается каждая рабочая нагрузка
Итог

Настольные компьютеры Apple 2026 года необычно способны работать с локальным ИИ, потому что их GPU могут работать внутри одного большого пула объединённой памяти. Практический диапазон, однако, варьируется от небольших моделей 7B–14B на 16 ГБ M6 Mac mini до квантизированных моделей уровня 400B на 512 ГБ M5 Ultra Mac Studio. Покупайте исходя из объёма и пропускной способности памяти, а не из-за заявленного Apple множителя. Каждое числовое значение производительности нового оборудования остаётся заявлением Apple до тех пор, пока независимые машины не поступят в продажу 22 сентября.

Apple превратила свои самые маленькие и самые мощные настольные компьютеры в одну линейку с локальным ИИ. Новая Mac mini поставляется с M6 или M5 Pro. Новый Mac Studio поставляется с M5 Max или M5 Ultra. Предзаказы открыты с 25 августа 2026 года, а общая доступность начинается 22 сентября; вариант Studio с 512 ГБ появится в конце октября.

Этот график — первый факт, который стоит запомнить. Apple опубликовала характеристики и свои собственные предпродукционные тесты, но у клиентов и независимых обзорщиков пока нет действующих устройств. Утверждения вроде «ИИ в 4,8 раза быстрее» служат доказательством на момент запуска, а не результатами независимого бенчмарка.

Второй факт важнее, чем названия чипов: объединённая память — это настоящая лестница продукта. Mac mini за $899 имеет 16 ГБ. Топовая M6 mini имеет 32 ГБ, M5 Pro достигает 64 ГБ, M5 Max достигает 128 ГБ, а M5 Ultra достигает 512 ГБ. Этот диапазон определяет, загрузится ли модель вообще.

Диапазон на первый взгляд

Рабочий столВарианты CPU и GPUУнифицированная памятьПропускная способность памятиНачальная цена в СШАРазумная роль локального ИИ
Mac mini, M612-ядерный CPU, 12-ядерный GPU16 ГБ, 24 ГБ или 32 ГБДо 170 ГБ/с$899Модели 7B–14B; 27B 4-битные с достаточной памятью и сдержанным контекстом
Mac mini, M5 Pro15- или 18-ядерный CPU; 16- или 20-ядерный GPU24 ГБ, 48 ГБ или 64 ГБ307GB/s$1,699Модели 27B с запасом; 70B 4-битные при 64 ГБ с дисциплиной контекста
Mac Studio, M5 Max18-ядерный CPU; 32- или 40-ядерный GPU36 ГБ, 48 ГБ, 64 ГБ или 128 ГБ460 ГБ/с или 614 ГБ/с$2,499Модели на 70 млрд параметров, большие смеси экспертов, генерация изображений, более тяжелая параллельная работа
Mac Studio, M5 UltraCPU на 30 или 36 ядер; GPU на 64 или 80 ядер96 ГБ, 256 ГБ или 512 ГБ1.2TB/s$5,499Квантованные модели класса 100–400 млрд, локальные эксперименты по обучению, инференс для нескольких пользователей

Эти диапазоны моделей являются плановыми оценками, а не гарантиями. Точное использование памяти изменяется в зависимости от квантования, длины контекста, кэша ключ-значение, времени выполнения, размера партии и того, открыты ли другие приложения. Файл модели, который меньше установленной памяти, все равно может вызвать сбой или замедление, когда среде выполнения требуется рабочее пространство.

Что изменилось в M6, M5 Pro, M5 Max и M5 Ultra

Новая архитектура GPU от Apple обеспечивает Нейронный ускоритель в каждом ядре GPU. Это отдельное устройство от выделенного нейронного движка: чипы M6 и M5 Pro/Max имеют 16-ядерный нейронный движок, в то время как M5 Ultra имеет 32-ядерную версию. Поддерживаемое программное обеспечение может использовать GPU, нейронный движок или оба.

M6 имеет 12-ядерный CPU, состоящий из двух «суперъядер», четырех производительных ядер и шести энергоэффективных ядер. Его 12-ядерный GPU разработан, чтобы ускорить базовую модель Mac при смешанных творческих и AI-задачах без увеличения размера корпуса. Apple заявляет, что производительность CPU возрастает до 40 процентов, а графики до 2 раз по сравнению с M4, в то время как производительность SSD удваивается.

M5 Pro обеспечивает пропускную способность памяти до 307 ГБ/с и до 20-ядерного GPU. Эта пропускная способность важна при генерации токенов, поскольку во время выполнения модельные веса неоднократно перемещаются через память. Также он поддерживает Thunderbolt 5, что становится важным для быстрой работы с хранилищем, дисплеями и сложной многомашинной работой.

M5 Max увеличивает пропускную способность до 460 ГБ/с в базовой конфигурации или до 614 ГБ/с с более крупным GPU и предоставляет до 128 ГБ памяти. Для многих серьёзных индивидуальных пользователей это является полезным средним вариантом: гораздо больше возможностей для модели, чем у mini, без затрат на Ultra.

M5 Ultra — это другой уровень. Apple объединяет четыре кристалла с помощью UltraFusion, обеспечивает пропускную способность памяти 1,2 ТБ/с и предлагает 36-ядерный CPU, 80-ядерный GPU, 32-ядерный Neural Engine и 512 ГБ объединённой памяти. Apple утверждает, что пакет имеет более 4,4 ТБ/с пропускной способности между кристаллами. Это конфигурация, которая может работать с моделями, которые обычно требуют рабочей станции или сервера с несколькими GPU.

Что показатели ИИ Apple доказывают и не доказывают

Apple тестировала все четыре настольных компьютера в июле и августе 2026 года на предсерийном оборудовании. Основные результаты LM Studio сравниваются обработка запроса, этап, на котором модель считывает и кодирует входные данные, а не только привычную скорость вывода токенов.

Новая системаЗаявление Apple о обработке запросов в LM StudioСравнительная система
M6 Mac miniДо 4,8xM4 Mac mini
M5 Pro Mac miniДо 4xM4 Pro Mac mini
M5 Max Mac StudioДо 3,9xM4 Max Mac Studio
M5 Ultra Mac StudioДо 4xM3 Ultra Mac Studio

Apple также заявляет, что M5 Max до 3,5x быстрее при генерации AI-изображений, а M5 Ultra до 4,3x быстрее по сравнению с их прямыми предшественниками. Компания сообщает о росте производительности в 3,3x для нагрузки DaVinci Resolve AI training на M5 Ultra. Это значимые показатели того, что программное обеспечение использует новые ускорители, но они не предсказывают каждую модель или среду выполнения.

Обработка и генерация запросов различны. A Исследовательская статья BaseRT иллюстрирует разрыв на более раннем устройстве M5 Pro: обработка запросов с учетом ускорителя могла превосходить MLX до 3,9 раза по результатам тестов авторов, тогда как прирост при декодировании был гораздо меньше. На Qwen3.6-27B 4-бит, BaseRT генерировал 18,1 токена в секунду, а MLX — 18,4. Система может значительно ускориться при чтении длинного документа, не производя каждый новый токен в четыре раза быстрее.

Следовательно, независимые обзоры должны сообщать как минимум пять измерений:

  1. время до первого токена;
  2. скорость обработки запроса;
  3. количество выходных токенов в секунду;
  4. пиковое использование памяти при указанной длине контекста;
  5. постоянная скорость, потребление энергии и уровень шума после длительной работы.

Без такого разделения «4x AI» может описывать реальный результат и при этом вводить в заблуждение покупателя с интерактивной нагрузкой.

Что может запускать каждый уровень памяти

Самый чистый способ ответить на этот вопрос — использовать текущие файлы моделей, а не арифметику вирусных параметров. Квантизация в 4 бита обычно требует примерно половины байта на параметр для весов, плюс метаданные и накладные расходы на выполнение. Модели с множеством экспертов могут активировать только часть своих весов для каждого токена, но все сохранённые веса всё равно должны помещаться если только среда выполнения не выгружает их в другое место.

КонфигурацияПрактическое размещение моделиПримеры и ограничения
M6, 16GB7B–14B 4-битХорошо подходит для локальных ассистентов, транскрипции, компактных моделей кодирования и небольших моделей изображений. Файл модели размером 16,1 ГБ не помещается безопасно с учётом накладных расходов macOS и среды выполнения.
M6, 24GBДо примерно 27B 4-бит16.1 ГБ артефакт Qwen3.8-27B 4-бит загружается, но длинный контекст и другие приложения уменьшают резервы.
M6, 32 ГБ27B–35B 4-битЛучший класс M6 для серьезного помощника по кодированию. Это не машина на 70B.
M5 Pro, 48 ГБ27B без проблем; выбраны более крупные квантыБольше пропускной способности и места для контекста, чем у M6. Все еще тесно для типичных пакетов 70B 4-бит с учетом дополнительных затрат.
M5 Pro, 64 ГБ70B 4-бит с осторожностьюЗакройте другие ресурсоемкие приложения и выбирайте контекст осознанно. Модели 27B с более высокой точностью подойдут проще.
M5 Max, 64 ГБ70B 4-битЛучшая пропускная способность и ресурсы GPU делают его более убедительным стартом для 70B.
M5 Max, 128 ГБ70B с более высокой точностью; выбраны кванты класса 100BХорошо подходит для локального кодирования, генерации изображений, видеоинструментов и параллельных рабочих процессов. Все еще меньше, чем 151 ГБ DeepSeek V4 Flash 4-битный артефакт.
M5 Ultra, 96 ГБ70B высокоточные или более крупные квантизированные моделиБыстрая высокопроизводительная индивидуальная рабочая станция, но недостаточно для самых больших новых открытых весов.
M5 Ultra, 256 ГБ4-битные артефакты класса 150B–300BПакет 151 ГБ DeepSeek V4 Flash 4-битного MLX помещается с полезным рабочим пространством.
M5 Ultra, 512 ГБПримерно 4-битные артефакты класса 400BПакет 419 ГБ GLM-5 4-битного MLX помещается, хотя контекст и накладные расходы времени выполнения все еще требуют осторожности.

Конкретные размеры файлов взяты из текущих репозиториев сообщества MLX: Qwen3.8-27B 4-битный — 16,1 ГБ, DeepSeek V4 Flash 4-битный объемом 151 ГБ, и GLM-5 4-битный объемом 419 ГБ. Это гораздо лучшие данные для покупки, чем пост, в котором говорится, что машина «работает на 27B», не указывая квантование или контекст.

Проверяем самые громкие заявления, распространяющиеся на X

Запуск вызвал настоящий восторг у создателей локального ИИ, особенно вокруг 512 ГБ Studio. Он также стал идеальным примером того, почему важны детали конфигурации.

Один широко распространённый пост утверждал, что $899 M6 Mac mini имел 32 ГБ и мог запускать «Llama 4 8B», а Mac Studio мог запускать «Llama 4 70B». Цена указана неверно: конфигурация Apple за $899 в США имеет 16 ГБ, а не 32 ГБ. Названия моделей тоже неверные: выпущенные Meta Llama 4 Scout и Maverick являются моделями с комбинированными экспертами, а не версиями 8B и 70B. Более широкая идея — более унифицированная память позволяет создавать более крупные локальные модели — верна, но приведённые примеры этого не доказывают.

Алекс Чима отметил M5 Ultra на 512 ГБ и предсказал, что четыре связанных машины смогут запускать огромные модели, такие как Kimi K3 или GLM-5.3, с производительностью свыше 100 токенов в секунду. Аргумент о мощности правдоподобен; скорость — это прогноз, а не измерение. В момент публикации не существовало поставляемых машин M5 Ultra на 512 ГБ.

Официальное объявление Kimi о K3 описывает модель примерно с 2,8 триллиона параметров. Сырые веса в 4 бита сами по себе займут около 1,4 ТБ до учёта накладных расходов, поэтому один 512 ГБ Studio её не вместит. Кластер из четырёх узлов на бумаге имеет достаточно агрегатной памяти, но топология, поддержка программного обеспечения, контекст и накладные расходы на передачу данных определяют реальную скорость.

Следовательно, ответственное прочтение X в день запуска такое:

  • волнение по поводу 256 ГБ и 512 ГБ объединённой памяти, доступной для потребителей, оправдано;
  • потолок в 32 ГБ у M6 mini является реальным ограничением для покупателей, которые представляют модели с 70B;
  • названия моделей, квантизация, размер артефактов и контекст должны сопровождать утверждения «может запустить»;
  • прогнозы пропускной способности кластера остаются непроверенными до появления аппаратного обеспечения и воспроизводимых команд.

Какое программное обеспечение может использовать железо

LM Studio — это самый простой графический способ загрузки моделей, общения, предоставления локального API и запуска локальных или облачных рабочих процессов кодирования и агентов. Apple выбрала его для сравнительного запуска, хотя точные настройки сборки и тестирования всё ещё имеют значение.

MLX и MLX-LM — это открытая, нативная для Apple-silicon стек Apple. MLX использует объединённую память, так что массивы CPU и GPU обмениваются данными без явного копирования. MLX-LM поддерживает генерацию, кэширование подсказок, квантизацию, LoRA или полную донастройку, а также распределённое выводирование.

llama.cpp по-прежнему остается гибкой платформой для командной строки и сервера, а Ollama предлагает более простой опыт управления моделями, основанный на локальном обслуживании. Сравнение фреймворков 2025 на M2 Ultra в этом тесте обнаружил, что MLX является самым сильным для длительной генерации, MLC конкурентоспособен по времени до первого токена, llama.cpp эффективен для работы с одним потоком, а Ollama удобен, но медленнее. Рассматривайте эти относительные результаты как доказательство относительно старой тестовой системы, а не как эталон для неопубликованных чипов.

PyTorch MPS может запускать поддерживаемые тензоры и модели на GPU Mac. Тем не менее, Mac по-прежнему не предоставляет NVIDIA CUDA. Ядра, работающие только с CUDA, развертывания vLLM и исследовательский код, написанный с использованием библиотек NVIDIA, могут потребовать портирования, альтернативные бэкенды или облачный/Linux GPU. Большой объём памяти делает возможным использование модели; это не делает совместимой каждый программный стек.

Могут ли несколько Mac Studio действительно стать одной AI-машиной?

Apple теперь явно продвигает кластеризацию систем M5 Ultra. В своём тесте кластер из четырёх узлов может обеспечивать до 3 раз больше производительности вывода ИИ, чем один Mac Studio. MLX предоставляет два коммуникационных бэкенда: обычный кольцо и JACCL, которая использует Thunderbolt 5 RDMA на macOS 26.2 и новее.

Это настоящая инженерия, а не галочка в один клик. распределённая документация MLX требует включения RDMA, перезагрузки, настройки хостов и подключения полностью подключённой сети для JACCL. Опубликовано эксперимент M3 Ultra с пятью узлами запустил примерно триллион параметров с 4-битной моделью Kimi-K2-Thinking с результатом примерно 13–15 выходных токенов в секунду в зависимости от топологии. Это доказывает, что гигантские кластеры Mac работают, а также показывает, что ёмкость и линейное ускорение — это разные вещи.

Покупайте кластер только в том случае, если вы можете определить модель, параллелизм, сетевую топологию, питание, владельца программного обеспечения и финансовую отдачу. Четыре топовые студии — это инфраструктура, а не обычный настольный аксессуар.

Эти Mac не только для языковых моделей

Те же графические процессоры, медиадвижки, память и улучшения хранения данных влияют на обычную работу. Apple заявляет, что M6 может рендерить графику с трассировкой лучей до 2 раз быстрее, чем M4, в то время как M5 Pro улучшает рендеринг в Blender и работу в Affinity Photo. M5 Max ориентирован на большие сборки Xcode, 3D рендеринг, генерацию изображений с ИИ и эффекты в Resolve.

M5 Ultra имеет специализированное мультимедийное оборудование, способное воспроизводить до 33 потоков видео 8K ProRes 422 с частотой 30 кадров в секунду. Конфигурация на 512 ГБ также создает пространство для больших сцен, научных данных и нескольких тяжелых приложений одновременно. Для видео-студии, разработчика или исследователя местный ИИ может быть лишь частью оправдания покупки, а не основной целью.

Кто должен покупать какой компьютер

Выберите M6 Mac mini , если вы хотите тихий универсальный Mac, который также запускает небольшие локальные помощники. Настройте 24 ГБ для реалистичного эксперимента с 27B или 32 ГБ, если приоритетом является местный ИИ. Модель на 16 ГБ все еще полезна, но это не выгодная машина 27B, о которой говорят вирусные публикации. Прочтите Руководство по покупке Mac mini M6 перед выбором объема памяти.

Выберите M5 Pro Mac mini если 48 ГБ или 64 ГБ достаточно и вам важен мини-корпус. Это наименее дорогостоящий вариант в линейке для осторожно настроенной 70B 4-битной модели.

Выберите M5 Max Mac Studio если вам нужно 64–128 ГБ, более быстрая постоянная работа GPU, видео I/O и более комфортная работа с 70B. Для многих профессиональных пользователей локального ИИ это сбалансированная конфигурация.

Выбрать M5 Ultra только когда конкретная рабочая нагрузка требует более 128 ГБ или когда его CPU, мультимедийные возможности и многопользовательский потенциал уже оправдывают его цену. Уровень 256 ГБ — это практическое начало для моделей вроде DeepSeek V4 Flash 4-бит. Уровень 512 ГБ предназначен для исключительно крупных объектов, таких как GLM-5 4-бит, и появится позже. Прочтите Руководство по покупке Mac Studio M5 Max и M5 Ultra чтобы узнать о компромиссах в конфигурации.

Всем остальным следует дождаться независимых обзоров после 22 сентября. Попросите рецензентов протестировать именно ту модель, квантизацию, среду выполнения, длину контекста и уровень памяти, которые вы планируете использовать. Бенчмарк на M5 Ultra с 512 ГБ не отвечает на вопрос, стоит ли покупать мини с 24 ГБ.

Вердикт

Apple сделала локальный ИИ убедительной причинной для покупки настольного Mac, но не обходом планирования емкости. M6 mini — это доступная машина для небольших моделей. M5 Pro достигает серьёзного локального вывода для одного пользователя. M5 Max обеспечивает наилучшее сочетание запасов мощности и производительности рабочей станции. Уровни M5 Ultra с 256 ГБ и 512 ГБ открывают размеры моделей, которые раньше были неудобны вне серверного оборудования.

Утверждения о запуске предполагают гораздо более быстрое обработку подсказок, а архитектура объясняет причину этого. Ни одно из них не доказывает четырехкратного улучшения при обычной генерации токенов. Рассматривайте релиз 22 сентября как начало независимого тестирования, а не как окончание принятия решения.

Источники

Запустите это в работу

Переводите количество параметров модели и квантизацию в требования к памяти перед сравнением названий чипов или коэффициентов бенчмарка.

Попробовать

Выберите одну модель, которую вы действительно используете, проверьте её точный размер артефакта, затем оставьте запас для macOS, кэша контекста и приложения, прежде чем выбирать конфигурацию.

Докажите, что это сработало

Дождитесь независимых результатов по времени до первого токена, обработке подсказок, скорости генерации, энергопотреблению и устойчивой нагрузке для того уровня памяти, который вы планируете приобрести.

Где это может оплатить

Система с большим объёмом памяти на локальной машине может заменить часть работы через платный API, но только если нагрузка подходит, локальный результат достаточно быстр, а использование оправдывает стоимость оборудования.

Держите в поле зрения

  • Mac mini M6 начинается с $899 с 16 ГБ, тогда как Mac Studio M5 Ultra начинается с $5,499 с 96 ГБ и может быть сконфигурирован до 512 ГБ.
  • Apple заявляет о больших улучшениях в обработке подсказок LM Studio, но поглощение подсказки — это не то же самое, что количество токенов, генерируемых в секунду.
  • Модель 27B 4-бит составляет около 16 ГБ; DeepSeek V4 Flash 4-бит — около 151 ГБ; GLM-5 4-бит — около 419 ГБ.
  • Новые Mac начнут отгружаться 22 сентября, поэтому независимых тестов на реальных устройствах пока нет.
Изучите рабочий процесс: выберите между передовыми и открытыми моделями с весами