Кейс продукта · 26 августа 2026
Руководство по покупке M5 Max и M5 Ultra Mac Studio
Сравните память и пропускную способность M5 Max и M5 Ultra, доступные AI модели, заявления Apple о производительности и реальность кластеров Mac Studio с 512 ГБ.

M5 Max — это сбалансированный Mac Studio для локальных моделей на 70B, творческой работы и до 128 ГБ памяти. M5 Ultra оправдывает свою цену, когда измеряемая рабочая нагрузка требует более 128 ГБ, пропускной способности 1,2 ТБ/с, мощных медиа-двигателей или нескольких пользователей. Уровень в 256 ГБ может вместить артефакт DeepSeek V4 Flash 4-bit размером 151 ГБ; поздний октябрьский уровень в 512 ГБ может вместить артефакт GLM-5 4-bit размером 419 ГБ. Ни один из этих фактов не доказывает полезной скорости генерации, и один Studio не может вместить приблизительно 2,8T-параметрическую Kimi K3 в 4-bit.
Новый Mac Studio имеет одну выдающуюся характеристику: до 512 ГБ объединённой памяти, доступной GPU. Это делает возможным использование локальных версий некоторых моделей класса 150B–400B без обычного сервера с несколькими GPU. Это не делает их автоматически быстрыми, совместимыми или экономичными.
Studio Apple 2026 года выпускается с M5 Max или M5 Ultra. M5 Max начинается с $2,499 в США; M5 Ultra начинается с $5,499. Предзаказы открыты с 25 августа, массовые поставки начнутся 22 сентября, а конфигурация на 512 ГБ ожидается в конце октября. Независимые обозреватели еще не получили единицу для тестирования, поэтому все показатели производительности нового оборудования остаются утверждениями Apple на момент запуска.
M5 Max против M5 Ultra
| Выбор | CPU / GPU | Унифицированная память | Пропускная способность | Максимальный объем памяти | Начальная цена | Роль локального ИИ |
|---|---|---|---|---|---|---|
| Базовая версия M5 Max | 18-ядерный ЦП / 32-ядерный ГП | 36ГБ | 460GB/s | До 8 ТБ | $2,499 | Быстрый 27B; выбранные крупные кванты |
| M5 Max с высокой производительностью графики | 18-ядерный ЦП / 40-ядерный ГП | 48 ГБ, 64 ГБ или 128 ГБ | 614GB/s | До 8 ТБ | Зависит от конфигурации | Модели 70B, крупные творческие задачи, выбранные кванты класса 100B |
| Базовая версия M5 Ultra | 30-ядерный ЦП / 64-ядерный ГП | 96ГБ | 1.2TB/s | До 16 ТБ | $5,499 | Высокоточные квантизированные модели 70B и больше |
| M5 Ultra высшего уровня | 36-ядерный ЦП / 80-ядерный ГП | 256 ГБ или 512 ГБ | 1.2TB/s | До 16 ТБ | Зависит от конфигурации | 150B–400B класс, 4-битные артефакты, эксперименты с дообучением, мультипользовательский сервис |
M5 Ultra объединяет четыре кристалла с помощью упаковки UltraFusion от Apple. Компания указывает более 4,4 ТБ/с пропускной способности между кристаллами, 32-ядерный Neural Engine и нейронные ускорители в каждом ядре ГП. M5 Max имеет 16-ядерный Neural Engine и те же ускорители, но в меньшем масштабе.
Вариант на 512 ГБ требует конфигурации с 36-ядерным ЦП и 80-ядерным ГП. Не сравнивайте базовую цену $5,499 с полностью оснащённой машиной на 512 ГБ так, как если бы это был один и тот же продукт.
Что могут вместить уровни памяти
36 ГБ или 48 ГБ M5 Max
Эти уровни являются быстрыми платформами для моделей 27B 4-бит, локальных помощников по программированию, транскрипции, генерации изображений и профессиональных креативных приложений. Система на 48 ГБ может загружать некоторые более крупные кванты, но обычные пакеты 70B 4-бит оставляют мало или совсем не оставляют полезного рабочего пространства.
64 ГБ M5 Max
Это практический вход во многие 70B 4-бит артефакты. Модель, квантизация и контекст по-прежнему имеют значение. Закрывайте другие приложения с высоким потреблением памяти при проверке маргинальной совместимости. Более высокая пропускная способность и количество GPU делают это более убедительным выбором для 70B, чем мини M5 Pro на 64 ГБ.
128 ГБ M5 Max
Это сбалансированная высококлассная локальная AI-студия: модели 70B с полезным запасом, модели меньшей точности, модели выбранного класса 100B или квантованные модели с множеством экспертов, генерация изображений и видео, а также несколько меньших моделей или пользователей. Это все еще слишком мало для текущих 151 ГБ. Артефакт DeepSeek V4 Flash 4-бит MLX.
96 ГБ M5 Ultra
Базовый Ultra — это покупка вычислительных ресурсов и пропускной способности больше, чем покупка емкости. Он может запускать модели 70B с более высокой точностью или более крупные квантованные модели, но его 96 ГБ не превышают потолок 128 ГБ у M5 Max. Выбирайте его, когда важны дополнительные CPU/GPU, медиа, пропускная способность или параллельность, а не просто потому, что «Ultra» звучит более готовым к ИИ.
256 ГБ M5 Ultra
Это первый принципиально новый уровень емкости. DeepSeek V4 Flash 4-бит занимает примерно 151ГБ, оставляя место для времени выполнения, контекста и macOS. Это также позволяет проводить более крупные эксперименты по дообучению и использовать несколько моделей одновременно. DeepSeek описывает V4 Flash как модель с 284 миллиардами параметров типа «смесь экспертов» с 13 миллиардами активных параметров; разреженная активация может сократить вычисления на токен, но сохранённые веса все равно требуют памяти.
512 ГБ M5 Ultra
С GLM-5 4-битный артефакт MLX около 419ГБ. Она может поместиться в 512 ГБ с ограниченной, но значимой оставшейся ёмкостью. Контекст, буферы времени выполнения и другие приложения всё ещё нужно измерять. Загрузка модели — это только первый тест; скорость интерактивного вывода — второй.
Дата конца октября имеет значение, если это причина покупки. Не следует ожидать поставки 512 ГБ в сентябре.
Kimi K3 и заявление о «кластер из триллиона параметров»
Выдающийся пост в X предсказал, что четыре студии M5 Ultra с 512 ГБ могут запускать модели, такие как Kimi K3 или GLM-5.3, со скоростью выше 100 токенов в секунду. Это обоснованное ожидание, а не результат тестирования оборудования.
Kimi описывает K3 как модель примерно с 2,8 триллионами параметров и контекстом на один миллион токенов. При четырёх битах одни только сырые веса будут занимать около 1,4 ТБ без учёта метаданных, кэша и накладных расходов во время работы. Таким образом, она не поместится на одной студии с 512 ГБ. Четыре машины теоретически обеспечивают достаточно совокупной памяти, но только распределённое программное обеспечение может превратить эту совокупную память в используемую модель.
Apple заявляет, что четыре узла M5 Ultra обеспечивают до 3x производительности ИИ-инференса одного узла по собственным тестам. MLX поддерживает распределённый инференс и бэкенд JACCL с использованием Thunderbolt 5 RDMA на macOS 26.2 или более поздней версии. The документация по настройке требует включения RDMA, перезагрузки, настройки файлов хоста и создания полностью связанной сети Thunderbolt. Это небольшой кластер для эксплуатации, а не четыре Mac, которые автоматически обнаруживают друг друга.
A тест сообщества пятиузлового M3 Ultra запускал примерно триллион-параметровую модель Kimi-K2-Thinking 4-бит с производительностью около 13–15 выходных токенов в секунду в зависимости от топологии. Это показывает, что гигантские локальные модели могут охватывать Mac. Также это предупреждение против умножения скорости одного устройства на количество узлов.
До тех пор, пока кто-то не опубликует воспроизводимый запуск M5 Ultra Kimi K3, «более 100 токенов в секунду» относится к прогнозу.
Насколько быстрее, по утверждению Apple?
Для M5 Max Apple утверждает:
- до 3,9 раза быстрее обработка запросов LM Studio по сравнению с M4 Max;
- до 3,5 раз быстрее генерация изображений с ИИ;
- до 3 раз быстрее работа Magic Mask в DaVinci Resolve;
- до 10,7 раз быстрее обработка запросов в LM Studio по сравнению с M1 Max.
Для M5 Ultra Apple утверждает:
- до 4 раз быстрее обработка запросов в LM Studio, чем на M3 Ultra;
- до 4,3 раз быстрее генерация изображений с ИИ;
- до 3,3 раз быстрее обучение модели ИИ в тесте DaVinci Resolve CopyCat;
- до 1,7 раз быстрее рендеринг в Redshift;
- до 9,8 раз быстрее обработка запросов в LM Studio по сравнению с M1 Ultra.
Apple проводила тесты на предсерийных машинах в июле и августе 2026 года. Показатель LM Studio описывает обработку запросов, а не обязательно количество выходных токенов в секунду. Программное обеспечение, поддерживающее ускорители, может быстрее обработать длинный запрос, не достигая при этом такого же увеличения скорости во время авторегрессивной генерации.
Для решения о покупке спросите о времени до первого токена, скорости вывода по подсказке, скорости декодирования, пике памяти, энергопотреблении, уровне шума вентилятора и скорости после продолжительного запуска. Также уточните, используется ли в тесте MLX, LM Studio, llama.cpp или другое окружение; их результаты не взаимозаменяемы.
Нагрузки за пределами локального чата
Ценность Studio легче обосновать, когда одна и та же машина выполняет несколько оплачиваемых задач.
M5 Max подходит для сборок Xcode, 3D-сцен, генерации изображений высокого разрешения, видеэффектов и нескольких дисплеев вместе с локальным выводом. M5 Ultra добавляет достаточно медиапроцессоров, чтобы Apple могла заявить воспроизведение до 33 потоков 8K ProRes 422 с 30 кадрами в секунду. Большая объединённая память может хранить видеокадры, 3D-ассеты, наборы данных и локальную модель без необходимости постоянного перемещения данных между отдельными пулами CPU и GPU.
Для обучения будьте точны. LoRA и другие методы тонкой настройки с эффективным использованием параметров могут быть реалистичными на MLX. Полное обучение модели уровня передовой науки не превращается в задачу для настольного компьютера только из-за 512 ГБ памяти. Исходный код для исследований, построенный на NVIDIA CUDA или vLLM, может не работать без портирования, так как ускорение GPU Apple использует Metal и MPS, а не CUDA.
Для многопользовательского вывода измеряйте конкуренцию. Одна гигантская модель, обслуживающая несколько пользователей, может оправдать использование Ultra лучше, чем один человек, ожидающий случайных ответов. MLX-LM поддерживает генерацию, кэширование, тонкую настройку и распределённую работу; LM Studio предлагает более удобный путь через настольный компьютер и локальный сервер. Выбранное приложение должно поддерживать архитектуру модели и квантизацию, которую вы намерены использовать.
Экономический тест
Правильное сравнение — это не «512 ГБ Mac против дорогого облака». Рассчитайте рабочую нагрузку:
- запросы или часы обучения в месяц;
- модель и контекст, необходимые для приемлемого качества;
- измеренная локальная и облачная пропускная способность;
- электричество, хранение, поддержка и время оператора;
- стоимость API или аренды GPU, которую удалось избежать;
- остаточная стоимость и срок службы.
Mac с большим объёмом памяти может быть привлекательным для работы с приватными данными, офлайн-доступа, предсказуемого повторного использования и рабочих нагрузок, которые также выигрывают от творческих инструментов macOS. Облако остаётся лучшим для прерывистой работы, программного обеспечения специфичного для CUDA, случайного доступа к очень большим моделям и масштабирования без владения простаивающим оборудованием.
Конфиденциальность также не является автоматической. Локальная модель сохраняет подсказки на устройстве только в том случае, если то же самое делают приложения, плагины, телеметрия и настройки резервного варианта. Проверьте весь рабочий процесс.
Какую студию вам следует купить?
Выберите M5 Max 64GB для специализированной рабочей станции 70B с 4-битным процессором и обычной профессиональной работы.
Выберите M5 Max 128GB для комфортной работы с 70B, выбранными большими квантами, одновременным запуском творческих приложений или нескольких меньших сервисов. Это, вероятно, оптимальный вариант для серьезных индивидуальных пользователей.
Выберите M5 Ultra 96GB только когда вычислительные возможности Ultra, медиа-движки, пропускная способность 1.2ТБ/с или параллельные процессы важнее, чем более высокая 128GB емкость M5 Max.
Выберите M5 Ultra 256GB когда именованный артефакт превышает 128 ГБ — DeepSeek V4 Flash 4-бита является конкретным примером — или требуется измеренное параллельное использование.
Выберите M5 Ultra 512 ГБ когда 400B-классовая квантованная модель, такая как GLM-5, является частью проверенного рабочего процесса. Учитывайте её доступность в конце октября и протестируйте, будет ли скорость вывода полезна, прежде чем принять решение.
Не покупайте четыре Studio, основываясь на прогнозе скорости токена. Создайте или воспроизведите эксперимент с двумя узлами, подтвердите топологию и владение программным обеспечением, и сначала оцените полную стоимость кластера по сравнению с обычной GPU-инфраструктурой.
Ждать если покупка зависит от независимой скорости вывода токенов, акустики, совместимости с приложениями третьих сторон или использования ускорителя. 22 сентября начинается этот цикл подтверждения.
Вердикт
M5 Max — это универсально полезный Studio: достаточно пропускной способности и памяти для моделей 70B, высокая креативная производительность и потолок в 128 ГБ. M5 Ultra — специализированная инфраструктура. Его варианты на 256 ГБ и 512 ГБ действительно делают возможным использование гораздо более крупных локальных моделей, но ёмкость — это не производительность, а заявления о запуске не являются независимыми результатами.
Покупайте Ultra, если измеренная задача превышает 128 ГБ или использует его расширенные рабочие возможности. В противном случае M5 Max — или mini M5 Pro — является более рациональным выбором.
Для анализа чипа в диапазоне и исправленных заявлений о запуске прочитайте Новый Mac mini и Mac Studio от Apple для локального AI.
Источники
- Apple: анонс Mac Studio с M5 Max и M5 Ultra
- Apple: технические характеристики Mac Studio
- Apple: конфигурация и цены Mac Studio в США
- Apple: архитектура M5 Ultra, кластеризация и раскрытие тестов
- MLX: распределённое инференс и настройка Thunderbolt 5 JACCL
- Сообщество MLX: тест на пяти узлах M3 Ultra Kimi-K2-Thinking
- Сообщество MLX: артефакт DeepSeek V4 Flash 4-бит
- Сообщество MLX: артефакт GLM-5 4-бит
- Kimi: анонс модели K3 и архитектура
- Алекс Чима в X: Mac Studio 512 ГБ и прогнозирование кластеров
- Статья BaseRT: обработка ускорителя запросов против декодирования
Запустите это в работу
Разделяйте ёмкость модели, пропускную способность запроса, пропускную способность генерации, совместимость программного обеспечения и многопользовательскую параллельность при выборе рабочих станций.
Попробовать
Воспроизведите целевой рабочий процесс на текущем Apple Silicon или арендованном оборудовании и зафиксируйте размер артефакта, контекст, скорость вывода, использование и время проверки человеком.
Докажите, что это сработало
Заказывайте Ultra только когда рабочая нагрузка превышает 128 ГБ или другая возможность Ultra имеет измеренное значение выше своей конфигурационной надбавки.
Где это может оплатить
Студия может заменить измеряемый вывод или аренду GPU для повторяющихся приватных рабочих нагрузок, но низкая загрузка может сделать даже технически успешный локальный вывод экономически невыгодным.
Держите в поле зрения
- M5 Max предлагает до 128 ГБ и 614 ГБ/с; M5 Ultra предлагает 96 ГБ, 256 ГБ или 512 ГБ и 1,2 ТБ/с.
- DeepSeek V4 Flash 4-бит около 151 ГБ и GLM-5 4-бит около 419 ГБ, что делает 256 ГБ и 512 ГБ принципиально разными уровнями ИИ.
- Apple сообщает до 4х ускорения обработки подсказок LM Studio по сравнению с M3 Ultra и до 3х вывода для четырех узлов M5 Ultra, но независимые единицы не были поставлены.