AI-модели · Учебное пособие 01

Уровни моделей ИИ: как сравнивать LLM

Выбирайте модель ИИ по рабочей нагрузке, а не по рейтингу в таблице лидеров. Эта четырехуровневая структура поможет вам найти самую дешевую модель, которая справится с задачей.

Рука направляет бумажные задания через четыре ступени механической модели-башни.
Время чтения
9 мин
Последнее обновление
Июнь 2026

0 из 6 завершено

Завершить & далее →

Последнее тестирование и обновление: Июнь 2026

Десятки AI-моделей будут выпущены в 2026 году. Выбор неправильной модели обходится вам в часы каждую неделю.

Большинство руководств отвечает на это с помощью таблицы лидеров, ранжированной от S до D. Это может быть полезной отправной точкой, но плохим руководством для конкретной работы. Спросите, какой уровень соответствует выполняемой вами работе, а не какая модель находится в верхней части чужой таблицы.

Почему таблицы лидеров вводят в заблуждение

Выбирайте нагрузку, а не модель. Дешёвая делает новостное сведение на 95% так же хорошо за одну двадцатую стоимости.

А теперь более сложная задача: “Рефакторинг слоя аутентификации моего рабочего приложения, написание миграции, запуск тестов, исправление всего, что ломается.” Дешёвая модель терпит неудачу в половине случаев. Дорогая успешна в 80% случаев. Разрыв между уровнями реальный. Дело не в том, что «модель А умнее»: дело в том, что она «более надёжна для этого конкретного типа работы.»

Модель, которая выигрывает в таблице лидеров, может не быть той, которая работает лучше всего всю неделю. Ваши рабочая нагрузка, бюджет и терпимость к «почти правильному» ответу определяют уровень.

Четыре практических уровня

В этом уроке модели ИИ разделены на четыре уровня. Рассматривайте уровни как схему маршрутизации вашей рабочей нагрузки, а не как очередную таблицу лидеров.

Пирамида уровней: Уровень 1 (Claude Opus 4.8 / Claude Max), Уровень 2 (GPT 5.4 / Gemini 3 Pro / Sonnet 4.7), Уровень 3 (Kimi K2.7 / Qwen 3.5 / MiniMax M3 / Grok 4), Уровень 4 (DeepSeek V4 Flash / GLM 5 / локальные 7B-20B)

Уровень 1: Пограничный. Claude Opus 4.8 и Claude Max. Класс Mythos в сложных рассуждениях. Самые дорогие модели за токен и самые способные к многоэтапной работе. Используйте их, когда задача действительно сложная и «почти правильно» неприемлемо.

Уровень 2: Пограничный-Сильный. GPT 5.4, Gemini 3 Pro, Claude Sonnet 4.7. На несколько пунктов от уровня 1, часто за небольшую часть стоимости. Оптимальный вариант для агентного кодирования.

Уровень 3: Ежедневное использование. Kimi K2.7, Qwen 3.5, MiniMax M3, Grok 4. Справляются с 80% задач, которые несложные: суммаризация, написание черновиков, вопросы и ответы, извлечение данных, проверка кода, заметки с совещаний. Дешевле уровня 2 в 3–10 раз. На это вы потратите больше всего токенов.

Уровень 4: экономичный. DeepSeek V4 Flash, GLM 5 и открытые модели с весами 7B–20B, которые можно запускать локально. Массовые задачи, обработка больших объемов, фоновые задачи: перевод, классификация, извлечение данных, пакетная суммаризация. Также используется как резервный вариант, когда не хочется отправлять конфиденциальные данные в Frontier API.

«Лучшая модель» — это вопрос нагрузки, а не таблицы лидеров. Передовые модели не «умнее» обычных моделей в абсолютном смысле. Они настраиваются для другого типа задач. Ошибка заключается в том, чтобы платить передовые цены за обычную работу или запускать критические задачи на экономичных моделях и удивляться, почему это не работает.

Руководствуйтесь стоимостью ошибки

Выбирайте по стоимости ошибки. Высокая стоимость ошибки → переходите на более высокий уровень. Низкая стоимость ошибки → снижаем уровень. Большинство пользователей используют Ежедневно Уровень 3, для сложных задач Уровень 1 или 2, Уровень 4 — в фоновом режиме. Вот грубая схема соответствия рабочей нагрузки и уровней:

НагрузкаВыбратьПочему
Многодневный синтез исследований, решения по новым архитектурамУровень 1 (Opus 4.8, Claude Max)Требуется глубина, сохранение контекста на длительное время, готовность платить $20+ за задачу.
Сложное агентное кодирование, комплексные рефакторинги, многофайловые миграцииУровень 2 (Сонет 4.7, GPT 5.4, Gemini 3 Pro)Почти на переднем крае за 1/3–1/5 стоимости. Оптимальная точка для агентного кодирования.
Ежедневные вопросы и ответы, составление черновиков, проверка кода, заметки с собранийУровень 3 (Kimi K2.7, Qwen 3.5, MiniMax M3)Выполняет 80% работы за небольшую часть стоимости. Смотрите L03: Китайские модели с открытым весом.
Массовое извлечение, перевод, классификация, пакетные задания или данные с повышенной конфиденциальностью, которые вы не хотите выводить с ноутбукаУровень 4 (DeepSeek V4 Flash, GLM 5, локальные 7B-20B)Предназначен для больших объёмов или только локального запуска. Качество «достаточно хорошее», не «передовое». Смотрите L04: Экономичный уровень.

Для более детального сравнения, когда вы попробуете эти уровни, смотрите L05: Передовые против моделей с открытым весом: Рамки принятия решений. Для семьи Anthropic конкретно, L02: Семья Anthropic проходит через Opus, Sonnet и остальную часть линейки.

Планируйте свои еженедельные задачи

Упражнение

Откройте текстовый файл. Запишите ответ на это своими словами, не копируя:

«Выберите три задачи, которые вы выполняете каждую неделю. Для каждой из них укажите уровень, к которому она относится, и одну модель из этого уровня. Затем оцените, сколько токенов в неделю этот уровень стоит по текущим ценам.»

Хороший ответ указывает уровень для каждой задачи, конкретную модель для этого уровня и примерно количество токенов.

Что дальше

Проверьте свое понимание

В1.Вопрос «какая AI модель лучшая?» лучше переформулировать так:
В2.Какой уровень является правильным по умолчанию для «ежедневных вопросов и ответов, составления черновиков, проверки кода, заметок с совещаний»?
В3.Вам нужно переработать миграцию из нескольких файлов в продакшене с тестами. К какому уровню вы должны обратиться в первую очередь?
В4.Краткий ответ: назовите одну рабочую нагрузку, которая относится к четвертому уровню, и объясните, почему вы выбрали бы четвертый уровень вместо третьего для неё.
В5.Согласно исходному видео, что на самом деле означает «S-уровень» в таблице лидеров моделей?
В6.Правда или ложь: «Модели Frontier умнее моделей для ежедневного использования в абсолютном смысле». Объясните в одном предложении.