AI-модели · Учебное пособие 01
Уровни моделей ИИ: как сравнивать LLM
Выбирайте модель ИИ по рабочей нагрузке, а не по рейтингу в таблице лидеров. Эта четырехуровневая структура поможет вам найти самую дешевую модель, которая справится с задачей.

0 из 6 завершено
Последнее тестирование и обновление: Июнь 2026
Десятки AI-моделей будут выпущены в 2026 году. Выбор неправильной модели обходится вам в часы каждую неделю.
Большинство руководств отвечает на это с помощью таблицы лидеров, ранжированной от S до D. Это может быть полезной отправной точкой, но плохим руководством для конкретной работы. Спросите, какой уровень соответствует выполняемой вами работе, а не какая модель находится в верхней части чужой таблицы.
Почему таблицы лидеров вводят в заблуждение
Выбирайте нагрузку, а не модель. Дешёвая делает новостное сведение на 95% так же хорошо за одну двадцатую стоимости.
А теперь более сложная задача: “Рефакторинг слоя аутентификации моего рабочего приложения, написание миграции, запуск тестов, исправление всего, что ломается.” Дешёвая модель терпит неудачу в половине случаев. Дорогая успешна в 80% случаев. Разрыв между уровнями реальный. Дело не в том, что «модель А умнее»: дело в том, что она «более надёжна для этого конкретного типа работы.»
Модель, которая выигрывает в таблице лидеров, может не быть той, которая работает лучше всего всю неделю. Ваши рабочая нагрузка, бюджет и терпимость к «почти правильному» ответу определяют уровень.
Четыре практических уровня
В этом уроке модели ИИ разделены на четыре уровня. Рассматривайте уровни как схему маршрутизации вашей рабочей нагрузки, а не как очередную таблицу лидеров.
Уровень 1: Пограничный. Claude Opus 4.8 и Claude Max. Класс Mythos в сложных рассуждениях. Самые дорогие модели за токен и самые способные к многоэтапной работе. Используйте их, когда задача действительно сложная и «почти правильно» неприемлемо.
Уровень 2: Пограничный-Сильный. GPT 5.4, Gemini 3 Pro, Claude Sonnet 4.7. На несколько пунктов от уровня 1, часто за небольшую часть стоимости. Оптимальный вариант для агентного кодирования.
Уровень 3: Ежедневное использование. Kimi K2.7, Qwen 3.5, MiniMax M3, Grok 4. Справляются с 80% задач, которые несложные: суммаризация, написание черновиков, вопросы и ответы, извлечение данных, проверка кода, заметки с совещаний. Дешевле уровня 2 в 3–10 раз. На это вы потратите больше всего токенов.
Уровень 4: экономичный. DeepSeek V4 Flash, GLM 5 и открытые модели с весами 7B–20B, которые можно запускать локально. Массовые задачи, обработка больших объемов, фоновые задачи: перевод, классификация, извлечение данных, пакетная суммаризация. Также используется как резервный вариант, когда не хочется отправлять конфиденциальные данные в Frontier API.
«Лучшая модель» — это вопрос нагрузки, а не таблицы лидеров. Передовые модели не «умнее» обычных моделей в абсолютном смысле. Они настраиваются для другого типа задач. Ошибка заключается в том, чтобы платить передовые цены за обычную работу или запускать критические задачи на экономичных моделях и удивляться, почему это не работает.
Руководствуйтесь стоимостью ошибки
Выбирайте по стоимости ошибки. Высокая стоимость ошибки → переходите на более высокий уровень. Низкая стоимость ошибки → снижаем уровень. Большинство пользователей используют Ежедневно Уровень 3, для сложных задач Уровень 1 или 2, Уровень 4 — в фоновом режиме. Вот грубая схема соответствия рабочей нагрузки и уровней:
| Нагрузка | Выбрать | Почему |
|---|---|---|
| Многодневный синтез исследований, решения по новым архитектурам | Уровень 1 (Opus 4.8, Claude Max) | Требуется глубина, сохранение контекста на длительное время, готовность платить $20+ за задачу. |
| Сложное агентное кодирование, комплексные рефакторинги, многофайловые миграции | Уровень 2 (Сонет 4.7, GPT 5.4, Gemini 3 Pro) | Почти на переднем крае за 1/3–1/5 стоимости. Оптимальная точка для агентного кодирования. |
| Ежедневные вопросы и ответы, составление черновиков, проверка кода, заметки с собраний | Уровень 3 (Kimi K2.7, Qwen 3.5, MiniMax M3) | Выполняет 80% работы за небольшую часть стоимости. Смотрите L03: Китайские модели с открытым весом. |
| Массовое извлечение, перевод, классификация, пакетные задания или данные с повышенной конфиденциальностью, которые вы не хотите выводить с ноутбука | Уровень 4 (DeepSeek V4 Flash, GLM 5, локальные 7B-20B) | Предназначен для больших объёмов или только локального запуска. Качество «достаточно хорошее», не «передовое». Смотрите L04: Экономичный уровень. |
Для более детального сравнения, когда вы попробуете эти уровни, смотрите L05: Передовые против моделей с открытым весом: Рамки принятия решений. Для семьи Anthropic конкретно, L02: Семья Anthropic проходит через Opus, Sonnet и остальную часть линейки.
Планируйте свои еженедельные задачи
Упражнение
Откройте текстовый файл. Запишите ответ на это своими словами, не копируя:
«Выберите три задачи, которые вы выполняете каждую неделю. Для каждой из них укажите уровень, к которому она относится, и одну модель из этого уровня. Затем оцените, сколько токенов в неделю этот уровень стоит по текущим ценам.»
Хороший ответ указывает уровень для каждой задачи, конкретную модель для этого уровня и примерно количество токенов.
Что дальше
- L02: Семья Anthropic
- L03: Китайские модели с открытым весом
- L04: Экономичный уровень
- L05: Передовые против моделей с открытым весом: Рамки принятия решений