Слух: НОВЫЙ Claude Opus уже в пути! (утечка Marshmallow & Melon)

Опубликовано
24 августа 2026 года
Продолжительность
7:28
Нажмите, чтобы загрузить плеер YouTube

На этой неделе в партнерских инструментах появились два новых идентификатора моделей: Claude Marshmallow EAP и Claude Melon EAP. Слухи говорят, что это предварительные версии следующего Opus и Sonnet, а не обновление Haiku. По сообщениям внутреннего тестирования, Marshmallow обходит Opus 5, так что большинство предполагает, что Marshmallow будет крупной моделью, а Melon — среднего уровня. В прошлом месяце была аналогичная утечка с Honeycomb, которая через две недели оказалась Opus 5. Так что мы можем увидеть эти модели в течение нескольких недель.

Что сейчас не так с Opus 5

Инженеры Anthropic тихо признали, что у Opus 5 есть реальные проблемы. Борис Черный, работающий в Anthropic, написал в социальных сетях, что Opus не идеален и его исправление является приоритетной задачей. Основная жалоба — многословие. Opus 5 пишет слишком много без причины, теряется при длинных блоках текста и расходует токены. Однако есть быстрое решение. Вы можете запустить claude/config output style equals concise для того, чтобы заставить выдавать более короткие ответы. Это помогает, но на модели высшего уровня это не должно быть необходимо.

Пользователи стали более прямыми. Они называют Opus 5 многословным, перегруженным предположениями монстром токенов, который расширяет масштабы, чрезмерно проверяет собственную работу и кажется более неаккуратным, чем Opus 4.6 при реальной отладке. Многие думают, что Opus 4.6 в феврале-марте был на пике. Текущий Opus 5 имеет максимальные показатели на бенчмарках, хорошо показывает себя в agent arena, но ломает старые рабочие процессы и требует совершенно нового стиля запросов, чтобы его можно было использовать.

Официальное объяснение Anthropic заключается в том, что Opus 5 более агентский и меньше поддаётся изменению через промпт, что верно, но это не то, чего хотят большинство пользователей. Они хотят модель, которая следует инструкциям, а не такую, которая решает внезапно пойти в противоположном направлении. Fable 5, модель планирования от Anthropic, всё равно направляет задачи по кодированию в Opus, поэтому по сути мы всё это время использовали Sonnet.

Скрытые издержки Sonnet 5

У Сонета 5 свои финансовые проблемы. На первый взгляд кажется, что это средний ценовой сегмент, но отзывы показывают, что на самом деле стоимость за задачу выше, чем у Сонета 4.6. Всё потому, что он разбивает задачи на большее количество суб-агентов и требует больше шагов. На бумаге Сонет 5 умнее, но на практике медленнее, менее точен и дороже. Он также отказывается от большего числа легитимных, но чувствительных задач, застревая в циклах споров вместо выполнения. Долгие чаты теряют контекст или неправильно расставляют приоритеты по ранним деталям. В итоге мы получаем умный Сонет для Опуса и глупый Сонет для Сонета.

Что нужно исправить Marshmallow и Melon

Если Marshmallow станет следующим Opus, ему нужно сохранить глубокое рассуждение и достижения в области безопасности, при этом обуздав чрезмерно инициативное поведение. Меньше расширения области применения, меньше самовольных марафонов проверки, лучшее соблюдение того, что вы действительно запросили. Если Melon станет следующим Sonnet, ему нужно сохранить улучшение рассуждений, но сократить скрытые издержки. Более разумные настройки по поводу того, когда создавать подагентов, более низкие показатели отказов, более предсказуемый контекст в длинных сессиях. В целом, следующему поколению Claude не следует заставлять каждого пользователя переписывать всю свою настройку только для того, чтобы пережить обновление.

Прямо сейчас от 80 до 90% нашей работы выполняется на GPT-5.6 Sol и Terra. Для действительно сложного решения задач мы используем Fable 5, для скорости — Grok 4.6, а Kimi K3 или DeepSeek V4 Pro — как бюджетные альтернативы. Если новые Opus и Sonnet действительно будут лучше Sol и Terra в повседневной работе, мы вернемся к Claude. Но Anthropic должен выпустить исправление, а не просто новое имя модели.