К содержимому
MoranaLabs
Research11 мин чтения1 просмотр

Claude Fable 5.1: кеш подешевел вчетверо, а флагман наконец обогнал младшую модель 

Разбор релиза 1 сентября без пересказа пресс-релиза: почему подешевела ровно одна строка счета, как посчитать экономию для своего контура и какая цифра в таблице бенчмарков важнее всех остальных.

0xReality

Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 первого сентября. Первая доступна всем, вторая — только участникам программ доверенного доступа в кибербезопасности и науках о жизни. Идентификатор модели в API — claude-fable-5-1, миллион токенов контекста, 128 тысяч токенов на выход, снятие с поддержки обещано не раньше 1 сентября 2027 года.

Базовые ставки не тронули: 10 долларов за миллион входных токенов и 50 за миллион выходных, как у Fable 5. Изменилась одна строка прайса. Именно она и дает всю заявленную экономию, и именно ее стоит разобрать, потому что достанется эта экономия не всем.

Подешевело ровно одно: повторное чтение контекста

Кеш промпта работает так: вы один раз платите за запись большого куска контекста, а потом на каждом следующем запросе платите за его чтение по льготной ставке. У всех моделей Anthropic чтение кеша стоит 0,1 от базовой цены входа. У Fable 5.1 и Mythos 5.1 множитель другой — 0,025.

Строка счетаFable 5Fable 5.1Opus 5
Вход, базовый$10 / млн$10 / млн$5 / млн
Выход$50 / млн$50 / млн$25 / млн
Запись кеша, 5 минут$12,50 / млн$12,50 / млн$6,25 / млн
Запись кеша, 1 час$20 / млн$20 / млн$10 / млн
Чтение кеша$1 / млн$0,25 / млн$0,50 / млн
Пакетный режим, вход/выход$5 / $25$5 / $25$2,50 / $12,50

Смотрите на предпоследнюю строку внимательно. У флагмана, который стоит вдвое дороже Opus 5 на входе, чтение кеша теперь вдвое дешевле, чем у Opus 5. Привычная пропорция «дороже модель — дороже все ее строки» сломана намеренно: Anthropic удешевила ровно тот режим, в котором работают агенты и Claude Code, и не тронула тот, в котором работают разовые запросы.

Арифметика: откуда берутся сорок процентов

Возьмем контур, который мы обычно и собираем клиентам: агент держит в контексте выгрузку проекта на 200 тысяч токенов, делает 40 шагов на задачу и на каждом шаге дописывает около 2 тысяч токенов. Контекст на каждом шаге перечитывается целиком — это и есть чтение кеша.

Статья расходаРасчетFable 5Fable 5.1
Запись кеша200 тыс. × $12,50 / млн$2,50$2,50
Чтение кеша, 40 шагов8 млн токенов × ставку$8,00$2,00
Выход80 тыс. × $50 / млн$4,00$4,00
Задача целиком$14,50$8,50

Минус 41 процент. Заявленные вендором «до 45 процентов на сильно агентских нагрузках» — это ровно такая арифметика, только с большей долей чтения в общем объеме. Чем длиннее диалог агента и чем толще контекст, тем ближе экономия к максимуму. Подставьте свои числа, формула из двух умножений.

Второй множитель экономии лежит не в прайсе. Вендор пишет, что на низком и среднем уровне усилия модель дает результат уровня Fable 5, а токенов тратит меньше. Уровень усилия по умолчанию — high; если ваши задачи проходят на medium, счет падает еще раз, уже по выходным токенам. Это проверяется за полдня на своих задачах и не требует ничьих обещаний.

Третий рычаг лежит рядом и берется почти бесплатно: пакетный режим дает минус 50 процентов на входе и выходе — 5 и 25 долларов за миллион. С интерактивом он несовместим, зато ночная обработка очереди документов, переиндексация базы знаний и разовая прогонка архива живут там штатно. Множители пакетного режима и кеша перемножаются.

Кому скидка не достанется вовсе

Если ваш сценарий — разовый запрос без кеша (классификация письма, извлечение полей из одного документа, короткий ответ пользователю), то счет не изменится ни на цент. Вход 10 долларов, выход 50 долларов, как вчера. Пятьдесят тысяч токенов на вход и три тысячи на выход стоили 0,65 доллара и стоят 0,65 доллара.

Вывод для архитектора простой и неприятный: рычаг экономии переехал из выбора модели в устройство запроса. Стабильный префикс, отсортированные ключи в JSON, никаких меток времени и идентификаторов в системном промпте — любой байт, изменившийся в начале, обнуляет кеш целиком, и вы платите полную ставку, не понимая почему. Проверяется это одним полем в ответе API: cache_read_input_tokens. Если он в нуле на повторяющихся запросах — экономии у вас нет, независимо от того, какая модель указана в конфиге.

Бенчмарки: главная цифра там не про Fable 5.1

ЗамерFable 5Opus 5Fable 5.1
Terminal-Bench-Science 0.124,7%29,0%52,6%
Terminal-Bench 4.0 (агентское кодирование)42,0%52,3%55,8%
AutomationBench (бизнес-процессы)17,1%26,9%31,4%
OSWorld 2.0, строгий зачет36,1%39,6%41,7%
GDPval-AA v2, баллы172318241853
CursorBench 3.2.070,5%70,0%73,4%

Пресс-релиз подает первую строку: рост в два с лишним раза на научных агентских задачах. Интереснее второй столбец. Fable 5 — модель вдвое дороже Opus 5 по базовым ставкам — проигрывала ей на пяти строках из шести: на агентском кодировании (42,0 против 52,3), на бизнес-процессах (17,1 против 26,9), на научных задачах, на управлении рабочим столом и на оценке рабочих задач. Три месяца самый дорогой доступный флагман был хуже собственной младшей модели там, где деньги и зарабатываются.

Fable 5.1 это перевернула: теперь она впереди Opus 5 на всех шести строках. Отсюда практический вывод, который переживет этот релиз: место в прайс-листе не говорит ничего о результате на вашей задаче. Проверять надо своим набором задач, и делать это заново на каждом релизе.

Токенизатор, который портит любое сравнение цен

Деталь из документации, которая не попадает в новости. Начиная с Opus 4.7 модели используют новый токенизатор, и он дает примерно на 30 процентов больше токенов на том же тексте. Тот же договор, та же выгрузка, та же переписка — счетчик показывает в среднем на треть больше.

Значит, сравнивать поколения по ставке за миллион токенов некорректно. Модель со ставкой ниже на четверть может обойтись дороже на том же корпусе документов просто потому, что иначе режет текст. Единственный честный показатель — стоимость решенной задачи целиком, посчитанная на своих данных. Мы этот показатель считаем в калькуляторе и в сметах на внедрение, и он регулярно расходится с интуицией заказчика в обе стороны.

Mythos 5.1: та же модель с ослабленными фильтрами

Вторая половина релиза до широкой публики не доедет. Mythos 5.1 раздается через программы доверенного доступа — Cyber Verification Program для защитной безопасности и Life Sciences Verification Program для биологии, с проверкой заказчика на входе. На агентском кодировании она берет 60,9 процента против 55,8 у Fable 5.1, и разница здесь в том, что ей разрешено больше.

Заявленная научная фактура: белковые связыватели с попаданием на половине из двенадцати мишеней и аффинностью на порядок выше прошлых победителей профильного конкурса; карта высот Венеры с разрешением 300 метров вместо прежних десятков километров; ускорение семи открытых биологических моделей в 1,4-2,5 раза с экономией счета за видеокарты на 30-60 процентов. Со стороны это не проверяется, доступа к программе у нас нет. Важен сам факт: вендор разделил линейку по строгости фильтров при одинаковых весах, и режим «разрешено больше» стал отдельным продуктом с проверкой покупателя.

Предохранители: минус 60 процентов ложных срабатываний

Второе изменение релиза денежное лишь косвенно, но для промышленной эксплуатации оно важнее бенчмарков. Anthropic заявляет около 60 процентов меньше вмешательств защитных механизмов за сессию Claude Code и падение ложных флагов на безобидных биологических запросах на 85 процентов относительно защит на старте Fable 5. Способность находить уязвимости при этом осталась, разработка эксплойтов — заблокирована.

Почему это отдельная новость, понятно из хронологии. Fable 5 вышла 9 июня. Двенадцатого июня Anthropic получила директиву правительства США об экспортном контроле: исследователи Amazon показали способ обойти защиты модели через задачу поиска уязвимостей в коде. Проверять гражданство пользователей в реальном времени вендор не мог, поэтому доступ отключили всем и по всему миру. Ограничения сняли в конце июня, доступ вернули 1 июля — с новым классификатором, который, по заявлению вендора, ловит более 99 процентов случаев того самого обхода, и с расширенным запасом прочности защит.

Запас прочности стоил денег всем остальным. Модель начала отказывать на безобидных запросах, а отказ по политике для промышленного контура — такой же простой, как таймаут или пятисотка. Разница в том, что таймаут виден в мониторинге, а отказ выглядит как связный вежливый текст и до метрик доходит редко. Fable 5.1 — это работа именно над этой ошибкой, и хорошо, что вендор начал публиковать долю ложных срабатываний как метрику.

В договорах на агентские контуры мы после июньской истории пишем отдельным пунктом: доля отказов по политике измеряется, попадает в отчет и лечится сменой поставщика модели без переписывания контура. Это дешевле, чем объяснять заказчику, почему процесс встал из-за решения, принятого за пределами его периметра.

Между поколениями пропасть, и мы ее измеряли

Общая закономерность подтверждается нашим собственным замером, который к этому релизу отношения не имеет и потому годится как независимая проверка. Мы гоняли восемь типовых задач на встроенном языке 1С по пять прогонов на модель и считали выдуманные имена методов платформы. У модели прошлого поколения выдуманные имена встречались в 88 процентах ответов, у модели текущего — в 38 процентах. По уникальным именам: 78 несуществующих из 302 против 13 из 187. Методика открыта: восемь задач, пять прогонов, вердикт по каждому имени сверялся с документацией платформы построчно.

Смысл в том, что поколение модели дает разницу в разы, а ценник внутри одного поколения — единицы процентов качества. Экономить, оставаясь на позапрошлом релизе, — худший из доступных способов сэкономить.

Из России доступа нет, и это не формальность

Россия не входит в список поддерживаемых стран Anthropic. Официального доступа нет ни к claude.ai, ни к API, ни к тем же моделям через Amazon Bedrock, Google Cloud и Microsoft Foundry — ограничения там на уровне аккаунта, а не эндпойнта. Для компании с российским юрлицом это означает, что разбирать релиз стоит как индикатор рынка. Планом закупки он не станет.

Что из этого следует практически. Для контуров, где данные не выходят за периметр (первичка с персональными данными, договоры, переписка с контрагентами), внешний вендор в принципе не подходил и до всякой геополитики — по причинам, которые мы разбирали отдельно. Там работает локальная модель в вашем контуре, и удешевление кеша у чужого флагмана на этот выбор не влияет никак.

Влияет другое: техника, за счет которой считается экономия. Кеш ключей и значений в локальном инференсе дает тот же эффект — повторное чтение неизменного префикса на порядок дешевле его пересчета. Если ваш контур на открытых весах не переиспользует префикс, вы оплачиваете видеопамятью ровно ту же ошибку, за которую в облаке платят долларами.

Когда флагман брать не нужно

Fable 5.1 в сравнительной таблице вендора помечена как самая медленная из линейки. Это осознанный размен: глубокое рассуждение включено всегда и отключить его нельзя. Для интерактивного помощника, который обязан ответить за секунду, это плохая покупка при любой цене.

ЗадачаЧто братьПочему
Классификация, извлечение полей, короткие ответыМладшая модельКеша нет, скидки нет, качества хватает
Чат в интерфейсе с ожиданием ответаБыстрая модельФлагман медленнее по определению
Агент на длинном контексте, десятки шаговФлагман с кешемЗдесь и живет вся экономия
Данные не выходят из периметраЛокальная модельВопрос доступа и 152-ФЗ, а не качества
Задача решается регулярным выражениемРегулярное выражениеМодель тут просто дороже и хуже

Чек-лист: проверить у себя за один день

  1. Посмотреть в логах долю cache_read_input_tokens в общем входе. Если меньше половины — сначала чините архитектуру запроса. Выбор модели тут вторичен.
  2. Пересчитать прошлый месяц по новой ставке чтения кеша. Разница между расчетом и обещанием вендора покажет, насколько ваш профиль нагрузки похож на агентский.
  3. Прогнать свой набор задач на уровнях усилия low и medium. Если качество держится, экономия удваивается.
  4. Замерить долю отказов по политике за месяц. Это метрика доступности, ее место в отчете рядом с аптаймом.
  5. Не сравнивать поколения по ставке за токен: токенизатор с версии 4.7 дает примерно на 30 процентов больше токенов на том же тексте.

Что меняется в наших проектах

Ничего в архитектуре. Контуры ИИ внутри 1С мы собираем провайдер-независимыми с самого начала: модель за интерфейсом, подмена поставщика — конфигом, промпты и данные хранятся у заказчика. Июнь 2026 года показал, зачем это нужно, лучше любой презентации: доступ к флагманской модели может исчезнуть за сутки по причинам, до которых заказчику нет дела.

Меняется вес одного пункта в проектировании. Раньше стабильный префикс контекста был вопросом латентности и приличия, теперь это главная статья экономии на длинных задачах: разница между аккуратным и небрежным контуром на одной и той же модели — сорок процентов счета. В наших проектах под эту разницу теперь заводится отдельная проверка на приемке.

И один вывод, который стоит унести из релиза целиком, даже если вы никогда не подключите ни одну из этих моделей. Флагман за двойную цену три месяца проигрывал собственной младшей модели на прикладных агентских задачах, и узнать об этом можно было только замером. Не из прайса, не из маркетинговых материалов, не из чужого рейтинга.

  • #Claude
  • #LLM
  • #ИИ-агенты
  • #архитектура
  • #окупаемость
  • #цены
ПоделитьсяTelegramX
рассылка

Новые статьи — на почту

Лонгриды про ML в проде, edge и компьютерное зрение — сразу после выхода.

Канал в Telegram: morana.log

Без спама. Нажимая «Подписаться», соглашаетесь с обработкой персональных данных

бесплатный pdf-гайд

Edge AI или облако: когда тащить нейросеть на железо

Признаки, фреймворк выбора и прикидка экономии — короткий PDF-гайд на почту.

PDF · 5 страниц · без спама. Нажимая «Получить», соглашаетесь с обработкой персональных данных

Читать дальше
— заявка

Опишите задачу  ответим как инженеры. 

Оставьте имя и Telegram — остальное обсудим. Без брифов на 40 слайдов и звонков по три раза.

Отвечаем за пару часовотвечает инженер, а не отдел продажNDA до передачи данных

Любой один канал — куда удобнее, туда и ответим

Или сразу написать в Telegram

Без спама и звонков-роботов. Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и обработкой персональных данных.