← Материалыleogodnik.me

Как платить
Claude Code меньше,
не теряя качества

Пересказ статьи команды Claude только в части, которую можно применять в Claude Code: кэш промпта, чистка инструкций и выбор усилий.

Оглавление

Вступление

О чём это

В Claude Code есть команда, которая читает ваш CLAUDE.md и выбрасывает оттуда то, что мешает новым моделям. Авторы прогнали её на шести промптах, куда нарочно подсадили старые приёмы вроде «проверь дважды», — и получили в среднем на 14,6% дешевле и на 5,3% точнее. Одной командой, не трогая ни модель, ни задачу.

Это пересказ статьи команды Claude. Половина её — про то, как писать свои приложения на API: диагностика кэша в консоли, ручные точки кэширования, пакетная обработка. Всё это я выбросил, оставил только то, что можно сделать, сидя в Claude Code.

Осталось три вещи, и они очень разные по отдаче. Аудит инструкций — то самое, с чего я бы начал: он разовый и почти бесплатный. Аккуратность с началом запроса и трезвый выбор усилий — это уже про привычку, эффект от них накапливается неделями и заметен, только если вы сидите в длинных сессиях с толстым CLAUDE.md и десятком подключённых инструментов. Если у вас пять коротких сессий в неделю и конфиг на десять строк — экономить, честно говоря, не на чем, читайте только про инструкции.

К оглавлению
Рычаг 1

Кэш промпта

Каждый раз, когда вы что-то пишете Claude, он сначала «вчитывается» во всё, что вы ему прислали: инструкции из CLAUDE.md, скиллы, описания инструментов, всю историю разговора. Это как заново пересматривать всю папку с делом перед каждым вопросом. Дорогая часть — именно чтение, а не ответ. На языке платформы этот шаг называется prefill.

Кэш — это закладка. Если следующий запрос начинается ровно так же, как предыдущий, Claude не перечитывает всё заново, а берёт готовое состояние с закладки. Чтение из кэша стоит долю от обычной цены входных токенов. Именно поэтому долгая сессия, где вы ничего не трогаете в начале, обходится дешевле, чем кажется.

Закладка работает только при трёх условиях:

  1. та же модель;
  2. начало запроса совпадает буква в букву;
  3. вы уложились по времени — у закладки есть срок годности, по умолчанию пять минут.
Что уезжает на серверМеняется ли между сообщениями
Системные инструкцииНет — кэшируются всегда
Описания инструментовНет, пока вы не трогаете набор инструментов
CLAUDE.md и памятьНет — кэш живёт на проект
Состояние сессииНет — кэш живёт на сессию
ПерепискаДа — растёт с каждым ходом

Первые четыре строки — то самое начало, которое кэшируется. Меняется только последняя, и это нормально: дописывать в хвост дёшево.

Что сбивает закладку в вашей сессии

Всё, что меняется в начале запроса. Хвост — ваши новые сообщения — можно наращивать сколько угодно, начало трогать дорого.

Что с этим делать

К оглавлению
Рычаг 2

Инструкции: устаревшие подходы вредят новым моделям

Это самая полезная часть статьи для Claude Code. В CLAUDE.md, скиллах и описаниях команд со временем накапливаются инструкции, которые латали слабости прежних моделей. Относительно возможностей свежих моделей они устаревают и начинают мешать. Типичные антипаттерны:

Как это чинить

В Claude Code есть команда, которая ищет эти антипаттерны сама. Она сканирует рабочую директорию: промпты, скиллы, описания инструментов и конфигурацию Claude Code — в том числе CLAUDE.md.

Claude Code
/claude-api prompt-audit

Насколько это важно, авторы показали на переходе с Opus 4.8 на Opus 5. Они брали чистый промпт и подсаживали в него по одному антипаттерну: устаревшая настройка thinking, пара противоречивых правил, ручной блокнот, «проверь дважды», «будь максимально дотошным» и обязательная процедура из шести шагов. Каждый вариант прогоняли на старой модели, на новой с одной лишь заменой модели и на новой после аудита.

КонфигурацияЦена за тикетТочность
Opus 4.8 со старым промптом2,52¢89,4%
Opus 5, промпт не тронут3,43¢91,7%
Opus 5 после аудита2,93¢97,0%

Среднее по шести промптам на бенчмарке клиентской поддержки. Обратите внимание на среднюю строку: одна лишь смена модели сделала работу дороже, чем была, — старые инструкции съели весь выигрыш.

Аудит убрал антипаттерны и в среднем снизил стоимость на 14,6%, а точность поднял на 5,3%. Расходы упали, потому что исчезли лишние вызовы инструментов и дублирующиеся рассуждения. А точность выросла по трём причинам, и все три поучительные: устаревшая настройка thinking заставляла отклонять целый класс запросов; противоречивые правила привели к тому, что модель четыре раза не сделала то, что была должна, и вместо этого переспрашивала; а ручной блокнот столкнулся со встроенным мышлением — в трёх случаях модель написала вызов инструмента внутри рассуждения и так его и не выполнила.

Проще говоря

Если ваш CLAUDE.md писался под прошлое поколение моделей, он сейчас, скорее всего, делает работу дороже и хуже. Прогнать по нему аудит — дело одной команды.

К оглавлению
Рычаг 3

Effort — насколько сильно стараться

Effort говорит Claude, насколько сильно стараться. На низком уровне он быстрее приходит к выводу. На высоком — размышляет, перепроверяет и рассматривает альтернативы, прежде чем ответить.

Соотношение цены и качества по уровням усилий у одной и той же модели бывает очень разным. На FrontierCode Diamond (50 самых сложных задач) Claude Fable 5 даёт 11,5% на низком effort за $5,35 за задачу, а на максимальном — 30,9% за $19,00: результат вырос примерно в 2,7 раза при цене примерно в 3,5 раза выше.

А бывает и наоборот: на Humanity's Last Exam (без инструментов) Fable 5.1 даёт около 53% на низком effort и около 61% на максимальном, но последний шаг до максимума добавляет всего полбалла при цене выше на 46%. Прирост укладывается в разброс между прогонами — то есть вы платите больше без измеримой отдачи.

Ошибиться с усилиями можно в обе стороны:

Главный практический вывод

Пробуйте более сильную модель на низком effort. Сильная модель, работающая вполсилы, бывает дешевле слабой, работающей на максимуме. На CursorBench 3.2 — а это как раз про работу с кодом — Claude Fable 5.1 на низком effort даёт то же качество, что Fable 5 на высоком, — за треть цены. Дешевле по двум причинам: на низком effort модель делает меньше работы на задачу, и чтение из кэша у новой модели стоит вчетверо меньше.

Так что при выборе, чем работать, разумнее взять модель поновее и не гнать её на максимум, чем экономить на модели и компенсировать это усилиями.

К оглавлению
Практика

С чего начать

С одной команды:

Claude Code
/claude-api prompt-audit

Она пройдёт по рабочей папке — по CLAUDE.md, скиллам, описаниям команд и инструментов — и покажет, что там устарело. Занимает это пару минут, а вычищает то, что вы писали руками месяцами и с тех пор ни разу не перечитывали. Ничего другого с таким же соотношением усилий и отдачи в статье нет.

Дальше — две привычки, которые окупаются медленнее.

От меня

К этому добавлю четвёртое: попробуйте /insights. В статье её нет, но она тоже даёт хорошее понимание, что у вас можно улучшить.

Ссылки: документация платформы, скилл claude-api (он же встроен в Claude Code), оригинал статьи и он же в X.

К оглавлению

Идея рирайта на русском — Леонид Годник. Оригинал: Reducing cost and improving performance with Claude Platform, Lance Martin, Brad Abrams, Isabella He и Ben Lehrburger, 8 сентября 2026 года.

Открыть канал в Telegram