🤯 Нашёл, куда утекают лимиты Claude Code, и это касается всех, кто гоняет субагентов. По наводке из треда проверил свои логи и офигел. Основной чат Claude Code держит кэш контекста час, а субагенты-помощники — всего 5 минут!😱 Стоит помощнику постоять дольше пяти минут (ждёт мой ответ, долгие тесты или сборку), и следующий шаг заново записывает в кэш весь его контекст, сотни тысяч токенов, а такая запись примерно в 12 раз дороже обычного чтения из кэша!!!! У меня субагент на Opus, который пилит камеру в моей AI-DnD, за два дня записал в кэш 116,6 млн токенов и 159 раз перезаписал контекст целиком, по 200–900 тысяч токенов за раз. Похоже, именно это и съело недельный лимит Max 🫣 Решение официальное, есть в документации Claude Code: в settings.json добавить "subagentPromptCacheTtl": "1h", а если гоняете агентов через API-ключ, то CLAUDE_CODE_PROMPT_CACHE_TTL=1h. Запись в часовой кэш дороже, но полных перезаписей после каждой паузы больше нет. Проверил: кэш действительно пошёл с ephemeral_5m на ephemeral_1h. Чудес не ждите: у моего лейна это срежет примерно 20–25% расхода, потому что основное съедает раздутый до 900 тысяч токенов контекст, который читается на каждом шаге. Поэтому вторая мера: не вести одного агента сутками, а давать каждый шаг свежему агенту с коротким отчётом предыдущего 🔄
📄 Документация: https://code.claude.com/docs/en/prompt-caching
P.S.
Заодно для Opus 5.5 раскатили Fast mode: тумблер в меню модели или /fast в терминале. Та же модель и то же качество, только около 285 токенов/с, в 2–2,5 раза быстрее. Стоит вдвое дороже ($8 / $40 за миллион токенов), а на подписке в лимиты не входит и списывается только с usage credits ⚡️