Как экономить токены при работе с нейросетями
Не платите за «печать» — платите только за «думание». Бесплатные модели на рутину, ограниченный контекст у субагентов и шесть правил, которые режут расход в разы.
Токены — это кусочки текста, за которые вы платите дважды: за вход (ваш запрос плюс вся история диалога) и за выход (ответ модели). Главный, почти невидимый пожиратель денег — контекст: модель каждый раз «перечитывает» всё, что было до этого. Чем длиннее диалог и чем больше файлов вы в него тащите, тем дороже каждый следующий ответ.
Наш рабочий конвейер разнесён по ролям, и у каждой роли своя модель по цене:
- primary (думает) — deepseek-v4-pro-0813, дорогая. Только проектирует, раскладывает задачу на шаги и ревьюит итог. Тратит мало, потому что не гоняет механику.
- writer (пишет и исполняет) — opencode/mimo-v2.6-flash-free, бесплатная (0 CAPS). Записывает файлы, запускает команды, ходит в API. Запасная — opencode/ling-3.1-flash-free.
- vision (разбирает картинки) — gemini-2.5-flash-lite, дешёвая. Отчёты, скриншоты, фото плат — только описание, без изменений.
Идея простая: CAPS сгорают только там, где реально нужен интеллект. Вот шесть правил, которые мы для этого держим.
- Отделите «думание» от «печати». Записать файл, прогнать команду, сходить в API, разобрать скриншот — это «печать», ей не нужна дорогая модель. Отдайте её writer'у, а модель подороже оставьте на то, что требует рассуждений.
- Ограничьте субагенту кеш токенов. Каждый субагент стартует со свежим, небольшим контекстом: он не наследует вашу историю и физически не может перечитывать гигабайты выгрузок. Ограниченный контекст — это и дешевле, и защита от главной утечки: повторного чтения больших файлов.
- Передавайте данные субагенту явно, а не через общую память. Раз субагент не помнит прошлый диалог, всё нужное ему вшивается в самодостаточный промпт: резюме плюс точные пути. Например: «прочитай ~/Documents/roadmap.md, проверь systemctl --user status, верни diff и отчёт о приёмке». Опора — явный маршрут «где взять данные и что проверить», а не «мы же это вчера обсуждали».
- Агрегируйте один раз и дальше работайте с резюме. Прочитали выгрузку API на десять тысяч строк или отчёт о железе — сразу сведите это в короткий бриф из 5–7 фактов, которые дальше понадобятся. Сырые файлы сохраняются в архиве, но в контекст больше не загружаются. По конвейеру ходит только резюме.
- Держите порог сжатия. У нас лимит — около 300 тысяч токенов на диалог. Как только контекст к нему приближается, суммируем состояние и начинаем компактную новую сессию, а не несём всё бесконечно. Это срезает тот самый «невидимый» расход, который обычно не замечают.
- Разделяйте ключи и замеряйте честно. На каждый инструмент — свой developer-ключ, чтобы статистика не искажалась. Баланс и расход проверяйте служебными методами, которые не списывают токены.
Начните пользоваться нейросетями в рублях
Оплата картами РФ без VPN, 250+ моделей в одном аккаунте и прозрачный расход.