Как экономить токены при работе с нейросетями

Не платите за «печать» — платите только за «думание». Бесплатные модели на рутину, ограниченный контекст у субагентов и шесть правил, которые режут расход в разы.

Как экономить токены при работе с нейросетями

Токены — это кусочки текста, за которые вы платите дважды: за вход (ваш запрос плюс вся история диалога) и за выход (ответ модели). Главный, почти невидимый пожиратель денег — контекст: модель каждый раз «перечитывает» всё, что было до этого. Чем длиннее диалог и чем больше файлов вы в него тащите, тем дороже каждый следующий ответ.

Наш рабочий конвейер разнесён по ролям, и у каждой роли своя модель по цене:

Идея простая: CAPS сгорают только там, где реально нужен интеллект. Вот шесть правил, которые мы для этого держим.

  1. Отделите «думание» от «печати». Записать файл, прогнать команду, сходить в API, разобрать скриншот — это «печать», ей не нужна дорогая модель. Отдайте её writer'у, а модель подороже оставьте на то, что требует рассуждений.
  2. Ограничьте субагенту кеш токенов. Каждый субагент стартует со свежим, небольшим контекстом: он не наследует вашу историю и физически не может перечитывать гигабайты выгрузок. Ограниченный контекст — это и дешевле, и защита от главной утечки: повторного чтения больших файлов.
  3. Передавайте данные субагенту явно, а не через общую память. Раз субагент не помнит прошлый диалог, всё нужное ему вшивается в самодостаточный промпт: резюме плюс точные пути. Например: «прочитай ~/Documents/roadmap.md, проверь systemctl --user status, верни diff и отчёт о приёмке». Опора — явный маршрут «где взять данные и что проверить», а не «мы же это вчера обсуждали».
  4. Агрегируйте один раз и дальше работайте с резюме. Прочитали выгрузку API на десять тысяч строк или отчёт о железе — сразу сведите это в короткий бриф из 5–7 фактов, которые дальше понадобятся. Сырые файлы сохраняются в архиве, но в контекст больше не загружаются. По конвейеру ходит только резюме.
  5. Держите порог сжатия. У нас лимит — около 300 тысяч токенов на диалог. Как только контекст к нему приближается, суммируем состояние и начинаем компактную новую сессию, а не несём всё бесконечно. Это срезает тот самый «невидимый» расход, который обычно не замечают.
  6. Разделяйте ключи и замеряйте честно. На каждый инструмент — свой developer-ключ, чтобы статистика не искажалась. Баланс и расход проверяйте служебными методами, которые не списывают токены.

Начните пользоваться нейросетями в рублях

Оплата картами РФ без VPN, 250+ моделей в одном аккаунте и прозрачный расход.

Начать с Bothub