К содержимому

Расход токенов

Подключённый сервер занимает часть контекста модели ещё до первого вызова, а каждый ответ добавляется к разговору. Это ваши деньги, поэтому мы называем цифры, а не общие слова: ниже фактические замеры и то, чем управлять, если расход кажется большим.

Сколько занимает сервер

Описания инструментов уезжают в контекст на каждом запросе к модели. У больших серверов это десятки тысяч токенов: типичное описание одного инструмента — 200–500 токенов, и набор из пятидесяти инструментов расходует 10 000–25 000 токенов до того, как что-то произошло. У нас восемь инструментов, и набор по умолчанию — только чтение.

ЧтоСимволовТокенов
Список инструментов, только чтение (4 инструмента)3 749≈ 1 100
Список инструментов, чтение и выставление счетов (7)10 485≈ 3 200
Список инструментов, всё вместе с возвратами (8)13 101≈ 4 000
Выборка 20 заказов, краткий формат3 826≈ 1 200
Выборка 20 заказов, подробный формат9 566≈ 2 900
Отказ по неверным параметрам, корзина из 100 позиций280≈ 85

Оценка в токенах — деление символов на 3,3: для русского текста это близкая прикидка. Числа снимаются тестом в репозитории сервера, а не пишутся руками, и тест падает, если описания разрастаются: так расход не растёт незаметно от версии к версии.

Чем сервер экономит

  • Показывает только включённое. По умолчанию видны четыре читающих инструмента; выставление счетов и возвраты включаются явно. Невключённое не занимает контекст вообще — ассистент о нём не знает.
  • Отвечает кратко по умолчанию. response_format: concise отдаёт ключевые поля; detailed стоит в 2,5 раза дороже и запрашивается осознанно.
  • Ограничивает страницу. Не больше 50 записей за вызов, по умолчанию 20. Одним запросом контекст не выесть.
  • Говорит, что ответ усечён. В ответе есть пометка «показано N из M» — модель видит, что смотрит выжимку, и уточняет фильтр вместо догадок. Состав отгрузки в подробном режиме усечён до пяти позиций: полный смотрят по одной отгрузке.
  • Сжимает отказы. Ошибка в корзине из ста позиций — это перечень полей на несколько строк, а не сто одинаковых сообщений: раньше такой отказ стоил больше семи тысяч токенов.
  • Не спрашивает дважды. Реквизиты по ИНН кешируются на сессию, повторное чтение того же счёта в пределах пяти секунд отдаётся из памяти.
  • Останавливает циклы. Не больше 200 вызовов инструментов за сессию: ассистент, который перечитывает одно и то же, упирается в предел и говорит об этом.
  • Держит справочники отдельно. Коды ставок НДС и единицы измерения читаются ресурсом по требованию, а не занимают место в каждом описании инструмента.

Что можете сделать вы

  • Оставьте набор по умолчанию, пока не понадобится больше: чтение стоит около 1 100 токенов — меньше одной страницы документации.
  • Не держите платёжный сервер в одной сессии с почтой, задачами и веб-поиском. Это экономит контекст и — важнее — снимает риск, что чужой текст станет командой для ассистента (почему).
  • Ищите фильтром, а не перебором страниц: по номеру заказа, статусу и датам. Один точный запрос дешевле трёх страниц, которые модель прочитает целиком.
  • Просите подробный формат только тогда, когда нужны состав и ссылки на оплату.
Сервер не считает ваши деньги

Сколько стоит токен, знает ваш провайдер модели, а не мы: тарифа и выбранной модели сервер не видит. Он отдаёт объём и число записей — перевод в рубли остаётся на стороне, где есть тариф.

Что дальше

Лимиты и ответы — что делать при достижении предела. Справочник инструментов — какие поля возвращает каждый. Быстрый старт — подключение и наборы инструментов.