Расход токенов
Подключённый сервер занимает часть контекста модели ещё до первого вызова, а каждый ответ добавляется к разговору. Это ваши деньги, поэтому мы называем цифры, а не общие слова: ниже фактические замеры и то, чем управлять, если расход кажется большим.
Сколько занимает сервер
Описания инструментов уезжают в контекст на каждом запросе к модели. У больших серверов это десятки тысяч токенов: типичное описание одного инструмента — 200–500 токенов, и набор из пятидесяти инструментов расходует 10 000–25 000 токенов до того, как что-то произошло. У нас восемь инструментов, и набор по умолчанию — только чтение.
| Что | Символов | Токенов |
|---|---|---|
| Список инструментов, только чтение (4 инструмента) | 3 749 | ≈ 1 100 |
| Список инструментов, чтение и выставление счетов (7) | 10 485 | ≈ 3 200 |
| Список инструментов, всё вместе с возвратами (8) | 13 101 | ≈ 4 000 |
| Выборка 20 заказов, краткий формат | 3 826 | ≈ 1 200 |
| Выборка 20 заказов, подробный формат | 9 566 | ≈ 2 900 |
| Отказ по неверным параметрам, корзина из 100 позиций | 280 | ≈ 85 |
Оценка в токенах — деление символов на 3,3: для русского текста это близкая прикидка. Числа снимаются тестом в репозитории сервера, а не пишутся руками, и тест падает, если описания разрастаются: так расход не растёт незаметно от версии к версии.
Чем сервер экономит
- Показывает только включённое. По умолчанию видны четыре читающих инструмента; выставление счетов и возвраты включаются явно. Невключённое не занимает контекст вообще — ассистент о нём не знает.
- Отвечает кратко по умолчанию.
response_format: conciseотдаёт ключевые поля;detailedстоит в 2,5 раза дороже и запрашивается осознанно. - Ограничивает страницу. Не больше 50 записей за вызов, по умолчанию 20. Одним запросом контекст не выесть.
- Говорит, что ответ усечён. В ответе есть пометка «показано N из M» — модель видит, что смотрит выжимку, и уточняет фильтр вместо догадок. Состав отгрузки в подробном режиме усечён до пяти позиций: полный смотрят по одной отгрузке.
- Сжимает отказы. Ошибка в корзине из ста позиций — это перечень полей на несколько строк, а не сто одинаковых сообщений: раньше такой отказ стоил больше семи тысяч токенов.
- Не спрашивает дважды. Реквизиты по ИНН кешируются на сессию, повторное чтение того же счёта в пределах пяти секунд отдаётся из памяти.
- Останавливает циклы. Не больше 200 вызовов инструментов за сессию: ассистент, который перечитывает одно и то же, упирается в предел и говорит об этом.
- Держит справочники отдельно. Коды ставок НДС и единицы измерения читаются ресурсом по требованию, а не занимают место в каждом описании инструмента.
Что можете сделать вы
- Оставьте набор по умолчанию, пока не понадобится больше: чтение стоит около 1 100 токенов — меньше одной страницы документации.
- Не держите платёжный сервер в одной сессии с почтой, задачами и веб-поиском. Это экономит контекст и — важнее — снимает риск, что чужой текст станет командой для ассистента (почему).
- Ищите фильтром, а не перебором страниц: по номеру заказа, статусу и датам. Один точный запрос дешевле трёх страниц, которые модель прочитает целиком.
- Просите подробный формат только тогда, когда нужны состав и ссылки на оплату.
Сколько стоит токен, знает ваш провайдер модели, а не мы: тарифа и выбранной модели сервер не видит. Он отдаёт объём и число записей — перевод в рубли остаётся на стороне, где есть тариф.
Что дальше
Лимиты и ответы — что делать при достижении предела. Справочник инструментов — какие поля возвращает каждый. Быстрый старт — подключение и наборы инструментов.