Модели, токены и кредиты: за что вы платите, когда пользуетесь ИИ
Почему в одном сервисе несколько моделей и что меняется при выборе более сильной, что такое токен и почему длинный документ дороже короткого, куда девается разговор, когда он перестаёт помещаться, и почему агентный режим расходует лимиты несоизмеримо быстрее обычного поиска.
Зачем это знать человеку, который просто хочет разобрать почту
Компания покупает сотрудникам доступ к ИИ-сервису. В интерфейсе появляются переключатели: выбор модели, выбор режима, где-то счётчик остатка. Инструкции к ним нет, и человек делает единственное разумное в такой ситуации — выбирает то, что звучит солиднее. «Максимальная» модель вместо обычной, «глубокое исследование» вместо поиска, агент вместо чата.
Через месяц у отдела кончаются лимиты, а руководитель получает счёт за перерасход. При этом восемьдесят процентов запросов были такими, что справился бы самый простой режим.
Дальше — то, что нужно понимать, чтобы не оказаться в этой истории. Без технических подробностей, но и без упрощений, из-за которых потом удивляются счёту.
Модель: почему их несколько и что меняется
Модель — это то, что собственно отвечает. Внутри одного сервиса их обычно несколько, и они различаются размером: сколько связей между понятиями модель удерживает и насколько длинную цепочку рассуждений может провести, не потеряв нить.
Большая модель лучше держит сложную задачу: разбор договора на десять страниц, где нужно сопоставить пункт из начала с оговоркой в конце. Маленькая быстрее и дешевле, и на простой задаче даёт тот же результат — переформулировать письмо, вытащить даты из текста, составить список из абзаца.
Что меняется при выборе более сильной модели: ответ приходит медленнее, лимит расходуется быстрее, качество на простой задаче не меняется вовсе. Последнее — самое важное и самое неочевидное. «Умная» модель не делает простой ответ более правильным; она просто дороже приходит к тому же результату.
Отсюда правило, к которому мы вернёмся ещё дважды: начинайте с простого и поднимайтесь на ступень выше только тогда, когда нижняя явно не справилась. Не «на всякий случай», а после того, как увидели плохой ответ.
Токен: чем измеряется объём
Модель не читает буквы и не читает слова. Она работает с токенами — кусочками текста, на которые он разбивается перед обработкой. Токеном может быть целое короткое слово, часть длинного, знак препинания или пробел.
По документации Сбера, в среднем в одном токене три-четыре символа, включая пробелы и знаки препинания. Отсюда легко прикинуть порядок: страница делового текста — это примерно пятьсот-шестьсот токенов, договор на десять страниц — несколько тысяч.
Оценка грубая, и точнее её сделать нельзя: разбиение зависит от языка, от терминов, от того, сколько в тексте цифр и латиницы. Для практики этого достаточно — важен порядок величины, а не точное число.
Два следствия, которые чувствуются в работе:
Длинный документ дороже короткого. Тарификации подлежат и ваш запрос, и ответ модели, и системная инструкция, если она есть. Приложили договор целиком, чтобы спросить про один пункт — оплатили весь договор.
Ответ тоже стоит денег. Просьба «распиши подробно» увеличивает счёт ровно настолько, насколько подробнее стал ответ. Если вам нужен список из пяти пунктов, попросите список из пяти пунктов, а не «развёрнутый анализ».
Контекстное окно: сколько модель помнит
Контекстное окно — предел того, сколько текста модель удерживает одновременно: ваш вопрос, приложенные файлы, вся история разговора и её собственные ответы. Всё это считается вместе.
У современных моделей окно большое — GigaChat Pro, по документации Сбера, обучен на контексте в 128 000 токенов, а GigaChat Light на миллионе. Звучит так, будто беспокоиться не о чем, и в большинстве рабочих задач так и есть.
Проблема начинается в длинных разговорах. История пересылается модели целиком на каждом шаге — она не помнит предыдущую реплику, она каждый раз перечитывает весь разговор заново. Значит, сотый вопрос в длинной переписке стоит дороже первого, хотя выглядит так же.
Когда разговор перестаёт помещаться в окно, сервис начинает выбрасывать самое старое. Внешне ничего не происходит: модель отвечает так же уверенно. Но инструкция, которую вы дали в самом начале — «отвечай только по приложенному документу», «пиши в деловом тоне» — тихо перестаёт действовать, потому что её больше нет в переданном контексте.
Практический вывод: новая задача — новый разговор. Длинная переписка обо всём подряд и дороже, и хуже по качеству. Если нужно, чтобы инструкция действовала всегда, её место не в первом сообщении чата, а в постоянных настройках рабочего пространства — там, где сервис подставляет её к каждому запросу заново.
Кредиты и лимиты: чем считают в подписках
В сервисах, которые продаются по подписке, платят не за токены. Там свои единицы: число запросов в сутки, число «глубоких» исследований в месяц, кредиты. Это удобнее для человека, но создаёт ловушку — единицы разные, и переносить интуицию с одного сервиса на другой нельзя.
Пример, который стоит разобрать целиком, потому что он типичен.
В Perplexity кредиты тратит только агентный режим Computer. Обычный поиск не расходует ничего: сколько бы вопросов вы ни задали за день, счёт от этого не изменится. По документации вендора, сто кредитов равны одному доллару, а одна задача агента стоит от сотни кредитов за самую лёгкую до нескольких тысяч за крупную.
Теперь сопоставьте это с месячным начислением на корпоративном месте уровня Pro — пятьсот кредитов. Самая лёгкая задача агента укладывается в этот запас один-два раза. Не на день работы и не на неделю: месячного запаса хватает на пару запусков.
Дальше устройство такое: когда личный запас кончился, добор идёт из общего пула организации в пределах потолка, который выставил администратор. Когда кончается пул — вендор выставляет счёт компании за перерасход всех сотрудников разом.
Что из этого стоит запомнить про подписки вообще:
- Неиспользованный месячный запас обычно сгорает. Копить бессмысленно.
- Приветственный бонус в разы больше месячного начисления и живёт короткий срок. Первый месяц создаёт ложное впечатление, что запас бездонный.
- Остаток виден в настройках учётной записи, а расход по конкретной задаче — прямо в ней. Загляните туда после первого же запуска дорогого режима.
Почему агент расходует несоизмеримо больше
Агентный режим — это когда ИИ не отвечает на вопрос, а выполняет работу: сам ходит по сайтам, открывает страницы, заполняет поля, работает с файлами и доводит многошаговую задачу до результата.
Механика расхода тут другая, и разница не в проценте, а в разы. Обычный поиск — это один запрос и один ответ. Агент за ту же задачу делает десятки шагов, и на каждом шаге ему пересылается вся история: что он уже сделал, что нашёл, что решил дальше. История растёт с каждым шагом, и каждый следующий шаг дороже предыдущего.
Добавьте к этому, что агент часто ошибается и возвращается: открыл не ту страницу, не нашёл кнопку, попробовал иначе. Каждая такая попытка тоже оплачена.
Отсюда практическое правило, ради которого написан весь раздел: не включайте агента там, где справляется поиск. Соблазн понятный — агент выглядит умнее и делает всё сам. Но задача «сравни двух поставщиков по открытым данным» решается обычным поиском за секунды и бесплатно, а через агента станет платной задачей на несколько минут с тем же результатом.
Лестница выбора
Собираем всё сказанное в порядок действий. Каждая следующая ступень дороже и медленнее предыдущей, поэтому поднимаемся только после того, как увидели, что нижняя не справилась.
- Обычный ответ модели. Переформулировать, сократить, объяснить, составить список. Данные уже есть в вопросе, искать ничего не нужно.
- Поиск. Нужен факт, которого модель знать не может: свежая новость, тариф, условие сервиса. Здесь же — проверка чужого утверждения по источникам.
- Углублённое исследование. Нужен обзор по теме, где одной страницей не обойтись: сравнение поставщиков, рынок, подборка практик. Ответа придётся ждать минуты.
- Агент. Задача требует последовательности действий, которую вы иначе делали бы руками. Самая дорогая ступень, и решение о ней принимают осознанно.
Проверочный вопрос перед подъёмом на ступень: что именно не получилось на предыдущей? Если ответить нечем, значит, вы поднимаетесь на всякий случай — и платите за это.
Что с этим делать в отделе
Три вещи, которые снимают большую часть перерасхода и ничего не стоят:
Показать людям, где смотреть остаток. Человек, который ни разу не видел счётчик, узнаёт о лимитах в момент, когда они кончились. Пять минут на планёрке решают вопрос.
Договориться, что агент запускают осознанно. Не запрещать — запрет уводит использование в тень. Просто проговорить, что это дорогая ступень, и назвать типичные задачи, где она оправдана.
Проверить настройки общих рабочих пространств. Если в пространстве стоит дорогой режим по умолчанию, лимиты потекут на каждом запросе внутри него, включая те, где хватило бы простого ответа.
Метод, который стоит за всем этим, разбирается в курсе: как ставить задачу так, чтобы хватало нижней ступени, и как проверять ответ, чтобы не переделывать. Первый модуль открыт.
Источники
- https://developers.sber.ru/docs/ru/gigachat/guides/counting-tokens проверено 2026-08-07
- https://www.perplexity.ai/help-center/en/articles/13838041-how-credits-work-on-perplexity проверено 2026-08-07
- https://www.perplexity.ai/help-center/en/articles/13901321-how-credits-work-for-enterprise-organizations-member-guide проверено 2026-08-07
Дальше — система, а не отдельный приём
Статья даёт один метод. В курсе — шесть модулей: от постановки задачи до сборки своего помощника, с готовыми промптами и разбором ошибок. Первый модуль открыт бесплатно.