КарьераКарьера
КонтактыКонтакты

AI и нейросети

5 августа 2026

Сколько стоит AI после релиза: токены, контекст, хранение и контроль качества

AI-сервис вышел в продакшен, пользователи задают вопросы, ответы приходят вовремя. Через месяц у продукта появляется новый документ — счёт за эксплуатацию. В нём легко заметить цену токенов и пропустить расходы, которые создают длинный контекст, поиск по базе и проверка качества.

Мы разрабатываем AI-чатботы и RAG-системы, а в работе используем Claude и ChatGPT с Codex. После релиза расходы делим по назначению: отдельно пользовательская AI-функция, отдельно инструменты команды. Для продуктового контура я бы считал стоимость одного полезного сценария — ответа с нужным источником, корректного действия в системе или передачи диалога человеку.

Счёт начинается до первого слова модели

Провайдер считает токены — небольшие фрагменты текста, на которые модель разбирает запрос и ответ. Вход оплачивается отдельно от выхода. У кэшированного входа своя ставка, а у Claude отдельно оплачивается и запись префикса в кэш.

Вопрос пользователя — только часть входа. Перед ответом модель получает инструкцию, описание доступных инструментов, примеры, историю диалога и фрагменты из базы знаний. В выход входят токены, которые модель потратила на генерацию. Точные значения нужно брать из поля usage в ответе API и сохранять по каждому запросу.

Первая рабочая формула выглядит так:

Стоимость ответа = обычный вход + чтение кэша + запись в кэш + выход + вызовы инструментов.

Чтобы эти строки не смешивались, я свёл их в одну таблицу:

AI_после_релиза_таблица_контуры_vc_1920x1080.png

11 000 входных токенов: контекст умножает каждый запрос

pic-11.jpg

Контекст — всё, что модель получает перед ответом. В RAG-системе путь обычно такой: запрос пользователя превращается в поисковый, поиск находит несколько фрагментов, приложение добавляет их к инструкции и отправляет Claude. История чата тоже растёт с каждым сообщением.

В расчётном сценарии ниже один вызов несёт 11 000 входных токенов: 8 000 занимает стабильный префикс, ещё 3 000 — вопрос, история и найденные документы. Для провайдера это один входной поток, хотя продукт собирает его из разных частей.

Большое контекстное окно показывает технический предел модели. Счёт определяет фактический объём переданных токенов. Если приложение каждый раз прикладывает двадцать страниц регламента, провайдер снова тарифицирует их как обычный или кэшированный вход. Вдобавок лишние фрагменты могут ухудшить ответ: полезный абзац теряется среди похожих инструкций и старых версий.

Здесь помогают три ограничения. Первое — лимит на число и размер фрагментов, которые возвращает поиск. Второе — сокращение истории: старые сообщения сворачиваются в краткое состояние диалога. Третье — кэширование стабильного префикса с системной инструкцией и описанием инструментов.

У Claude цена кэша зависит от операции и срока жизни записи. Короткий кэш хорошо работает при плотном потоке запросов; при редких обращениях он будет чаще записываться заново. Поэтому в логах нужна фактическая доля чтений из кэша, а в финансовой модели — отдельные ставки на чтение и запись.

Пять гигабайт базы: отдельно хранение, поиск и версии

pic-12.jpg


База знаний занимает несколько слоёв. Есть исходные файлы, очищенный текст, фрагменты для поиска, векторные представления, индекс, логи запросов и версии документов. К ним добавляются резервные копии и данные для разбора спорных ответов.

Для базы на 5 ГБ нужно учесть тариф векторного хранилища, операции поиска, резервные копии и логи. Найденные фрагменты затем входят в контекст Claude и снова оплачиваются как входные токены.

Своя векторная база меняет названия строк, но сохраняет логику расходов: хранилище, вычисления для индексации, поиск, резервирование и наблюдаемость. Частое обновление документов добавляет переиндексацию. Если старые версии остаются активными, поиск может вернуть отменённый регламент.

Для каждого источника нужны владелец, версия и срок жизни. После обновления полезно проверять, что новый документ попал в индекс, старый перестал участвовать в выдаче, а права доступа сохранились. Иначе компания оплачивает хранение дублей и получает ответы по отменённым правилам.

10 000 диалогов: считаем $811,20 на Claude

Возьмём условный месяц. Это иллюстрация формулы, а не статистика проекта Qtim. Тарифы Claude Sonnet 4.6 приведены по состоянию на 2026-08-04:

  • 10 000 диалогов по четыре обращения к модели — 40 000 вызовов;
  • на вызов приходится 8 000 токенов стабильной инструкции, 3 000 переменных входных токенов и 500 выходных;
  • 95% стабильного префикса читается из кэша, 5% записывается заново.
AI_после_релиза_таблица_расчёт_vc_1920x1080.png

Без кэша тот же объём Claude Sonnet 4.6 обошёлся бы в $1 620. Разница — $808,80. В таблице посчитаны только токены модели: поиск и хранение зависят от выбранной инфраструктуры.

Расчёт не включает серверы приложения, базу данных, очереди, мониторинг, резервные копии, платные интеграции и время специалистов. Он также не учитывает налоги, конвертацию валют и особые режимы размещения данных. Затраты на разработку самого контура можно сверить с отдельным разбором стоимости MVP в 2026 году; эксплуатацию после релиза считают по фактическому трафику.

Codex считаем по завершённым задачам команды

Я бы не переводил расход Codex в цену пользовательского диалога. Он читает код, историю задачи, логи и результаты команд, а затем генерирует изменения и объяснения. После релиза эта строка растёт во время исправлений, обновления тестов, разбора инцидентов и код-ревью.

Подписки на Claude и ChatGPT с Codex учитываем в расходах команды. Для Codex смотрим четыре метрики: кредиты на завершённую задачу, объём контекста, число повторных запусков и расход автоматизаций. Если агентов несколько, общий пул уходит быстрее — это нормально, пока одновременно сокращается время решения задачи.

Так видно причину роста общего счёта. Либо продукт получил больше обращений, либо Claude стал отвечать длиннее, либо инженерной задаче потребовалось больше попыток. Одна общая сумма этого не покажет.

Ошибка в ответе живёт в отдельном бюджете

pic-13.jpg

На этом месте легко обрадоваться: 40 000 обращений к Claude обошлись в $811,20. Низкая цена полезна, пока система отвечает по актуальному документу, соблюдает права и вовремя передаёт сложный случай человеку. Ошибка в рекомендации может создать обращение в поддержку, неверную заявку или юридический риск.

Контроль качества начинается с тестового набора. В него входят обычные вопросы, редкие случаи, опечатки, конфликтующие документы и попытки вывести систему за разрешённый сценарий. Для каждого примера задают ожидаемый источник, обязательные элементы ответа и условие передачи оператору.

После изменения промпта, модели, поиска или базы тесты прогоняют заново. Часть примеров берут из логов, а автоматические оценки сверяют с решениями экспертов.

У этой строки бюджета своя формула:

Контроль качества = прогоны тестов + экспертная проверка выборки + разбор ошибок + исправления.

В универсальный долларовый тариф она не складывается. Один продукт проверяет корректность ссылки на регламент, другой — подбор товара и совместимость характеристик, третий — право выполнить действие в CRM. До релиза нужно определить частоту проверки, объём выборки и ответственного за решение спорных случаев.

Пять лимитов удерживают стоимость после релиза

Я бы зафиксировал пять ограничений ещё до выхода к пользователям.

Первое — отдельные бюджеты на продуктовый API и AI-инструменты команды.

Второе — стоимость одного завершённого сценария и её 95-й процентиль. Среднее скрывает дорогие длинные диалоги.

Третье — лимиты контекста: размер истории, число найденных фрагментов, максимальный выход и доля кэшированных токенов.

Четвёртое — маршрутизация. Простые запросы получает компактная модель, сложные — более сильная, действия с высоким риском уходят человеку.

Пятое — порог качества. Команда заранее определяет допустимую долю ответов без источника, ошибочных действий и передач оператору, а затем ставит уведомления по расходу и деградации.

Главный критерий простой: считайте стоимость полезного результата вместе с ценой его проверки. Если у вас уже есть AI-сценарий и ожидаемый трафик, его можно принести на обсуждение нашей команде. Разложим маршрут ответа по токенам, поиску, хранению и контролю качества до того, как первый месячный счёт станет сюрпризом.

Подпишись — самые свежие новости сначала в соцсетях

ещё