Почему бот забывает, что клиент сказал минуту назад: контекст и токены без формул
Клиент написал боту адрес доставки, ответил на два уточняющих вопроса — и бот спросил адрес снова. Так происходит потому, что у нейросети есть «окно», в которое влезает разговор, и оно измеряется токенами — кусками слов по несколько букв; когда окно кончается, начало диалога выпадает. Запросы «что такое токены» и «что такое контекст в нейросети» вместе набирают 1 347 показов в месяц в Wordstat — и почти всегда за ними стоит этот случай. Ниже — как устроена память модели, куда девается адрес и что записывать отдельно, чтобы бот не переспрашивал.

У нейросети нет памяти, есть окно
Объём распечатки ограничен — это и есть окно контекста, у каждой модели своё. Пока разговор короткий, в окно влезает всё, и бот выглядит внимательным. Когда разговор растёт, разработчик или платформа начинает отрезать старое — обычно с начала. Адрес из первого сообщения оказывается за краем, и для модели его как будто не было.
Главное, что нужно понять
Языковая модель ничего не запоминает между ответами. Каждый раз, когда бот отвечает, ему заново отправляют весь разговор — ваши реплики, его реплики, инструкцию разработчика — и модель читает это с нуля, как человек, которому дали распечатку чата.
Минута здесь ни при чём
Важно не время, а сколько текста накопилось между адресом и вопросом о нём. Одно длинное сообщение с вставленным прайсом вытесняет начало диалога так же, как двадцать коротких реплик.
Токен — это не слово и не буква
Окно измеряют не в словах и не в символах, а в токенах
Токен — кусок текста, на который модель режет всё, что ей дают: частые короткие слова обычно целиком, длинные — на два-три куска, редкие или с опечатками — почти по буквам. Знаки препинания, пробелы и цифры тоже занимают токены.
Для русского языка это работает хуже, чем для английского
Слова длиннее, окончаний больше, и одно слово в среднем превращается в два-три токена. Грубая прикидка: тысяча токенов — примерно страница текста. У каждой модели свой словарь, поэтому точное число смотрите в её документации или в счётчике токенов сервиса.
Окно в 32 тысячи токенов — это не 32 тысячи слов, а порядка 30 страниц русского текста вместе с инструкцией бота, вставленной базой знаний и ответами самой модели: они тоже занимают место и тоже вытесняют начало.
Куда на самом деле девается адрес
Переполнение окна — только одна из причин, и в коротких диалогах она редко главная. Чаще виноваты три вещи.
Первая — жёсткая обрезка истории
Чтобы платить за токены меньше, разработчик часто оставляет боту последние пять–десять сообщений. Адрес в первом сообщении, вопрос в одиннадцатом — и никакое большое окно не поможет, потому что до модели адрес уже не доходит.
Вторая — длинная инструкция
Если в системный промпт бота вставили весь прайс, правила доставки и скрипт продаж, на разговор остаётся мало места, и в моделях с маленьким окном это заметно уже на пятой реплике.
Третья и самая частая — адрес никто не записал
Для модели «улица Ленина, 12» — просто текст среди другого текста, а не поле «адрес». Пока диалог короткий, она его находит; дальше — всё хуже. Плюс бытовые причины: новая сессия на следующий день, перезапуск бота, переход с сайта в мессенджер — история осталась в другом месте.
Что записывать в память бота отдельно от разговора
Лечится это не увеличением окна, а тем, что важные факты выносят из разговора в структуру. Как только клиент называет имя, адрес, телефон или время, бот записывает это в карточку клиента — в базу данных, а не в текст диалога. Дальше в каждый запрос к модели вместо всей истории подкладывается короткая карточка: имя, адрес, заказ, статус. Это несколько десятков токенов, и они всегда в окне.
Минимальный набор для сервисного бизнеса
Имя, телефон, адрес, что заказано, на какое время, что оплачено. Для магазина — ещё выбранные позиции и способ доставки.
Тот же принцип работает с большими данными
Каталог никто не кладёт в окно целиком: в агрегаторе ТехМаркет парсер держит 5 630+ лотов спецтехники и обновляет их каждые 30 минут — по запросу из базы достаются только подходящие лоты, и модель получает их, а не весь массив. Длинные диалоги сжимают: раз в десять сообщений модель пишет резюме, и дальше в окно идёт оно.
Размеры окна у популярных моделей и почему это не главное
На дату публикации порядок величин такой
У YandexGPT 5.1 Pro окно — 32 тысячи токенов, у последних версий GigaChat — около 128 тысяч, у зарубежных флагманов, которые стоят за ChatGPT, Gemini и DeepSeek, — от 128 тысяч до миллиона. Цифры меняются каждые несколько месяцев — перед выбором модели смотрите её документацию.
Большое окно соблазняет положить туда всё
Работает это плохо по трём причинам. Платите вы за каждый токен в каждом запросе, и диалог на 50 тысяч токенов, отправляемый заново при каждой реплике, обходится заметно дороже карточки клиента. Модели хуже находят факт в середине длинного текста, чем в начале или в конце. И ответ по длинному контексту приходит медленнее, а клиент в чате ждать не любит.
Окно — запас на случай длинного разговора, а не место хранения
Хранится всё в карточке клиента и в базе знаний, о которой мы писали отдельно.
Как проверить своего бота за десять минут
Тест не требует доступа к коду, и его стоит провести до разговора с разработчиком. Откройте бота как клиент. Первым сообщением назовите имя и адрес, дальше задайте восемь–десять вопросов не по теме: часы работы, оплата, парковка. Потом спросите: «Куда вы мне привезёте?» Если бот переспрашивает адрес — история обрезается или адрес не записывается.
Второй тест — на длинное сообщение
Вставьте в чат текст на две страницы и снова спросите про адрес. Если бот его теряет, окно маленькое или инструкция съедает большую его часть.
Третий — на новую сессию
Закройте чат, откройте через час и спросите про свой заказ. Бот без карточки клиента ответит как незнакомому. Для разовых консультаций это нормально; если у вас запись, доставка или повторные покупки — покажите результат тому, кто делал бота.
Когда можно починить самому, а когда звать студию
В конструкторах ботов часть проблем решается настройками. Сократите инструкцию до необходимого. Найдите параметр глубины истории и посмотрите, сколько сообщений бот помнит. Во многих конструкторах есть «переменные» или «поля пользователя» — это и есть карточка клиента: настройте, чтобы бот сохранял туда адрес и имя при первом упоминании и подставлял в ответы.
Самостоятельный путь заканчивается там, где карточку нужно связывать с CRM, базой знаний и оплатой, а диалоги — сжимать и проверять на сотнях реальных обращений. В пакете бот с базой знаний за 100 000 ₽ мы за две недели собираем карточку клиента, базу знаний, интеграцию с CRM и аналитику диалогов. Если бот — часть большой системы с несколькими каналами, складом и отделом продаж, это проект от 600 000 ₽ с исследованием процессов; в пакет за 100 000 ₽ это не входит.
Частые вопросы
Что спрашивают до заказа — с ответами, которые мы даём на брифе.
Что такое токены в нейросети простыми словами?
Токен — кусок текста, на который модель режет всё, что читает и пишет: короткое частое слово — обычно один токен, длинное — два-три, знаки препинания тоже считаются. За токены берут оплату, в токенах измеряют окно контекста. Для русского текста тысяча токенов — примерно страница.
Что такое контекст в нейросети?
Всё, что модель видит при ответе: инструкция разработчика, история разговора, вставленные документы и её собственные предыдущие ответы. Контекст ограничен окном, которое измеряется в токенах. Что не влезло в окно, для модели не существует — отсюда и «забывчивость» бота.
Почему чат-бот забывает предыдущие сообщения?
Три причины: разработчик оставил боту только последние несколько сообщений, длинная инструкция или документ вытеснили начало диалога из окна, или адрес никуда не записали. Реже — новая сессия или перезапуск бота.
Можно ли сделать так, чтобы бот помнил клиента всегда?
Да, если хранить факты о клиенте не в разговоре, а в отдельной карточке в базе: имя, адрес, заказы, статусы. Карточка подкладывается в каждый запрос к модели и не зависит от длины диалога и сессий. Так устроены боты для записи, доставки и повторных продаж.
Как это выглядит на практике
Похожая задача? План и расчёт за 24 часа
Расскажите, что нужно сделать. Подскажем, хватит ли пакета с фиксированной ценой или это проект от 600 000 ₽, и вернёмся с планом.
