22.07.2026

ChatGPT, Grok, а теперь DeepSeek: приватные чаты с нейросетями утекают в поиск. И русскоязычных — больше всех

АКТУАЛЬНО | СТАТЬЯ
Автор: Михаил Охотников, руководитель SEO-отдела, AMDG
Когда мой коллега в 2018 году писал, что персональные данные из Google Docs и PowerBI попадают в поисковую выдачу, это казалось крайним случаем — недосмотром пары нерадивых сайтов. Спустя несколько лет история повторяется на новом носителе, и масштаб уже другой. Я взял операторы поиска, подставил домены сервисов-чатов с нейросетями — и открыл сотни чужих переписок с ИИ. Среди них — рабочие задачи, куски кода с доступами, студенческие работы и личные вопросы. Больше всего в моей выборке оказалось русскоязычных чатов.
Рассказываю как SEO-специалист: почему это происходит, что именно сейчас лежит в открытом доступе и что с этим делать бизнесу.
Важно с самого начала: я не выкладываю готовых «дорков» и не публикую ссылок на конкретные чужие чаты. Все примеры ниже обезличены, персональные данные на скриншотах замазаны. Задача статьи — показать масштаб проблемы, а не дать инструкцию по добыче чужих секретов.

Запустите подбор агентства бесплатно!

NewBiz - бесплатный сервис для уверенного выбора исполнителя в сфере рекламы и маркетинга, основанный на статистических данных.

Что реально лежит в поиске: примеры выдачи

Как выглядят доступные чаты с ИИ в поиске
График отпусков в компании с данными сотрудников
Ссылка на персональные данные пользователя, с помощью которых можно идентифицировать конкретного человека


Это не взлом и не утечка базы. Это обычные чаты, которые пользователи сами сделали публичными кнопкой «Поделиться» — и которые затем подхватил поисковый робот.
Это уже было. И не раз
Явление не новое — новый только носитель. Короткая ретроспектива:
  • 2011 — в выдачу попадают СМС «Мегафона» и заказы из интернет-магазинов. Тогда данные покупателей (Ф. И. О., адреса, телефоны, иногда паспорта) оказались доступны по обычному поисковому запросу
  • 2018 — Google Docs, Google-таблицы и отчёты в PowerBI индексируются массово; в выдаче всплывают данные клиентов крупных сервисов. Это и есть та статья коллеги, с которой началась преемственность темы
  • июль — август 2025 — расшаренные чаты ChatGPT попадают в Google. OpenAI признаёт это «недолгим экспериментом» и в конце июля 2025 убирает функцию, делавшую чаты видимыми для поисковиков, после чего начинает деиндексацию
  • август 2025 — у Grok (xAI) кнопка «Поделиться» создавала публичный URL без предупреждения; по данным Forbes, в индекс попало более 370 000 переписок
  • 2026 — та же механика у DeepSeek. Именно её я и разбираю ниже на собственных данных.
Вывод простой: проблема системная. Меняется сервис — механизм остаётся.

Как приватный чат оказывается в Google

Здесь как раз пригодится взгляд SEO-специалиста, потому что большинство разработчиков механизм недооценивает.
Сама по себе кнопка «Поделиться» в чате создаёт страницу с публичным URL. Дальше всё зависит от того, закрыл ли сервис эту страницу от индексации. Если на ней нет noindex, страница не запрещена в robots.txt и не отдаётся заголовок X-Robots-Tag — поисковый робот воспринимает её как обычную публичную веб-страницу и добавляет в индекс. Никакого «взлома» не требуется: сервис сам отдал роботу валидную ссылку.
При этом даже те, кто думает, что «ссылку никто не знает», ошибаются. Поисковик узнаёт о странице десятком способов, помимо прямых ссылок: через браузеры (Chrome, Яндекс.Браузер — это огромная доля трафика), через счётчики аналитики, плагины, а также через сервисы, торгующие обезличенными данными о посещениях. Мой коллега подробно разбирал это ещё в 2018-м, и с тех пор каналов только прибавилось.
Миф, который стоит утечек: «ссылка есть только у того, кому я её отправил»
Главное заблуждение пользователя: раз я нажал «Поделиться» и скинул ссылку коллеге — её видит только коллега. На деле нажатие этой кнопки у ряда сервисов означало публикацию в открытый интернет.
И второе, ещё более неприятное: удаление чата не равно удалению публичной ссылки. Даже когда сервис спохватывается и закрывает функцию, поисковый кеш и веб-архивы уже сохранили копии. В случае с ChatGPT именно так и вышло: функцию убрали, но часть контента осталась в кеше и архивах. То есть «отозвать» уже утёкший чат в общем случае нельзя.

Что показал анализ выборки чатов DeepSeek

Я собрал срез из ~200 публичных share-страниц DeepSeek, попавших в поиск, и обезличил их в агрегированную статистику: считались только факты и метаданные, содержимое сообщений нигде не сохранялось. Это срез, а не репрезентативная картина всего индекса — выборка ограничена тем, что отдал поиск, и на неё влияют перекосы (о них ниже). Но и среза достаточно, чтобы увидеть характер проблемы.
Ключевое из данных
  • Русский язык — крупнейший в выборке: около 42% распознанных чатов. Всего в срезе встретилось 12 языков — от английского и китайского до персидского. Тезис «под угрозой только англоязычные» неверен: запросы русскоязычных пользователей лежат в открытом поиске наравне со всеми.
  • 26% чатов — с прикреплённым файлом: превью загруженного документа или таблицы. Это буквально Shadow AI в кадре — рабочие файлы, отправленные в потребительский чат-бот.
  • Около трети чатов содержат код — фрагменты, которые разработчики вставляют для отладки (иногда вместе с доступами).
  • По темам картина такая: код ~36%, «деньги» ~17% (об этой цифре ниже отдельная оговорка), поисковые запросы ~9%, подготовка контента ~6%, учёба ~6%, рабочие задачи ~5%, медицина ~4%; остальное — в категории «другое» (~17%). Обратите внимание на связку «рабочие задачи + подготовка контента + код»: это ровно тот пласт, где в потребительский чат-бот попадают рабочие материалы — тексты для каналов, служебные документы, куски проектов.
  • Чувствительные данные — в 3% чатов: ключи/токены, email, телефоны, номер карты, документ. Каждое совпадение по ключам и картам я проверил вручную; значения нигде не выписывались.
Цифра 3% выглядит небольшой, но её нужно читать в масштабе индекса. Точное число проиндексированных страниц поисковики больше не показывают, но нам удалось насчитать как минимум 5000 разных share-страниц с чатами DeepSeek — а на деле их может быть на порядок больше. Даже 3% от пяти тысяч страниц — это около 150 переписок с секретами и персональными данными. А учитывая, что удалить их из кеша нельзя, критична каждая.
Отдельная находка — криптоспам. Около 13% выборки — это один и тот же шаблонный текст криптокампании (wallet address / reward program). Похоже, функцию шаринга DeepSeek эксплуатируют для SEO-/криптонакрутки. То есть у открытых share-ссылок есть и вторая, неочевидная проблема, помимо утечек: их используют как площадку для спама.
Пример, который стоит целой статистики. В одном сверхдлинном диалоге совпали сразу 4 из 5 типов чувствительных данных — email, телефон, номер карты и документ в рамках одной переписки. Такого набора уже потенциально достаточно, чтобы установить личность конкретного человека. Это и есть цена «безобидной» кнопки «Поделиться».

Кто в зоне риска: сценарий для бизнеса

Представьте типичную ситуацию. Сотрудник просит нейросеть помочь с рабочей задачей: вставляет кусок кода вместе с API-ключом, или загружает квартальный отчёт, или обсуждает переписку с клиентом. Потом нажимает «Поделиться», чтобы скинуть результат коллеге в мессенджер.
Через какое-то время эта страница оказывается в индексе. Дальше достаточно тематического поискового запроса — и внутренние данные компании, доступы или ПД клиентов доступны любому. Никакого взлома периметра: утечка произошла через личную инициативу сотрудника и потребительский сервис, который вы не контролируете.
Это и есть Shadow AI — использование сотрудниками неподконтрольных ИИ-сервисов в рабочих целях. Для бизнеса это уже не гипотетический, а измеримый канал утечки.

Обратная сторона: по чату видно, кто готовил контент через ИИ

Отдельный сюжет, который всплыл в выборке, — чаты, созданные ради написания контента. Их в срезе заметная доля (подготовка контента + рабочие задачи), и они опасны иначе, чем утечки паролей.
Логика простая. Если текст сгенерировали в DeepSeek и опубликовали, готовый результат лежит в открытом чате. Дальше достаточно взять кусок итогового текста и вбить его в поиск — и он находится уже на конкретном ресурсе: в определённом Telegram-канале, на сайте, в статье. Так связка «черновик в чате → публикация» восстанавливается за пару минут, без всякого взлома.
Дальше — интереснее. В самом диалоге часто виден не только текст, но и бриф: какой тезис автор хочет протранслировать (иногда прямо, иногда — читаемый между строк), какой посыл заложен, каких выводов он добивался от модели. То есть по чату видно не только что опубликовано, но и зачем. А поскольку в запросах к модели регулярно упоминаются конкретные проекты и компании, их даже не нужно вычислять отдельно — они названы прямым текстом в самом чате.

Отдельный сюжет, который всплыл в выборке, — чаты, созданные ради написания контента. Их в срезе заметная доля (подготовка контента + рабочие задачи), и они опасны иначе, чем утечки паролей.
Логика простая. Если текст сгенерировали в DeepSeek и опубликовали, готовый результат лежит в открытом чате. Дальше достаточно взять кусок итогового текста и вбить его в поиск — и он находится уже на конкретном ресурсе: в определённом Telegram-канале, на сайте, в статье. Так связка «черновик в чате → публикация» восстанавливается за пару минут, без всякого взлома.
Дальше — интереснее. В самом диалоге часто виден не только текст, но и бриф: какой тезис автор хочет протранслировать (иногда прямо, иногда — читаемый между строк), какой посыл заложен, каких выводов он добивался от модели. То есть по чату видно не только что опубликовано, но и зачем. А поскольку в запросах к модели регулярно упоминаются конкретные проекты и компании, их даже не нужно вычислять отдельно — они названы прямым текстом в самом чате.

Вывод, который стоит подчеркнуть для бизнеса: любой материал, который компания готовит силами ИИ, потенциально может обернуться против неё. 
Опубликованный пост — это ещё и оставленный в открытом доступе бриф с настоящими намерениями, названными партнёрами и внутренней логикой кампании. Для маркетинга, PR и любых коммуникаций это репутационный риск ровно там, где ИИ должен был экономить время.

Кто виноват и легально ли это

Ответственность. Основная доля — на сервисах, которые проектируют кнопку «Поделиться» без внятного предупреждения и без noindex по умолчанию. Пользователь честно не понимает, что «поделиться с коллегой» и «опубликовать в интернете» — в их реализации одно и то же. Часть ответственности — на самих пользователях (не читают, что именно они делают публичным) и на поисковых системах, которые недостаточно объясняют механику индексации даже профессионалам.
Легальность. Индексация публичной страницы поисковиком сама по себе законна — робот не знает, персональные там данные или нет. Но как только в таких чатах оказываются ПД, включается регуляторика: GDPR для данных граждан ЕС и 152-ФЗ для данных россиян. Отдельный вопрос — юрисдикция: DeepSeek — китайская компания, и вопрос о том, где физически хранятся данные (data residency), для бизнеса не праздный. (Это фактическая сторона; правовую оценку конкретной ситуации оставляю юристам).

Что делать

Бизнесу и службам безопасности
  • Ввести политику в отношении Shadow AI: явно определить, какие данные нельзя вставлять в потребительские ИИ-сервисы (код с доступами, ПД клиентов, внутренние документы).
  • Для рабочих задач использовать корпоративные/enterprise-варианты, где шаринг не индексируется, либо локальные модели.
  • Проверить собственную экспозицию: поискать, не попали ли в индекс страницы шаринга, связанные с вашими данными, и запросить их удаление.
  • Помнить, что удаление чата ≠ удаление публичной ссылки: дополнительно работать с кешем и архивами.
Сервисам с ИИ-чатами
  • Показывать явное предупреждение при создании публичной ссылки: «наличие ссылки только у вас не гарантирует приватность».
  • Закрывать страницы шаринга от индексации по умолчанию (noindex, robots.txt, X-Robots-Tag), а не полагаться на один метод.
  • Проверять, что защита работает во всех поисковых системах, а не только в Google, — директивы индексации у разных поисковиков расходятся.
На момент подготовки материала DeepSeek уже начал закрывать страницы шаринга от индексации — по сценарию, знакомому по ChatGPT: сначала функция работает без ограничений, затем, после огласки, сервис спохватывается. Но, как и в случае с ChatGPT, это не отменяет уже случившегося: страницы, попавшие в индекс и кеш ранее, остаются доступными.


Методология исследования
  • Собран срез ~200 публичных share-страниц DeepSeek, попавших в индекс поисковых систем.
  • Повторные ссылки на один чат схлопнуты. 
  • Из каждой страницы извлекались только метаданные и факты (язык, тема, наличие кода/файла, булевы признаки чувствительных данных) — содержимое сообщений не сохранялось; чувствительные данные фиксировались как факт, а не как значение. 
  • Язык определялся автоматически по объёму пользовательского текста; тема и признаки чувствительных данных — эвристически (оценка, не точное значение). 
  • Совпадения по ключам и картам верифицировались вручную. 
  • Два аномально длинных диалога исключены из подсчётов по объёму. 
  • Проценты по языкам и темам считаются от числа распознанных чатов, выборка не претендует на репрезентативность всего индекса.
Больше информации в нашем телеграм-канале. NewBiz Медиа — проект о новом лидерстве, лучших бизнес-практиках, аутентичном управлении и уверенном выборе решений, определяющих будущее брендов и отрасли.