← Статьи

безопасность

Как обезличить документ перед отправкой в ИИ

Убрать фамилии — не обезличивание: документ опознаётся связкой из ИНН, номера, суммы и редкой формулировки. Разбор приёма с метками и таблицей соответствия, проверочный промпт и объяснение, почему замену делают до отправки, а не руками самого ИИ.

6 мин чтения · 03.08.2026

С чего это обычно начинается

К понедельнику нужно короткое резюме длинного договора: предмет, сроки, ответственность, на что смотреть в первую очередь. Читать целиком некогда, и вы решаете отдать текст ИИ.

Перед отправкой вы делаете то, что кажется разумным: проходите поиском по фамилиям сторон и подписантов и заменяете их на условные. Персональные данные убраны — можно отправлять.

Посмотрите, что осталось. Номер договора и дата. ИНН обеих организаций — они стоят в реквизитах, а часто ещё и в колонтитуле. Сумма с точностью до копейки. Срок поставки, привязанный к конкретному календарному дню. Адрес склада. И пункт про эксклюзивность, сформулированный необычно: его писал ваш юрист, и такой формулировки больше нигде нет.

Каждого из этих признаков по отдельности недостаточно. Все вместе они опознают документ надёжнее, чем фамилия: однофамильцев много, а договор с таким номером, такой суммой и такой датой — один.

Чем документ опознаётся на самом деле

Признак, который сам по себе никого не называет, но в сочетании с другими сужает круг до одного, в терминологии NIST называется квазиидентификатором. Индекс, дата, должность, сумма, номер — по отдельности безобидны, вместе работают как имя.

Насколько быстро сужается круг, показывает работа в Nature Communications: авторы оценивают, что 99,98% жителей США были бы корректно переопознаны в произвольном наборе данных по пятнадцати демографическим признакам. Пятнадцать — это немного: пол, дата рождения, индекс и ещё дюжина строк обычной анкеты.

Второй пример старше: исследователи взяли опубликованный набор обезличенных оценок фильмов 500 000 подписчиков Netflix и, используя открытую базу IMDb как внешнее знание, сопоставили записи с конкретными людьми. Имена из набора были удалены; осталась структура предпочтений — её хватило.

Отсюда главное свойство: обезличивание ломается не изнутри, а снаружи. Документ опознаёт не то, что в нём написано, а совпадение написанного с тем, что читающий уже знает. Поэтому у вопроса «достаточно ли я убрал» нет ответа в отрыве от второго вопроса — достаточно относительно чьего знания.

Пять классов признаков

Список, по которому проходят документ. Он короткий намеренно: длинный чек-лист не выполняется.

1. Люди и роли. ФИО, должности, подписи, инициалы в колонтитулах и в имени файла, телефоны, адреса почты.

2. Организации. Названия, ИНН, КПП, ОГРН, банковские реквизиты, юридические и фактические адреса, домены в адресах почты.

3. Идентификаторы документа. Номер и дата, номера приложений, спецификаций, счетов, заявок, внутренние регистрационные индексы.

4. Числа и сроки. Суммы, ставки, объёмы, конкретные календарные даты, нетиповые сроки.

5. Редкие формулировки. Необычный пункт, внутренний термин, название проекта, фраза, которая встречается ровно в одном документе. Этот класс не выглядит как данные — и остаётся в тексте после того, как всё остальное уже заменено.

Проверка на пятый класс простая: если фрагмент находится поиском и даёт одно совпадение — он опознаёт документ. Оговорка: поисковый запрос — это тоже отправка текста третьей стороне, проверяйте так только те фрагменты, которые не жалко отправить.

Приём: метки и таблица соответствия

Шесть шагов, первые пять — без ИИ.

Работайте с копией. Оригинал не трогаем — он понадобится для обратной сверки.

Заведите таблицу соответствия. Два столбца: метка и то, что за ней стоит. Этот файл остаётся у вас и не покидает вашу машину ни при каких условиях.

Замену делайте механически. Поиск по документу, замена всех вхождений. Один объект — одна метка во всём тексте.

Метки — заглавными в квадратных скобках: [ЗАКАЗЧИК], [ИСПОЛНИТЕЛЬ], [ДОГОВОР_НОМЕР]. Их видно глазом при вычитке, и они не встречаются в обычном тексте, поэтому не смешиваются с содержанием ни при чтении, ни при обратной подстановке.

С числами два режима. Если сумма участвует в расчёте — посчитать пеню, сверить итог — метка ломает задачу: заменяйте число другим числом, сохранив порядок величины и соотношения между числами. Если число в расчёте не участвует, ставьте метку. Даты сдвигайте все на одно и то же количество дней: интервалы сохранятся, календарь — нет.

Обратная подстановка — после получения ответа, по той же таблице, в обратную сторону.

Структура таблицы — метка слева, расшифровка справа; значения вы заполняете у себя:

  • [ЗАКАЗЧИК] — название организации-стороны, её ИНН и КПП
  • [ИСПОЛНИТЕЛЬ] — название второй организации, её ИНН и КПП
  • [ДОГОВОР_НОМЕР] — номер и дата договора
  • [СУММА_ОСНОВНАЯ] — цена договора
  • [АДРЕС_ПОСТАВКИ] — адрес пункта отгрузки
  • [ПРОЕКТ] — внутреннее название проекта

Первый прогон долгий: вы одновременно составляете список признаков. Дальше он повторяется почти без изменений — договор, счёт, служебная записка и письмо опознаются одним и тем же набором полей. Со вторым документом того же типа вы идёте по готовому перечню.

Проверка: пусть ИИ поработает атакующим

Сделав замены, не отправляйте сразу рабочий вопрос. Сначала отдайте очищенный текст на проверку — но не с просьбой обезличить, а с просьбой опознать. Разница в проверяемости: список найденных зацепок вы сверяете с документом строка за строкой, а утверждение «ничего не осталось» сверить не с чем.

Ниже приложен текст, из которого я попытался убрать всё, что позволяет опознать документ, организации и людей. Твоя задача — не переписывать текст, а проверить его. Действуй как человек, который хочет понять, о каком именно документе и какой организации идёт речь. 1. Выпиши все фрагменты, которые сужают круг возможных документов или организаций: идентификаторы, числа, даты, адреса, домены, должности, редкие формулировки, внутренние термины. 2. Для каждого фрагмента укажи, что именно он выдаёт и насколько сильно сужает круг. 3. Отдельно перечисли комбинации: признаки, безобидные по отдельности, но опознающие вместе. 4. Отметь места, где замена сделана непоследовательно: один и тот же объект назван разными метками или метка проставлена не везде. 5. Не предлагай варианты замены и не пытайся угадать, что стояло на месте меток. Если зацепок не осталось, так и напиши.

Ответ — список для вычитки, а не вердикт. Пункт 3 важнее остальных: отдельная строка может быть безобидной, а связка таких строк — нет.

Почему обезличивание делается до отправки, а не силами ИИ

Соблазн — приложить документ и написать «убери отсюда всё лишнее». Четыре причины, почему такой порядок не работает.

Просьба обезличить — это уже отправка. Если утечка возможна, она произошла в момент нажатия кнопки, а не когда пришёл ответ.

Замена получается вероятностной. Модель может пропустить часть вхождений — один из ИНН, одно упоминание в колонтитуле — и не сообщит об этом: пропуск неотличим от отсутствия. Механический поиск-замена показывает число найденных вхождений, и его можно сверить с тем, сколько вы ожидали найти.

Метки будут непоследовательными. В одном абзаце организация станет [КОМПАНИЯ], в другом [ЗАКАЗЧИК], в третьем останется как была. Такой текст нельзя ни читать, ни собрать обратно.

Таблицы соответствия не останется. Обратная подстановка превратится в ручную работу по всему документу, и вы получите ответ, который нельзя использовать без переписывания.

Отсюда рабочий порядок из трёх шагов: замену делает человек или простой скрипт локально; проверку делает ИИ на уже очищенном тексте; рабочий вопрос задаётся третьим.

Где приём не работает или ломается

Вы отправляете файл, а не текст. В файле остаются автор, организация, история правок, примечания, скрытые строки и столбцы, второй лист. Метки в видимом тексте на это не влияют. Надёжнее скопировать содержимое в чистый новый документ или отправлять текстом.

Скан или фотография. Замена в текстовом слое не меняет изображение. Печать, подпись и угловой штамп остаются на картинке.

Документ уникален по сути. Если задача звучит как «единственный подрядчик с таким допуском» — заменять нечего: сама постановка вопроса опознаёт участников. Такой текст либо не отправляют, либо переформулируют задачу абстрактно, без приложения документа.

Ответ становится хуже. Обезличивание — это потеря информации. Если вопрос завязан ровно на то, что вы убрали, ответ будет более общим, чем нужно. Вывод в такой ситуации — не отправлять вовсе, а не ослаблять замену.

Обратная подстановка бьёт мимо. Если одна метка является началом другой — [СУММА] и [СУММА_НДС] — автозамена по короткой испортит длинную. Правило: ни одна метка не должна быть началом другой, либо подставляйте от самой длинной к самой короткой.

Изменённые числа возвращаются в ответе. Сдвинув суммы и даты, вы получите ответ про сдвинутые. Пересчёт на настоящих числах — ваша работа, и это не ошибка ИИ, а следствие вашего же приёма.

Таблица соответствия — новый объект риска. Она и есть ключ: по ней восстанавливается всё. Если она лежит в той же папке, уходит в письме или пересылается в переписке, обезличивание отменяется целиком. Держите её отдельно и удаляйте, когда задача закрыта.

Одна чужая отправка обнуляет вашу аккуратность. Если тот же файл коллега приложит целиком, ваша работа не имеет значения. Приём индивидуальный, защита — только командная.

Техническая мера не закрывает договорную. Посмотрите, как в вашем соглашении о конфиденциальности определён предмет: если речь идёт об информации в любой форме, а не только о персональных данных, метки этого обязательства не снимают. Что и в каком виде можно выносить наружу — вопрос к тексту договора и внутренним правилам, а не к качеству обезличивания.

Что сделать сегодня

Одно действие, на своём документе.

Возьмите документ, который вы уже отправляли в чат — тот самый, где заменили фамилии. Ничего никуда не отправляя, пройдите по нему с пятью классами признаков и выпишите в столбик всё, что нашли. Затем посчитайте два числа: сколько признаков вы убрали тогда и сколько осталось бы.

Второе число — замер, а не упрёк: оно показывает, какую долю признаков снимает привычная замена фамилий. Из того же столбика получается шаблон таблицы соответствия для следующего документа того же типа.

Источники

Сделать это прямо сейчас: инструмент обезличивания найдёт в тексте реквизиты, суммы и имена, заменит метками и отдаст таблицу соответствия. Работает в браузере — документ никуда не отправляется.

Дальше — система, а не отдельный приём

Статья даёт один метод. В курсе — шесть модулей: от постановки задачи до сборки своего помощника, с готовыми промптами и разбором ошибок. Первый модуль открыт бесплатно.

Посмотреть курс Бесплатные промпты

Читать дальше

Корпоративный доступ к ИИ: что меняется, а что не меняется никогда

безопасность · 10 мин

Три круга данных: что можно и что нельзя загружать в ИИ

безопасность · 7 мин

Модели, токены и кредиты: за что вы платите, когда пользуетесь ИИ

инструменты · 9 мин