← Материалыleogodnik.me

Чувствительные
данные
и нейросети

Хочу поделиться своим отношением к передаче чувствительных данных в нейросети. Я всю жизнь работаю с финансами и с вопросами хранения и передачи чувствительных данных сталкиваюсь постоянно.

Леонид Годник, 26 августа 2026 года

Оглавление

Подход

Конспирология, гигиена и здравый смысл

Начну немного издалека. Ещё с самого начала массового распространения интернета я всегда исходил из того, что любые данные, которые мы каким-либо образом размещаем в сети, потенциально могут где-то агрегироваться и как-то использоваться. Полного контроля над тем, что дальше происходит с данными в интернете, у большинства пользователей по факту никогда не было.

В вопросах передачи и хранения я против конспирологии, но за цифровую гигиену, здравый смысл, последовательность и понимание рисков.

Если говорить про гигиену, то она, безусловно, должна быть. Передавать чувствительные данные, по которым можно реально идентифицировать человека, по разным причинам, в том числе по этическим соображениям, неправильно. Просто потому, что я, например, точно не понимаю, каким образом эти данные могут использоваться в дальнейшем.

При этом я практически уверен, что в Anthropic, OpenAI, Google, Яндексе и других компаниях не сидят люди, которые специально читают загружаемую нами информацию, формируют из неё базы данных и потом продают их конкурентам. В подобную историю я не верю.

Поэтому если данные достаточно анонимны и нам действительно нужно обработать их с помощью нейросети, то лично я не вижу в этом ничего страшного.

Что я понимаю под идентифицируемыми данными?

Человека видно

Допустим, у нас есть банковская выписка, в которой содержится полный набор реквизитов. Например, выплата зарплаты, где есть не только фамилия, имя и отчество человека, но ещё ИНН, номер паспорта, домашний адрес. То есть человека можно совершенно однозначно идентифицировать. Это одна ситуация.

Человека не видно

Совсем другая ситуация, если у нас есть таблица, где кроме фамилии с инициалами и каких-то сумм ничего нет. Более того, мы можем убрать даже заголовки столбцов, чтобы было ещё менее понятно, что именно означают эти данные.

Если обработка такой таблицы нейросетью серьёзно поможет нам в работе, то лично я не вижу здесь проблемы. Мы увеличиваем свою эффективность, используем лучшие доступные инструменты и при этом объективно никому не вредим.

Мне вообще нравится термин «цифровая гигиена», потому что он вызывает хорошую аналогию. Любая гигиена сама по себе классно иллюстрирует этот подход, потому что каждый человек в конечном итоге определяет её разумный уровень для себя.

Можно мыть руки перед каждым приёмом пищи, можно не мыть вообще, можно мыться раз в неделю. Если спросить стоматолога, сколько раз нужно чистить зубы, он даст рекомендации по протоколу: два раза в день, утром и вечером, плюс желательно после каждого приёма пищи. А дальше каждый сам определяет для себя разумный баланс между идеальным соблюдением всех рекомендаций и нормальной жизнью.

Для меня с цифровой гигиеной примерно так же. Нужно понимать, где риск действительно критичен, а где мы начинаем настолько усложнять себе жизнь, что польза уже сомнительна.

К оглавлению
Опасения

Страшно, очень страшно!

Теперь о том, чего именно я реально опасаюсь при работе с нейросетями.

Сразу оговорюсь, это не результат какого-то исследования. Это просто моё личное опасение. Я бы даже процитировал классику:

Страшно, очень страшно! Мы не знаем, что это такое, если б мы знали, что это такое, мы не знаем, что это такое!

Допустим, я загружаю в нейросеть все свои налоговые декларации за последние десять лет. Там есть ИП Годник Леонид Владимирович, мой ИНН, домашний адрес и масса другой информации, которая совершенно однозначно идентифицирует меня.

Мне очевидно, что информация, которую мы передаём нейросетям, каким-либо образом может использоваться внутри этих систем. Как именно она дальше обрабатывается, где хранится, используется ли для обучения и что вообще с ней происходит, для меня во многом загадка. Возможно, есть люди, которые точно знают ответы на эти вопросы, но я думаю, что таких людей на планете не очень много.

И моё реальное опасение заключается не в том, что кто-то специально украдёт мою декларацию.

Я скорее опасаюсь другого сценария. Например, кто-то когда-нибудь спросит нейросеть: «Сколько зарабатывает Леонид Годник?» или просто спросит, кто я такой. И по какой-то причине, из-за ошибки, галлюцинации или особенностей работы системы, она вдруг выдаст данные из моих деклараций, мой ИНН, адрес и другую информацию.

Ещё раз повторю, я совершенно не утверждаю, что это возможно или что именно так всё работает. Это просто моё личное понимание риска.

Поэтому я возвращаюсь к исходной мысли.

К чему я прихожу

Если есть необходимость загружать какие-то данные в нейросеть и обрабатывать их там, лучше сделать это таким образом, чтобы по этим данным невозможно было полноценно и однозначно идентифицировать конкретного человека.

При этом я не сторонник очень сильно загоняться на эту тему и усложнять себе жизнь сложными системами анонимизации там, где это не оправдано. Безусловно, всё это можно сделать. Я даже примерно понимаю как. Но это будет замедлять процессы, а польза далеко не всегда будет соответствовать затратам.

Поэтому для меня это в первую очередь вопрос здравого смысла. Там, где дополнительные меры действительно оправданы, их надо применять.

К оглавлению
Последовательность

А как и где вы сейчас храните данные?

Меня всегда очень забавляли предприниматели, владельцы бизнеса, финансисты и финансовые директора, которые страшно озабочены конфиденциальностью информации и рассказывают, насколько особенно и защищённо она должна храниться.

А потом выясняется, что огромный массив их информации лежит на Google Диске, в Google Таблицах и Google Документах.

Причём я такую ситуацию встречаю постоянно.

И когда эти же люди спрашивают меня: «А как же передавать данные в нейросеть?», мне хочется спросить: «Ребята, а вы Anthropic доверяете меньше, чем Google? Или OpenAI меньше, чем Google?»

Тем более у самого Google есть Gemini, и вся инфраструктура Google сегодня очень плотно интегрирована с искусственным интеллектом.

Поэтому давайте просто быть последовательными.

Если у вас действительно вся информация хранится на собственных хорошо администрируемых серверах или в серьёзных защищённых корпоративных системах, например в корпоративном Google Workspace, OneDrive или Яндекс 360 с осознанно настроенными правами доступа, тогда ваш вопрос про передачу данных в нейросеть абсолютно логичен.

Но если у вас всё лежит в Google Таблицах, при этом половина этих таблиц уже сто раз кем-то скопирована, часть открыта по ссылке для всех, а ещё какая-то часть до сих пор доступна сотрудникам, которые пять лет назад уволились из компании, то возникает довольно резонный вопрос: а почему именно в момент передачи данных нейросети вы вдруг так сильно начали переживать за их конфиденциальность?

К оглавлению
Рамки

Законодательство и договоры никто не отменял

Безусловно, помимо всего, что я написал выше, есть ещё законодательство. Я вообще не юрист, и мой уровень знаний не позволяет давать какие-либо советы в этой сфере. У меня есть лишь общее представление.

Каждый живёт и работает в каком-то государстве, и в каждой стране есть свои законы, регулирующие работу с данными.

Поэтому я всех призываю быть взрослыми людьми и хотя бы на общем уровне знать законодательство той страны, в которой вы работаете, понимать возможные риски и последствия и уже после этого самостоятельно принимать решение с учётом всех факторов: цифровой гигиены, здравого смысла, законодательства и всего остального.

Кроме того, помимо непосредственно законодательства, очень важно учитывать и контрактные обязательства, которые мы на себя принимаем.

Это может быть трудовой договор при найме на работу или договор, который мы подписываем как подрядчик при выполнении каких-либо работ, соглашение о неразглашении и так далее.

Если в договоре есть требования или ограничения, связанные с конфиденциальностью, хранением и передачей данных, ими, безусловно, тоже необходимо руководствоваться.

Ну и, конечно же, имея в виду, с какими данными приходится иметь дело, я настоятельно рекомендую согласовывать такие моменты с непосредственным владельцем этих данных.

К оглавлению
Кто это написал

Леонид Годник — финансы, данные и нейросети в работе. Пишу об этом в телеграм-канале @financialpostpunk.

Открыть канал в Telegram