Председатель правления АРПП «Отечественный софт» Наталья Касперская обратила внимание на инициативу Ассоциации Больших Данных относительно обработки персональных данных граждан.
Наталья Касперская пишет в своем телеграм-канале:
«Прочла новость от 3 августа про то, что участники Ассоциации Больших данных (АБД), куда входят крупные отечественные компании, разрабатывающие системы ИИ, попросили разрешить Минцифры обрабатывать большие персональные данные без согласия граждан для разработки, обучения и использования ИИ.
Мотивация АБД следующая: «Сейчас такие данные продолжают считаться персональными даже после обезличивания, что может тормозить развитие ИИ в РФ. Участники рынка считают, что сейчас рынок данных в России развит слабо, а большинство датасетов остается внутри крупных экосистем».
Защиту данных АБД обещает обеспечить через так называемые «технологии повышения приватности». Я задумалась, насколько такой подход опасен с точки зрения защиты информации и существуют ли действительно методы гарантированной деперсонализации данных?
Технологии повышения приватности (Privacy Enhancing Technologies — PETs) — это набор математических и программных методов защиты личных данных, позволяющих обрабатывать, передавать и хранить информацию без риска ее утечки или раскрытия. В российском законодательстве понятие PETs отсутствует.
РЕТs включают в себя несколько способов деперсонализации данных.
Коротко говоря, существует 6 основных способов деперсонализации, которые я приведу ниже, и прокомментирую.
1. «Замыливание» персональных данных путём добавления к ним статистического шума и разных нерелевантных данных. В принципе, работающий инструмент, но он требует аккуратного подбора соответствующего «шума», чтобы его было сложно снять программным способом и вычленить-таки исходные данные.
2. Государственный обмен данными — это когда некоторая группа исследовательских или медицинских учреждений обменивается данными (например, о болезнях и симптомах), не разглашая персональных данных. В целом, этот метод рабочий и уже широко используется в нашей стране. Хотя, строго говоря, анамнез пациента за несколько лет абсолютно уникален — то есть отстоит далеко от других анамнезов в пространстве данных. Его практически нельзя эффективно обезличить. Стоит участнику «обмена данными» добавить к анамнезу обогащение имеющимися у него данными — например, сведениями о поездках на такси в клиники за последние 10 лет, или данными о заказах в аптеках, или запросами о лекарствах в поисковиках, или данными о страховых возмещениях по ОМС — как тут же сличением векторов однозначно восстанавливается ФИО пациента. Изнутри системы риск утечки данных существует и безо всякого обмена, просто через сотрудников этих самых учреждений.
3. Безопасные многосторонние вычисления — когда университеты, например, обмениваются уже между собой вычисленными данными (сигнатурами, «векторами», «хэшами») об объектах исследования, не передавая персональную информацию вообще. Но для этого способы вычисление «хэшей» и знания об их структуре должны быть общими, что снижает надёжность обезличивания.
4. Гомоморфное шифрование — это сложный математический алгоритм, который даёт возможность делать произвольные вычисления на зашифрованных данных без их расшифровки. Лет 10 назад это стало прорывом в области шифрования. Примеры использования — осуществление поиска по запросу без знания самого запроса; фильтрация спама без чтения содержимого писем; подсчёт голосов без вскрытия конвертов; тесты ДНК без чтения самих ДНК, и многое другое. Это, наверное, самый надёжный способ деперсонализации данных. Правда, я не уверена, что шифрованные данные можно применять для обучения нейросетей.
5. Псевдоанонимизация — когда каждому лицу присваивается идентификатор вместо имени, а потом эти идентификаторы ещё и шифруются. Это довольно дешёвый способ, но не очень надёжный. Потому что идентификацию человека можно провести не по его идентификатору, а по набору его уникальных признаков, например, по лицу или географии перемещений (по «четырём точкам» в городе).
6. Есть ещё метод синтетических данных, который, например, используем мы в ИнфоВотч для тестирования своих продуктов. Он означает генерацию реалистично выглядящих персональных данных в большом количестве. Способ стопроцентно гарантирует безопасность личных данных реальных людей, поскольку не использует их вообще. Но, к сожалению, он практически непригоден для обучения ИИ-моделей, так как последним нужны именно реальные данные.
Резюмирую вышесказанное: методы обезличивания действительно существуют и вроде как даже довольно эффективные, по заверениям разработчиков.
Но, во-первых, даже на первый взгляд перечисленные методы плохо подходят для обучения нейросетей.
Во-вторых, чем надёжнее скрыты (зашумлены, зашифрованы) данные, тем сложнее и дороже их использование для обучения ИИ. А если же компании получат право самостоятельно обезличивать данные, то какой метод они выберут — самый надёжный или самый дешёвый?
В-третьих, проверка и сертификация анонимизации — это технически довольно сложная задача. Кто будет этим заниматься? Или дело ограничится собственными добровольными декларациями компаний в духе «мамой клянусь, что надёжно»?
Ну, и наконец, есть виды данных, обезличивание на которых вообще не работает. Например, распознавание лиц. Обезличивай – не обезличивай, а лицо всё равно привязано к конкретному человеку.
Ну и основной вопрос: а зачем вообще АБД нужны персональные данные?
Чему на самом деле можно обучать ИИ-модели на личных данных граждан и зачем? Показу ещё более таргетированной рекламы для стимуляции ещё большего числа импульсных покупок? Построению индивидуальных образовательных траекторий, ценность которых не просто сомнительная, а прямо нарушает право на личную жизнь и судьбу? Построению социального рейтинга?
Точно ли стоит ради этих сомнительных или прямо вредных целей отменять или ослаблять ФЗ-152 о защите персональных данных, который в ноябре 2024 года был усилен законодателями при активном сопротивлении цифрового бизнеса и АБД (помните — были введены оборотные штрафы, уголовная ответственность руководства компаний и госорганов за утечку ПДн)?
Роскомнадзор, кстати, внимательно следит за выполнением этого закона, защищая права граждан на частную жизнь. Поэтому я всё-таки надеюсь, что данная антиконституционная и антиобщественная инициатива АБД реализована не будет».


