<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Differential Privacy on kenji.blog</title><link>http://kenji.blog/ru/tags/differential-privacy/</link><description>Recent content in Differential Privacy on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>ru</language><copyright>kenjinote</copyright><lastBuildDate>Sat, 12 Sep 2026 12:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/ru/tags/differential-privacy/index.xml" rel="self" type="application/rss+xml"/><item><title>Компромисс между конфиденциальностью и удобством: судьба персональных данных в эпоху больших данных</title><link>http://kenji.blog/ru/p/privacy-vs-convenience-big-data/</link><pubDate>Sat, 12 Sep 2026 12:00:00 +0900</pubDate><guid>http://kenji.blog/ru/p/privacy-vs-convenience-big-data/</guid><description>&lt;img src="http://kenji.blog/p/privacy-vs-convenience-big-data/img/eyecatch.jpg" alt="Featured image of post Компромисс между конфиденциальностью и удобством: судьба персональных данных в эпоху больших данных" />&lt;h1 id="компромисс-между-конфиденциальностью-и-удобством-судьба-персональных-данных-в-эпоху-больших-данных">Компромисс между конфиденциальностью и удобством: судьба персональных данных в эпоху больших данных
&lt;/h1>&lt;p>В современном цифровом обществе мы генерируем огромные объемы данных в нашей повседневной жизни. Непрерывно собираются разнообразные «большие данные», такие как данные о местоположении со смартфонов, публикации в социальных сетях, история покупок в интернет-магазинах и данные о здоровье, фиксируемые носимыми устройствами. Эти данные необходимы для развития ИИ (искусственного интеллекта) и предоставления персонализированных услуг, что делает нашу жизнь более удобной и насыщенной.&lt;/p>
&lt;p>Однако, с другой стороны, риск нарушения конфиденциальности, связанный со сбором и использованием персональных данных, стал серьезной социальной проблемой. Риски, скрывающиеся за удобством, такие как утечки данных, передача данных третьим лицам без согласия пользователей и опасения по поводу создания государства тотального контроля, достигли масштабов, которые невозможно игнорировать. В этой статье мы дадим чрезвычайно подробное техническое объяснение того, как решается эта современная дилемма — «компромисс между конфиденциальностью и удобством» — с точки зрения как технологий, так и законодательства, с учетом последних тенденций.&lt;/p>
&lt;h2 id="1-парадигма-общества-управляемого-данными-и-эволюция-архитектуры-данных">1. Парадигма общества, управляемого данными, и эволюция архитектуры данных
&lt;/h2>&lt;p>Для эффективного сбора и использования данных компании внедряют различные архитектуры данных. Произошел переход от ранее доминирующих «хранилищ данных» (Data Warehouse) к «озерам данных» (Data Lake), которые централизованно управляют всеми данными, включая неструктурированные, а в настоящее время происходит сдвиг парадигмы в сторону распределенной архитектуры — «сетки данных» (Data Mesh).&lt;/p>
&lt;h3 id="централизованное-озеро-данных-и-конвейер-анонимизации">Централизованное озеро данных и конвейер анонимизации
&lt;/h3>&lt;p>Озеро данных — это репозиторий хранилища, в котором хранятся огромные объемы необработанных данных в их исходном формате. Однако использование необработанных данных, содержащих персональные данные (PII: Personally Identifiable Information), напрямую для анализа приводит к серьезным нарушениям нормативных требований. Поэтому между озером данных и средой анализа внедряется строгий «конвейер анонимизации» (Anonymization Pipeline).&lt;/p>
&lt;p>На следующем рисунке показан процесс работы конвейера анонимизации в типичном централизованном озере данных.&lt;/p>
&lt;pre class="mermaid">
flowchart TD
A[&amp;#34;Источники данных (Веб, IoT, Мобильные)&amp;#34;] --&amp;gt;|&amp;#34;Сбор данных&amp;#34;| B[&amp;#34;Зона необработанных данных (Неизмененные)&amp;#34;]
B --&amp;gt;|&amp;#34;Процесс ETL&amp;#34;| C[&amp;#34;Конвейер анонимизации и очистки&amp;#34;]
C --&amp;gt;|&amp;#34;Псевдонимизация / Токенизация&amp;#34;| D[&amp;#34;Доверенная зона (k-анонимизированные)&amp;#34;]
D --&amp;gt;|&amp;#34;Проектирование признаков&amp;#34;| E[&amp;#34;Очищенная зона (Готово для ML)&amp;#34;]
E --&amp;gt;|&amp;#34;Обучение модели&amp;#34;| F[&amp;#34;Инструменты BI и модели ML&amp;#34;]
C --&amp;gt;|&amp;#34;Журналы аудита&amp;#34;| G[&amp;#34;Центр безопасности и соответствия требованиям&amp;#34;]
&lt;/pre>
&lt;p>В таком конвейере при поступлении данных автоматически применяются такие процессы, как хеширование, маскирование и шифрование. Однако, как будет показано ниже, простое маскирование или псевдонимизация (Pseudonymization) не могут полностью исключить риск «повторной идентификации» (Re-identification) путем сопоставления с другими источниками данных.&lt;/p>
&lt;h2 id="2-глубокое-понимание-технологий-защиты-конфиденциальности-pets">2. Глубокое понимание технологий защиты конфиденциальности (PETs)
&lt;/h2>&lt;p>Ключом к достижению баланса между конфиденциальностью и использованием данных являются «технологии повышения конфиденциальности» (Privacy-Enhancing Technologies: PETs). Здесь мы подробно объясним математические определения и техническую реализацию основных технологий PETs, которые играют чрезвычайно важную роль в современном анализе больших данных и машинном обучении.&lt;/p>
&lt;h3 id="21-k-анонимность-k-anonymity-и-ее-расширения">2.1 k-анонимность (K-Anonymity) и ее расширения
&lt;/h3>&lt;p>Предложенная Латаньей Суини и Пьеранджелой Самарати в 1998 году «k-анонимность» является основополагающей концепцией защиты конфиденциальности при публикации данных. Это означает, что любая запись в наборе данных должна быть неотличима как минимум от $k-1$ других записей.&lt;/p>
&lt;p>Атрибуты в базе данных можно разделить на три основные категории:&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Идентификаторы (Explicit Identifiers)&lt;/strong>: информация, позволяющая напрямую идентифицировать человека, например, имя или идентификационный номер (обычно удаляются или шифруются).&lt;/li>
&lt;li>&lt;strong>Квази-идентификаторы (Quasi-Identifiers: QIs)&lt;/strong>: информация, которая сама по себе не может идентифицировать человека, но позволяет сделать это в комбинации, например, возраст, пол, почтовый индекс.&lt;/li>
&lt;li>&lt;strong>Конфиденциальные атрибуты (Sensitive Attributes)&lt;/strong>: информация, подлежащая защите, такая как название заболевания или годовой доход.&lt;/li>
&lt;/ol>
&lt;p>k-анонимность гарантирует, что существует как минимум $k$ одинаковых комбинаций квази-идентификаторов (класс эквивалентности: Equivalence Class). Однако k-анонимность уязвима для «атаки однородности» (Homogeneity Attack) и «атаки с использованием фоновых знаний» (Background Knowledge Attack). Например, если все $k$ человек в определенном классе эквивалентности имеют одно и то же заболевание (конфиденциальный атрибут), название заболевания будет раскрыто, даже если сохраняется k-анонимность.&lt;/p>
&lt;p>Для преодоления этой проблемы были предложены следующие расширенные модели:&lt;/p>
&lt;ul>
&lt;li>&lt;strong>l-разнообразие (l-diversity)&lt;/strong>: гарантирует, что конфиденциальный атрибут в каждом классе эквивалентности принимает как минимум $l$ различных значений.&lt;/li>
&lt;li>&lt;strong>t-близость (t-closeness)&lt;/strong>: гарантирует, что расстояние (например, расстояние землекопа - Earth Mover&amp;rsquo;s Distance) между распределением конфиденциального атрибута в каждом классе эквивалентности и его распределением во всем наборе данных не превышает порог $t$.&lt;/li>
&lt;/ul>
&lt;h3 id="22-дифференциальная-приватность-differential-privacy-dp">2.2 Дифференциальная приватность (Differential Privacy: DP)
&lt;/h3>&lt;p>Преодолев ограничения модели k-анонимности, «дифференциальная приватность» (Differential Privacy), предложенная Синтией Дворк и ее коллегами в 2006 году, сегодня широко применяется как наиболее строгий математический стандарт конфиденциальности. Технологические гиганты, такие как Apple, Google и Microsoft, применяют эту $\epsilon$-дифференциальную приватность при сборе телеметрических и статистических данных от пользователей.&lt;/p>
&lt;h4 id="математическое-определение-дифференциальной-приватности">Математическое определение дифференциальной приватности
&lt;/h4>&lt;p>Рандомизированный алгоритм (Randomized Algorithm) $\mathcal{M}$ удовлетворяет $\epsilon$-дифференциальной приватности, если для любых двух соседних наборов данных $D$ и $D'$, отличающихся ровно на одну запись (то есть $\|D - D'\|_1 = 1$), и любого подмножества возможных результатов $S \subseteq \text{Range}(\mathcal{M})$ выполняется следующее неравенство:&lt;/p>
$$ \Pr[\mathcal{M}(D) \in S] \le e^\epsilon \Pr[\mathcal{M}(D') \in S] $$&lt;p>Здесь $\epsilon$ (бюджет приватности) — это неотрицательный параметр, контролирующий уровень защиты конфиденциальности. Чем меньше $\epsilon$, тем сильнее защита конфиденциальности, но при этом снижается полезность (утилитарность) данных.&lt;/p>
&lt;p>Кроме того, широко используется ослабленная модель — $(\epsilon, \delta)$-дифференциальная приватность, которая допускает нарушение гарантии конфиденциальности с очень малой вероятностью $\delta$.&lt;/p>
$$ \Pr[\mathcal{M}(D) \in S] \le e^\epsilon \Pr[\mathcal{M}(D') \in S] + \delta $$&lt;h4 id="механизм-лапласа-laplace-mechanism">Механизм Лапласа (Laplace Mechanism)
&lt;/h4>&lt;p>Типичным методом реализации дифференциальной приватности является «механизм Лапласа», который преднамеренно добавляет шум (случайные числа), подчиняющийся определенному распределению, к истинному результату запроса. То, сколько шума следует добавить, зависит от «глобальной чувствительности» (Global Sensitivity) $\Delta f$ функции $f$.&lt;/p>
&lt;p>Глобальная чувствительность $\Delta f$ определяется как максимальное изменение результата функции $f$ для любых соседних наборов данных $D, D'$.&lt;/p>
$$ \Delta f = \max_{D, D'} \| f(D) - f(D') \|_1 $$&lt;p>Механизм Лапласа добавляет к результату функции $f(D)$ шум $Y$, выбранный из распределения Лапласа $\text{Lap}(b)$ с параметром масштаба $b = \frac{\Delta f}{\epsilon}$.&lt;/p>
$$ \mathcal{M}(D) = f(D) + Y, \quad Y \sim \text{Lap}\left(\frac{\Delta f}{\epsilon}\right) $$&lt;p>Функция плотности вероятности распределения Лапласа имеет следующий вид:&lt;/p>
$$ p(x \mid b) = \frac{1}{2b} \exp\left( - \frac{|x|}{b} \right) $$&lt;p>Благодаря внедрению этого шума становится невозможно по результатам сделать вывод о том, присутствует ли конкретный человек в наборе данных. Компании используют DP как технологию, маскирующую сами персональные данные, сохраняя при этом полезность статистических тенденций всех данных (среднее значение, дисперсия, количество и т. д.).&lt;/p>
&lt;h3 id="23-федеративное-обучение-federated-learning-fl">2.3 Федеративное обучение (Federated Learning: FL)
&lt;/h3>&lt;p>Традиционное машинное обучение использовало централизованный подход, при котором огромные объемы данных собирались на центральном сервере, как в упомянутом ранее озере данных, для обучения модели. Однако отправка конфиденциальных данных, таких как медицинские изображения или история ввода на смартфоне, на центральный сервер сопряжена с серьезным риском для конфиденциальности.&lt;/p>
&lt;p>В связи с этим в 2016 году Google предложил «федеративное обучение» (Federated Learning). При федеративном обучении вместо перемещения самих данных вычислительный процесс для модели переносится на граничные устройства (например, смартфоны или серверы больниц), где эти данные находятся.&lt;/p>
&lt;pre class="mermaid">
flowchart TD
Server[&amp;#34;Центральный сервер агрегации&amp;#34;]
Device1[&amp;#34;Граничное устройство 1 (Смартфон)&amp;#34;]
Device2[&amp;#34;Граничное устройство 2 (Смартфон)&amp;#34;]
Device3[&amp;#34;Граничное устройство 3 (Смартфон)&amp;#34;]
Server --&amp;gt;|&amp;#34;1. Рассылка весов глобальной модели&amp;#34;| Device1
Server --&amp;gt;|&amp;#34;1. Рассылка весов глобальной модели&amp;#34;| Device2
Server --&amp;gt;|&amp;#34;1. Рассылка весов глобальной модели&amp;#34;| Device3
Device1 --&amp;gt;|&amp;#34;2. Локальное обучение на приватных данных&amp;#34;| Device1
Device2 --&amp;gt;|&amp;#34;2. Локальное обучение на приватных данных&amp;#34;| Device2
Device3 --&amp;gt;|&amp;#34;2. Локальное обучение на приватных данных&amp;#34;| Device3
Device1 --&amp;gt;|&amp;#34;3. Передача градиентов/обновлений модели&amp;#34;| Server
Device2 --&amp;gt;|&amp;#34;3. Передача градиентов/обновлений модели&amp;#34;| Server
Device3 --&amp;gt;|&amp;#34;3. Передача градиентов/обновлений модели&amp;#34;| Server
Server --&amp;gt;|&amp;#34;4. Агрегация (FedAvg)&amp;#34;| Server
Server --&amp;gt;|&amp;#34;5. Обновление глобальной модели&amp;#34;| Server
&lt;/pre>
&lt;h4 id="алгоритм-federated-averaging-fedavg">Алгоритм Federated Averaging (FedAvg)
&lt;/h4>&lt;p>Типичным алгоритмом агрегации в федеративном обучении является FedAvg. Каждый клиент $k$ использует свой собственный набор данных $D_k$ (размером $n_k$) для локального обучения методом стохастического градиентного спуска (SGD) в течение нескольких эпох, вычисляя обновленные веса $w_{t+1}^k$.&lt;/p>
&lt;p>Центральный сервер получает веса от участвующих $K$ клиентов и обновляет веса глобальной модели $w_{t+1}$ путем их усреднения с весом, пропорциональным размеру данных. Если общее количество данных равно $n = \sum_{k=1}^K n_k$, формула обновления выглядит следующим образом:&lt;/p>
$$ w_{t+1} = \sum_{k=1}^K \frac{n_k}{n} w_{t+1}^k $$&lt;p>Благодаря этому можно создавать интеллектуальные модели ИИ, не перемещая исходные персональные данные (такие как история сообщений или фотографии) за пределы устройства. В качестве типичных примеров применения можно привести функцию прогнозирования следующего слова в Google Keyboard (Gboard), а также улучшение моделей распознавания голоса Apple FaceID и «Привет, Siri».&lt;/p>
&lt;h3 id="24-гомоморфное-шифрование-homomorphic-encryption-he">2.4 Гомоморфное шифрование (Homomorphic Encryption: HE)
&lt;/h3>&lt;p>«Волшебная» криптографическая технология, которая позволяет выполнять вычисления (такие как сложение и умножение) с данными, оставляя их в зашифрованном состоянии, — это гомоморфное шифрование. При использовании обычных методов шифрования для обработки данных их необходимо сначала расшифровать (вернуть в открытый текст), но расшифровка на облачном сервере является уязвимостью с точки зрения безопасности.&lt;/p>
&lt;p>С использованием гомоморфного шифрования реализуются следующие свойства: если функция шифрования — $E(\cdot)$, то сложение или умножение открытых текстов $m_1$ и $m_2$ становится возможным через операции над зашифрованными текстами ($\oplus$ и $\otimes$).&lt;/p>
$$ E(m_1 + m_2) = E(m_1) \oplus E(m_2) $$$$ E(m_1 \times m_2) = E(m_1) \otimes E(m_2) $$&lt;p>Гомоморфное шифрование делится на «частично гомоморфное шифрование» (Partially Homomorphic Encryption: PHE), которое позволяет выполнять только сложение или только умножение, и «полностью гомоморфное шифрование» (Fully Homomorphic Encryption: FHE), которое позволяет выполнять и сложение, и умножение бесконечное число раз. С тех пор как в 2009 году Крейг Джентри построил первую схему FHE с использованием криптографии на решетках (Lattice-based cryptography), это стало большим прорывом в криптографии.&lt;/p>
&lt;p>В настоящее время остаются проблемы, такие как вычислительные затраты и увеличение размера зашифрованного текста (накладные расходы), но ожидается, что эта технология найдет применение в безопасном анализе медицинских данных в облаке и конфиденциальных вычислениях между финансовыми учреждениями.&lt;/p>
&lt;h2 id="3-законодательство-и-тенденции-комплаенса-gdpr-против-ccpa">3. Законодательство и тенденции комплаенса: GDPR против CCPA
&lt;/h2>&lt;p>Параллельно с технологической эволюцией во всем мире также стремительно развивается правовая база. Соблюдение этих законов и нормативных актов стало обязательным условием для компаний при использовании больших данных. Давайте сравним две наиболее влиятельные нормативные базы.&lt;/p>
&lt;h3 id="общий-регламент-по-защите-данных-ес-gdpr">Общий регламент по защите данных ЕС (GDPR)
&lt;/h3>&lt;p>Вступивший в силу в мае 2018 года Общий регламент ЕС по защите данных (GDPR) признан «мировым стандартом (золотым стандартом)» в области защиты персональных данных. GDPR применяется ко всем организациям, обрабатывающим данные лиц на территории ЕС, и в случае его нарушения налагается огромный штраф в размере до 4% от мирового годового оборота или 20 миллионов евро, в зависимости от того, какая сумма больше.&lt;/p>
&lt;p>&lt;strong>Основные особенности GDPR:&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Принцип согласия (Opt-in)&lt;/strong>: Сбор и обработка данных требуют явного, свободного и предварительного согласия пользователя.&lt;/li>
&lt;li>&lt;strong>Право на забвение (Right to be Forgotten/Right to Erasure)&lt;/strong>: Пользователь имеет право требовать от компании полного удаления своих персональных данных. Данные также должны быть удалены из резервных копий озера данных, что является технически чрезвычайно сложным требованием.&lt;/li>
&lt;li>&lt;strong>Контроллер данных и процессор данных&lt;/strong>: Строго определяет ответственность того, кто определяет цели использования данных (контроллер), и того, кто обрабатывает данные в соответствии с его инструкциями (процессор).&lt;/li>
&lt;/ul>
&lt;h3 id="закон-калифорнии-о-конфиденциальности-потребителей-ccpacpra">Закон Калифорнии о конфиденциальности потребителей (CCPA/CPRA)
&lt;/h3>&lt;p>Хотя в Соединенных Штатах нет всеобъемлющего закона о конфиденциальности на федеральном уровне, Закон Калифорнии о конфиденциальности потребителей (CCPA), вступивший в силу в Калифорнии в 2020 году, служит де-факто национальным стандартом. Позже он был дополнительно усилен Законом о правах на конфиденциальность Калифорнии (CPRA).&lt;/p>
&lt;p>&lt;strong>Основные особенности CCPA:&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Принцип отказа (Opt-out)&lt;/strong>: В отличие от «предварительного согласия» GDPR, сбор данных возможен без предварительного согласия, но требуется предоставить пользователю четкую ссылку для отказа с текстом «Не продавать мою персональную информацию (Do Not Sell My Personal Information)».&lt;/li>
&lt;li>&lt;strong>Право доступа к данным&lt;/strong>: Потребители могут потребовать раскрытия конкретной информации, собранной компанией, ее категорий, источников и факта продажи третьим лицам.&lt;/li>
&lt;/ul>
&lt;p>Эти законы строго требуют от компаний реализации концепции «конфиденциальность на этапе проектирования» (Privacy by Design), то есть внедрения защиты конфиденциальности еще на этапе разработки систем и процессов.&lt;/p>
&lt;h2 id="4-проблемы-внедрения-в-экосистеме-данных">4. Проблемы внедрения в экосистеме данных
&lt;/h2>&lt;p>Давайте рассмотрим с точки зрения реализации применение технологий защиты конфиденциальности и законодательных актов в реальной среде больших данных. Например, предположим случай реализации k-анонимизации или дифференциальной приватности в озере данных с использованием Python и Pandas или PySpark.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;span class="lnt">31
&lt;/span>&lt;span class="lnt">32
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-python" data-lang="python">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Концептуальная реализация агрегирования данных с применением дифференциальной приватности (Python)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">import&lt;/span> &lt;span class="nn">numpy&lt;/span> &lt;span class="k">as&lt;/span> &lt;span class="nn">np&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">import&lt;/span> &lt;span class="nn">pandas&lt;/span> &lt;span class="k">as&lt;/span> &lt;span class="nn">pd&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">def&lt;/span> &lt;span class="nf">laplace_mechanism&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">true_value&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">sensitivity&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">epsilon&lt;/span>&lt;span class="p">):&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="s2">&amp;#34;&amp;#34;&amp;#34;
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s2"> Функция для добавления шума Лапласа к истинному значению
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s2"> &amp;#34;&amp;#34;&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">scale&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">sensitivity&lt;/span> &lt;span class="o">/&lt;/span> &lt;span class="n">epsilon&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">noise&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">np&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">random&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">laplace&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">loc&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="mi">0&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">scale&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="n">scale&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">return&lt;/span> &lt;span class="n">true_value&lt;/span> &lt;span class="o">+&lt;/span> &lt;span class="n">noise&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">def&lt;/span> &lt;span class="nf">get_dp_average_salary&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">dataframe&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">epsilon&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="mf">1.0&lt;/span>&lt;span class="p">):&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="s2">&amp;#34;&amp;#34;&amp;#34;
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s2"> Вычисление средней зарплаты с гарантией дифференциальной приватности
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s2"> &amp;#34;&amp;#34;&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Фактическое вычисление&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">true_sum&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">dataframe&lt;/span>&lt;span class="p">[&lt;/span>&lt;span class="s1">&amp;#39;salary&amp;#39;&lt;/span>&lt;span class="p">]&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">sum&lt;/span>&lt;span class="p">()&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">true_count&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="nb">len&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">dataframe&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Применение дифференциальной приватности (на основе предположения о чувствительности)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Предположим, что колебание максимальной зарплаты является чувствительностью (более строго требуется клиппинг)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">max_salary_diff&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="mi">100000&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Добавление шума (также возможно применение DP отдельно к сумме и количеству)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">noisy_sum&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">laplace_mechanism&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">true_sum&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">max_salary_diff&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">epsilon&lt;/span> &lt;span class="o">/&lt;/span> &lt;span class="mi">2&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">noisy_count&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">laplace_mechanism&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">true_count&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="mi">1&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">epsilon&lt;/span> &lt;span class="o">/&lt;/span> &lt;span class="mi">2&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">return&lt;/span> &lt;span class="n">noisy_sum&lt;/span> &lt;span class="o">/&lt;/span> &lt;span class="n">noisy_count&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Выполнение внутри конвейера данных&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># dp_avg_salary = get_dp_average_salary(raw_df, epsilon=0.5)&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Как видно из этого фрагмента кода, сама реализация дифференциальной приватности проста и заключается в добавлении шума, но в реальной эксплуатации управление «бюджетом приватности» ($\epsilon$) становится чрезвычайно сложной задачей. При выполнении нескольких запросов к одному и тому же набору данных бюджет приватности расходуется (на основе теоремы композиции), и в конечном итоге необходимо создать механизм (Privacy Budget Management), который будет блокировать весь набор данных или отклонять запросы.&lt;/p>
&lt;h2 id="5-перспективы-на-будущее-и-этические-проблемы">5. Перспективы на будущее и этические проблемы
&lt;/h2>&lt;p>Компромисс между большими данными и конфиденциальностью не является игрой с нулевой суммой. С развитием PETs, таких как дифференциальная приватность, федеративное обучение и гомоморфное шифрование, новая парадигма использования данных — «обмен инсайтами без обмена данными» — становится реальностью.&lt;/p>
&lt;p>Кроме того, в последние годы движение за возвращение суверенитета данных (Data Sovereignty) от гигантских платформ к частным лицам ускорилось благодаря связи с концепциями «Сетки данных» (Data Mesh) и «Web3» (децентрализованной сети). Обсуждается будущее, в котором персональные данные будут храниться в персональных хранилищах данных (PDS) или кошельках данных, а сами пользователи будут контролировать разрешения на использование и монетизацию данных.&lt;/p>
&lt;p>Однако технические решения не идеальны. В федеративном обучении существует угроза «атаки отравления» (Poisoning Attack), при которой злоумышленный клиент отправляет некорректные обновления модели, чтобы испортить глобальную модель. В случае с дифференциальной приватностью также указывается на этическую проблему: данные меньшинств могут быть стерты шумом, что приводит к появлению систематической ошибки (предвзятости) в моделях ИИ.&lt;/p>
&lt;h2 id="заключение">Заключение
&lt;/h2>&lt;p>Судьба персональных данных в эпоху больших данных выходит за рамки простой технической проблемы и ставит фундаментальный вопрос о том, в каком обществе мы хотим жить. Как нам защитить человеческое достоинство и конфиденциальность, продолжая наслаждаться удобствами? К устойчивому решению можно прийти только благодаря триединству: совершенствованию правовых норм, непрерывным инновациям в технологиях защиты конфиденциальности и высокой грамотности каждого из нас, предоставляющего данные. Конфиденциальность и удобство больше не будут компромиссом, а превратятся в «обязательное требование», которое можно будет удовлетворить с помощью новейших технологий.&lt;/p></description></item></channel></rss>