<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Big Data on kenji.blog</title><link>http://kenji.blog/es/tags/big-data/</link><description>Recent content in Big Data on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>es</language><copyright>kenjinote</copyright><lastBuildDate>Sat, 12 Sep 2026 12:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/es/tags/big-data/index.xml" rel="self" type="application/rss+xml"/><item><title>El equilibrio entre privacidad y conveniencia: El destino de la información personal en la era del Big Data</title><link>http://kenji.blog/es/p/privacy-vs-convenience-big-data/</link><pubDate>Sat, 12 Sep 2026 12:00:00 +0900</pubDate><guid>http://kenji.blog/es/p/privacy-vs-convenience-big-data/</guid><description>&lt;img src="http://kenji.blog/p/privacy-vs-convenience-big-data/img/eyecatch.jpg" alt="Featured image of post El equilibrio entre privacidad y conveniencia: El destino de la información personal en la era del Big Data" />&lt;h1 id="el-equilibrio-entre-privacidad-y-conveniencia-el-destino-de-la-información-personal-en-la-era-del-big-data">El equilibrio entre privacidad y conveniencia: El destino de la información personal en la era del Big Data
&lt;/h1>&lt;p>En la sociedad digital moderna, generamos cantidades masivas de datos en nuestra vida diaria. Se recopilan incesantemente &amp;ldquo;big data&amp;rdquo; en múltiples formas, como datos de ubicación de teléfonos inteligentes, publicaciones en redes sociales, historiales de compras en línea y datos de salud registrados por dispositivos portátiles. Estos datos son esenciales para la evolución de la IA (Inteligencia Artificial) y la provisión de servicios personalizados, haciendo nuestras vidas más convenientes y enriquecedoras.&lt;/p>
&lt;p>Sin embargo, por otro lado, el riesgo de invasión de la privacidad asociado con la recopilación y uso de información personal ha surgido como un problema social grave. Los riesgos ocultos tras la conveniencia han alcanzado una escala que no se puede ignorar, como los incidentes de filtración de datos, el suministro de datos a terceros sin el consentimiento del usuario e incluso las preocupaciones sobre la transformación en una sociedad de vigilancia por parte del Estado. En este artículo, proporcionaremos una explicación técnica extremadamente detallada de cómo se está abordando este dilema moderno del &amp;ldquo;equilibrio entre privacidad y conveniencia&amp;rdquo; tanto desde el aspecto tecnológico como el regulatorio, incluyendo las últimas tendencias.&lt;/p>
&lt;h2 id="1-el-paradigma-de-la-sociedad-impulsada-por-datos-y-la-evolución-de-la-arquitectura-de-datos">1. El paradigma de la sociedad impulsada por datos y la evolución de la arquitectura de datos
&lt;/h2>&lt;p>Para recopilar y utilizar datos de manera eficiente, las empresas adoptan diversas arquitecturas de datos. Ha habido una transición desde el &amp;ldquo;Data Warehouse&amp;rdquo; (Almacén de datos), que solía ser la corriente principal, hacia el &amp;ldquo;Data Lake&amp;rdquo; (Lago de datos), que gestiona centralizadamente todos los datos, incluidos los no estructurados, y actualmente se está produciendo un cambio de paradigma hacia el &amp;ldquo;Data Mesh&amp;rdquo; (Malla de datos), una arquitectura descentralizada.&lt;/p>
&lt;h3 id="lago-de-datos-centralizado-y-tubería-de-anonimización">Lago de datos centralizado y tubería de anonimización
&lt;/h3>&lt;p>Un lago de datos es un repositorio de almacenamiento que guarda grandes volúmenes de datos sin procesar en su formato original. Sin embargo, utilizar datos sin procesar que incluyen información de identificación personal (PII) directamente para el análisis causa graves violaciones de cumplimiento. Por lo tanto, se implementa una estricta &amp;ldquo;tubería de anonimización (Anonymization Pipeline)&amp;rdquo; entre el lago de datos y el entorno de análisis.&lt;/p>
&lt;p>El siguiente diagrama muestra el flujo de la tubería de anonimización en un lago de datos centralizado típico.&lt;/p>
&lt;pre class="mermaid">
flowchart TD
A[&amp;#34;Fuentes de datos (Web, IoT, Móvil)&amp;#34;] --&amp;gt;|&amp;#34;Ingesta&amp;#34;| B[&amp;#34;Zona de datos sin procesar (Intactos)&amp;#34;]
B --&amp;gt;|&amp;#34;Proceso ETL&amp;#34;| C[&amp;#34;Tubería de anonimización y limpieza&amp;#34;]
C --&amp;gt;|&amp;#34;Seudonimización / Tokenización&amp;#34;| D[&amp;#34;Zona de confianza (k-anonimizado)&amp;#34;]
D --&amp;gt;|&amp;#34;Ingeniería de características&amp;#34;| E[&amp;#34;Zona refinada (Lista para ML)&amp;#34;]
E --&amp;gt;|&amp;#34;Entrenamiento de modelos&amp;#34;| F[&amp;#34;Herramientas de BI y Modelos de ML&amp;#34;]
C --&amp;gt;|&amp;#34;Registros de auditoría&amp;#34;| G[&amp;#34;Centro de seguridad y cumplimiento&amp;#34;]
&lt;/pre>
&lt;p>En una tubería de este tipo, procesos como el hash, el enmascaramiento y el cifrado se aplican automáticamente al ingreso de los datos. Sin embargo, como se discutirá más adelante, el simple enmascaramiento o la seudonimización no pueden eliminar por completo el riesgo de &amp;ldquo;reidentificación (Re-identification)&amp;rdquo; al cruzarlos con otras fuentes de datos.&lt;/p>
&lt;h2 id="2-comprensión-profunda-de-las-tecnologías-de-mejora-de-la-privacidad-pets">2. Comprensión profunda de las Tecnologías de Mejora de la Privacidad (PETs)
&lt;/h2>&lt;p>La clave para lograr tanto la privacidad como la utilización de datos son las &amp;ldquo;Tecnologías de mejora de la privacidad (PETs, por sus siglas en inglés)&amp;rdquo;. Aquí, explicaremos en detalle las definiciones matemáticas y las implementaciones técnicas de las principales PETs que juegan un papel extremadamente importante en el análisis moderno de big data y el aprendizaje automático.&lt;/p>
&lt;h3 id="21-k-anonimato-k-anonymity-y-sus-extensiones">2.1 k-anonimato (K-Anonymity) y sus extensiones
&lt;/h3>&lt;p>El &amp;ldquo;k-anonimato&amp;rdquo;, propuesto por Latanya Sweeney y Pierangela Samarati en 1998, es un concepto fundamental para la protección de la privacidad en la publicación de datos. Significa garantizar que cualquier registro en un conjunto de datos sea indistinguible de al menos $k-1$ otros registros.&lt;/p>
&lt;p>Los atributos dentro de una base de datos se clasifican a grandes rasgos en tres tipos:&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Identificadores explícitos (Explicit Identifiers)&lt;/strong>: Información que puede identificar directamente a un individuo, como nombres o números de seguridad social (generalmente se eliminan o cifran).&lt;/li>
&lt;li>&lt;strong>Cuasi-identificadores (Quasi-Identifiers: QIs)&lt;/strong>: Información que, como edad, género o código postal, no puede identificar a un individuo por sí sola, pero puede hacerlo cuando se combina.&lt;/li>
&lt;li>&lt;strong>Atributos sensibles (Sensitive Attributes)&lt;/strong>: Información que debe protegerse, como el nombre de una enfermedad o los ingresos anuales.&lt;/li>
&lt;/ol>
&lt;p>El k-anonimato garantiza que siempre haya $k$ o más combinaciones de cuasi-identificadores (Clase de equivalencia: Equivalence Class). Sin embargo, el k-anonimato tiene vulnerabilidades frente a los &amp;ldquo;Ataques de homogeneidad (Homogeneity Attack)&amp;rdquo; y &amp;ldquo;Ataques de conocimiento previo (Background Knowledge Attack)&amp;rdquo;. Por ejemplo, si las $k$ personas que pertenecen a una determinada clase de equivalencia tienen la misma enfermedad (atributo sensible), la enfermedad será identificada incluso si se mantiene el k-anonimato.&lt;/p>
&lt;p>Para superar esto, se han propuesto los siguientes modelos extendidos:&lt;/p>
&lt;ul>
&lt;li>&lt;strong>l-diversidad (l-diversity)&lt;/strong>: Garantiza que en cada clase de equivalencia, el atributo sensible tenga al menos $l$ valores diferentes.&lt;/li>
&lt;li>&lt;strong>t-cercanía (t-closeness)&lt;/strong>: Asegura que la distancia (como la Earth Mover&amp;rsquo;s Distance) entre la distribución del atributo sensible en cada clase de equivalencia y la distribución del atributo sensible en todo el conjunto de datos sea menor o igual a un umbral $t$.&lt;/li>
&lt;/ul>
&lt;h3 id="22-privacidad-diferencial-differential-privacy-dp">2.2 Privacidad diferencial (Differential Privacy: DP)
&lt;/h3>&lt;p>Superando las limitaciones del modelo de k-anonimato, la &amp;ldquo;Privacidad diferencial (Differential Privacy)&amp;rdquo;, propuesta por Cynthia Dwork y otros en 2006, es ampliamente adoptada hoy en día como el estándar de privacidad más fuerte y matemáticamente riguroso. Gigantes tecnológicos como Apple, Google y Microsoft aplican esta privacidad diferencial $\epsilon$ al recopilar datos de telemetría y datos estadísticos de los usuarios.&lt;/p>
&lt;h4 id="definición-matemática-de-la-privacidad-diferencial">Definición matemática de la privacidad diferencial
&lt;/h4>&lt;p>Se dice que un algoritmo aleatorizado (Randomized Algorithm) $\mathcal{M}$ satisface la privacidad diferencial $\epsilon$ si, para cualesquiera dos conjuntos de datos adyacentes $D$ y $D'$ que difieren en solo un registro (es decir, $\|D - D'\|_1 = 1$), y para cualquier subconjunto de salidas $S \subseteq \text{Range}(\mathcal{M})$, se cumple la siguiente desigualdad:&lt;/p>
$$ \Pr[\mathcal{M}(D) \in S] \le e^\epsilon \Pr[\mathcal{M}(D') \in S] $$&lt;p>Aquí, $\epsilon$ (presupuesto de privacidad) es un parámetro no negativo que controla el nivel de protección de la privacidad. Cuanto menor sea $\epsilon$, más fuerte será la protección de la privacidad, pero la utilidad de los datos disminuirá.&lt;/p>
&lt;p>Además, también se utiliza ampliamente la privacidad diferencial $(\epsilon, \delta)$, que es un modelo relajado que permite que la garantía de privacidad se rompa con una probabilidad muy pequeña $\delta$.&lt;/p>
$$ \Pr[\mathcal{M}(D) \in S] \le e^\epsilon \Pr[\mathcal{M}(D') \in S] + \delta $$&lt;h4 id="mecanismo-de-laplace-laplace-mechanism">Mecanismo de Laplace (Laplace Mechanism)
&lt;/h4>&lt;p>Un método representativo para lograr la privacidad diferencial es el &amp;ldquo;Mecanismo de Laplace&amp;rdquo;, que agrega intencionalmente ruido (números aleatorios) siguiendo una distribución específica al resultado de salida verdadero de una consulta. La cantidad de ruido que se debe agregar depende de la &amp;ldquo;sensibilidad global (Global Sensitivity)&amp;rdquo; $\Delta f$ de la función $f$.&lt;/p>
&lt;p>La sensibilidad global $\Delta f$ se define como la cantidad máxima de cambio en la salida de la función $f$ para cualesquiera conjuntos de datos adyacentes $D, D'$.&lt;/p>
$$ \Delta f = \max_{D, D'} \| f(D) - f(D') \|_1 $$&lt;p>El mecanismo de Laplace agrega al resultado de la función $f(D)$ el ruido $Y$ muestreado de la distribución de Laplace $\text{Lap}(b)$ con parámetro de escala $b = \frac{\Delta f}{\epsilon}$.&lt;/p>
$$ \mathcal{M}(D) = f(D) + Y, \quad Y \sim \text{Lap}\left(\frac{\Delta f}{\epsilon}\right) $$&lt;p>La función de densidad de probabilidad de la distribución de Laplace es la siguiente:&lt;/p>
$$ p(x \mid b) = \frac{1}{2b} \exp\left( - \frac{|x|}{b} \right) $$&lt;p>Debido a esta inyección de ruido, se vuelve imposible inferir a partir del resultado de salida si un individuo específico está incluido en el conjunto de datos. Las empresas utilizan la DP como una tecnología para enmascarar los datos individuales en sí mismos, mientras mantienen la utilidad de las tendencias estadísticas (como la media, varianza, recuentos, etc.) de los datos en su conjunto.&lt;/p>
&lt;h3 id="23-aprendizaje-federado-federated-learning-fl">2.3 Aprendizaje Federado (Federated Learning: FL)
&lt;/h3>&lt;p>El aprendizaje automático tradicional utilizaba un enfoque centralizado en el que se entrenaban modelos agregando cantidades masivas de datos en un servidor central, como el lago de datos mencionado anteriormente. Sin embargo, transmitir datos confidenciales, como imágenes médicas o historiales de entrada de teléfonos inteligentes, a un servidor central conlleva graves riesgos de privacidad.&lt;/p>
&lt;p>Por lo tanto, en 2016 Google propuso el &amp;ldquo;Aprendizaje Federado (Federated Learning)&amp;rdquo;. En el aprendizaje federado, en lugar de mover los datos en sí, el &amp;ldquo;procesamiento computacional del modelo&amp;rdquo; se traslada al lado del dispositivo perimetral (como teléfonos inteligentes o servidores de hospitales) donde residen los datos.&lt;/p>
&lt;pre class="mermaid">
flowchart TD
Server[&amp;#34;Servidor de agregación central&amp;#34;]
Device1[&amp;#34;Dispositivo perimetral 1 (Teléfono inteligente)&amp;#34;]
Device2[&amp;#34;Dispositivo perimetral 2 (Teléfono inteligente)&amp;#34;]
Device3[&amp;#34;Dispositivo perimetral 3 (Teléfono inteligente)&amp;#34;]
Server --&amp;gt;|&amp;#34;1. Transmitir pesos del modelo global&amp;#34;| Device1
Server --&amp;gt;|&amp;#34;1. Transmitir pesos del modelo global&amp;#34;| Device2
Server --&amp;gt;|&amp;#34;1. Transmitir pesos del modelo global&amp;#34;| Device3
Device1 --&amp;gt;|&amp;#34;2. Entrenamiento local con datos privados&amp;#34;| Device1
Device2 --&amp;gt;|&amp;#34;2. Entrenamiento local con datos privados&amp;#34;| Device2
Device3 --&amp;gt;|&amp;#34;2. Entrenamiento local con datos privados&amp;#34;| Device3
Device1 --&amp;gt;|&amp;#34;3. Transmitir gradientes/actualizaciones del modelo&amp;#34;| Server
Device2 --&amp;gt;|&amp;#34;3. Transmitir gradientes/actualizaciones del modelo&amp;#34;| Server
Device3 --&amp;gt;|&amp;#34;3. Transmitir gradientes/actualizaciones del modelo&amp;#34;| Server
Server --&amp;gt;|&amp;#34;4. Agregación (FedAvg)&amp;#34;| Server
Server --&amp;gt;|&amp;#34;5. Actualizar modelo global&amp;#34;| Server
&lt;/pre>
&lt;h4 id="algoritmo-de-promediado-federado-federated-averaging-fedavg">Algoritmo de promediado federado (Federated Averaging: FedAvg)
&lt;/h4>&lt;p>Un algoritmo de agregación representativo en el aprendizaje federado es FedAvg. Cada cliente $k$ realiza localmente un entrenamiento de múltiples épocas utilizando descenso de gradiente estocástico (SGD) con su propio conjunto de datos $D_k$ (de tamaño $n_k$), y calcula los pesos actualizados $w_{t+1}^k$.&lt;/p>
&lt;p>El servidor central recibe los pesos de los $K$ clientes participantes y actualiza los pesos del modelo global $w_{t+1}$ promediando estos pesos ponderados según el tamaño de los datos. Si el número total de datos es $n = \sum_{k=1}^K n_k$, la fórmula de actualización es la siguiente:&lt;/p>
$$ w_{t+1} = \sum_{k=1}^K \frac{n_k}{n} w_{t+1}^k $$&lt;p>Esto permite construir modelos de IA inteligentes sin que los datos personales sin procesar (como historiales de mensajes o fotos) salgan nunca del dispositivo. Ejemplos representativos de aplicación incluyen la función de predicción de la siguiente palabra en Google Keyboard (Gboard) y las mejoras en los modelos de reconocimiento de voz de FaceID y Hey Siri de Apple.&lt;/p>
&lt;h3 id="24-cifrado-homomórfico-homomorphic-encryption-he">2.4 Cifrado homomórfico (Homomorphic Encryption: HE)
&lt;/h3>&lt;p>La tecnología criptográfica &amp;ldquo;mágica&amp;rdquo; que permite realizar cálculos (como suma y multiplicación) en datos mientras permanecen cifrados es el cifrado homomórfico. Con los métodos de cifrado normales, cuando se realiza procesamiento computacional en los datos, es necesario descifrarlos primero (devolverlos a texto plano), pero realizar el descifrado en un servidor en la nube crea una vulnerabilidad de seguridad.&lt;/p>
&lt;p>Si se utiliza el cifrado homomórfico, se logran las siguientes propiedades. Suponiendo que la función de cifrado es $E(\cdot)$, la suma y la multiplicación de los textos planos $m_1$ y $m_2$ se vuelven posibles mediante operaciones ($\oplus$ y $\otimes$) en los textos cifrados tal cual.&lt;/p>
$$ E(m_1 + m_2) = E(m_1) \oplus E(m_2) $$$$ E(m_1 \times m_2) = E(m_1) \otimes E(m_2) $$&lt;p>El cifrado homomórfico se divide en &amp;ldquo;Cifrado parcialmente homomórfico (Partially Homomorphic Encryption: PHE)&amp;rdquo;, donde solo es posible la suma o la multiplicación, y &amp;ldquo;Cifrado completamente homomórfico (Fully Homomorphic Encryption: FHE)&amp;rdquo;, donde tanto la suma como la multiplicación son posibles un número infinito de veces. Desde que Craig Gentry construyó el primer esquema FHE en 2009 utilizando criptografía basada en retículos (Lattice-based cryptography), ha sido un gran avance en la criptografía.&lt;/p>
&lt;p>Actualmente, aún quedan desafíos como los costos computacionales y el aumento en el tamaño de los textos cifrados (sobrecarga), pero se espera su aplicación para el análisis seguro de datos médicos en la nube y para el cálculo secreto entre instituciones financieras.&lt;/p>
&lt;h2 id="3-tendencias-en-regulación-legal-y-cumplimiento-gdpr-vs-ccpa">3. Tendencias en regulación legal y cumplimiento: GDPR vs CCPA
&lt;/h2>&lt;p>En paralelo con la evolución técnica, el establecimiento de marcos legales también avanza rápidamente a nivel mundial. Al utilizar big data, las empresas deben cumplir obligatoriamente con estas regulaciones legales. Comparemos los dos marcos regulatorios más influyentes.&lt;/p>
&lt;h3 id="reglamento-general-de-protección-de-datos-de-la-ue-gdpr">Reglamento General de Protección de Datos de la UE (GDPR)
&lt;/h3>&lt;p>El GDPR (Reglamento General de Protección de Datos) de la UE, que entró en vigor en mayo de 2018, es reconocido como el &amp;ldquo;estándar global (estándar de oro)&amp;rdquo; para la protección de datos personales. El GDPR se aplica a todas las organizaciones que manejan datos de individuos dentro de la UE, y en caso de violación, impone enormes multas de hasta el 4% de los ingresos anuales globales o 20 millones de euros, la cantidad que sea mayor.&lt;/p>
&lt;p>&lt;strong>Características principales del GDPR:&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Principio de inclusión (Opt-in)&lt;/strong>: La recopilación y el procesamiento de datos requieren el consentimiento previo, libre y explícito del usuario.&lt;/li>
&lt;li>&lt;strong>Derecho al olvido (Right to be Forgotten/Right to Erasure)&lt;/strong>: Los usuarios tienen derecho a exigir que las empresas borren por completo sus datos personales. Esto requiere eliminar datos incluso de las copias de seguridad del lago de datos, lo cual es un requisito técnicamente muy difícil.&lt;/li>
&lt;li>&lt;strong>Controlador de datos y Procesador de datos&lt;/strong>: Define estrictamente las responsabilidades de quienes deciden el propósito de uso de los datos (controlador) y quienes procesan los datos de acuerdo con sus instrucciones (procesador).&lt;/li>
&lt;/ul>
&lt;h3 id="ley-de-privacidad-del-consumidor-de-california-ccpacpra">Ley de Privacidad del Consumidor de California (CCPA/CPRA)
&lt;/h3>&lt;p>Si bien Estados Unidos carece de una ley de privacidad integral a nivel federal, la CCPA (California Consumer Privacy Act), promulgada en California en 2020, sirve como el estándar nacional de facto. Posteriormente se fortaleció con la CPRA (California Privacy Rights Act).&lt;/p>
&lt;p>&lt;strong>Características principales de la CCPA:&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Principio de exclusión (Opt-out)&lt;/strong>: A diferencia del &amp;ldquo;consentimiento previo&amp;rdquo; del GDPR, se pueden recopilar datos sin consentimiento previo, pero es obligatorio proporcionar a los usuarios un enlace claro de exclusión voluntaria que diga &amp;ldquo;No vender mi información personal (Do Not Sell My Personal Information)&amp;rdquo;.&lt;/li>
&lt;li>&lt;strong>Derecho de acceso a los datos&lt;/strong>: Los consumidores pueden solicitar que las empresas divulguen información específica recopilada, sus categorías, fuentes y si se vendió a terceros.&lt;/li>
&lt;/ul>
&lt;p>Estas leyes y regulaciones exigen firmemente a las empresas la &amp;ldquo;Privacidad por diseño (Privacy by Design)&amp;rdquo;, que consiste en incorporar la protección de la privacidad desde la fase de diseño de los sistemas y procesos.&lt;/p>
&lt;h2 id="4-desafíos-de-implementación-en-el-ecosistema-de-datos">4. Desafíos de implementación en el ecosistema de datos
&lt;/h2>&lt;p>Veamos las perspectivas de implementación al aplicar tecnologías de mejora de la privacidad y regulaciones legales en un entorno real de big data. Por ejemplo, suponga un caso en el que se implementa k-anonimato o privacidad diferencial utilizando Python y Pandas, o PySpark, en un lago de datos.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;span class="lnt">31
&lt;/span>&lt;span class="lnt">32
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-python" data-lang="python">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Implementación conceptual de agregación de datos aplicando privacidad diferencial (Python)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">import&lt;/span> &lt;span class="nn">numpy&lt;/span> &lt;span class="k">as&lt;/span> &lt;span class="nn">np&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">import&lt;/span> &lt;span class="nn">pandas&lt;/span> &lt;span class="k">as&lt;/span> &lt;span class="nn">pd&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">def&lt;/span> &lt;span class="nf">laplace_mechanism&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">true_value&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">sensitivity&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">epsilon&lt;/span>&lt;span class="p">):&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="s2">&amp;#34;&amp;#34;&amp;#34;
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s2"> Función que agrega ruido de Laplace al valor verdadero
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s2"> &amp;#34;&amp;#34;&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">scale&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">sensitivity&lt;/span> &lt;span class="o">/&lt;/span> &lt;span class="n">epsilon&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">noise&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">np&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">random&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">laplace&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">loc&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="mi">0&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">scale&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="n">scale&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">return&lt;/span> &lt;span class="n">true_value&lt;/span> &lt;span class="o">+&lt;/span> &lt;span class="n">noise&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">def&lt;/span> &lt;span class="nf">get_dp_average_salary&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">dataframe&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">epsilon&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="mf">1.0&lt;/span>&lt;span class="p">):&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="s2">&amp;#34;&amp;#34;&amp;#34;
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s2"> Cálculo del salario promedio con garantía de privacidad diferencial
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="s2"> &amp;#34;&amp;#34;&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Cálculo real&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">true_sum&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">dataframe&lt;/span>&lt;span class="p">[&lt;/span>&lt;span class="s1">&amp;#39;salary&amp;#39;&lt;/span>&lt;span class="p">]&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">sum&lt;/span>&lt;span class="p">()&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">true_count&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="nb">len&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">dataframe&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Aplicación de privacidad diferencial (basada en supuestos de sensibilidad)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Suponemos la variación máxima del salario como sensibilidad (se requiere recorte para mayor rigor)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">max_salary_diff&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="mi">100000&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Adición de ruido (es posible aplicar DP a la suma y al recuento individualmente)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">noisy_sum&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">laplace_mechanism&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">true_sum&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">max_salary_diff&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">epsilon&lt;/span> &lt;span class="o">/&lt;/span> &lt;span class="mi">2&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">noisy_count&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">laplace_mechanism&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">true_count&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="mi">1&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">epsilon&lt;/span> &lt;span class="o">/&lt;/span> &lt;span class="mi">2&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">return&lt;/span> &lt;span class="n">noisy_sum&lt;/span> &lt;span class="o">/&lt;/span> &lt;span class="n">noisy_count&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Ejecución en la tubería de datos&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># dp_avg_salary = get_dp_average_salary(raw_df, epsilon=0.5)&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Como se ve en este fragmento de código, la implementación de la privacidad diferencial en sí misma es tan simple como agregar ruido, pero en las operaciones reales, la gestión del &amp;ldquo;presupuesto de privacidad ($\epsilon$)&amp;rdquo; se vuelve extremadamente difícil. Cuando se emiten múltiples consultas contra el mismo conjunto de datos, el presupuesto de privacidad se consume (según el teorema de composición) y, en última instancia, es necesario construir un mecanismo (Privacy Budget Management) para bloquear todo el conjunto de datos o rechazar las consultas.&lt;/p>
&lt;h2 id="5-perspectivas-futuras-y-desafíos-éticos">5. Perspectivas futuras y desafíos éticos
&lt;/h2>&lt;p>El equilibrio entre el big data y la privacidad no es un juego de suma cero. Con la evolución de las PETs, como la privacidad diferencial, el aprendizaje federado y el cifrado homomórfico, un nuevo paradigma de utilización de datos de &amp;ldquo;compartir información sin compartir datos&amp;rdquo; se está convirtiendo en una realidad.&lt;/p>
&lt;p>Además, en los últimos años, vinculado con los conceptos de &amp;ldquo;Malla de datos (Data Mesh)&amp;rdquo; y &amp;ldquo;Web3 (Web descentralizada)&amp;rdquo;, el movimiento para recuperar la soberanía de los datos (Data Sovereignty) de las plataformas gigantes hacia los individuos también se está acelerando. Se está discutiendo un futuro en el que los datos individuales se almacenen en almacenes de datos personales (PDS) o billeteras de datos, y los propios usuarios controlen las licencias y la monetización de sus datos.&lt;/p>
&lt;p>Sin embargo, las soluciones técnicas no son perfectas. En el aprendizaje federado, existe la amenaza de un &amp;ldquo;ataque de envenenamiento (Poisoning Attack)&amp;rdquo; en el que clientes maliciosos envían actualizaciones de modelos fraudulentas para contaminar el modelo global. En la privacidad diferencial, también se han señalado desafíos éticos donde los datos de las minorías son borrados por el ruido, creando sesgos en los modelos de IA.&lt;/p>
&lt;h2 id="conclusión">Conclusión
&lt;/h2>&lt;p>El destino de la información personal en la era del big data va más allá de ser un simple problema técnico; plantea la pregunta fundamental de qué tipo de sociedad deseamos. Cómo proteger la dignidad personal y la privacidad mientras disfrutamos de la conveniencia. Solo se puede alcanzar una solución sostenible mediante la trinidad de regulaciones legales, innovación continua en tecnologías de protección de la privacidad y una alta alfabetización de cada uno de nosotros que proporciona los datos. La privacidad y la conveniencia ya no son una compensación, sino que evolucionarán hacia un &amp;ldquo;requisito indispensable&amp;rdquo; que puede coexistir gracias a las últimas tecnologías.&lt;/p></description></item></channel></rss>