La administración correcta de los datos sensibles almacenados en un repositorio de almacenamiento comienza con la clasificación del almacenamiento: identifica dónde están los datos sensibles en el repositorio, de qué tipo de datos sensibles se trata y cómo se usan. Esta información te ayuda a establecer de manera correcta el control de acceso y los permisos para compartir y puede ser parte de un plan de supervisión constante.
Sensitive Data Protection puede detectar y clasificar datos sensibles almacenados en una ubicación de Cloud Storage, un tipo de Datastore o una tabla de BigQuery. Cuando se analizan archivos en ubicaciones de Cloud Storage, Sensitive Data Protection admite el análisis de archivos de objetos binarios, de texto, de imagen, de Microsoft Word, Microsoft Excel, Microsoft PowerPoint, PDF y Apache Avro. Los tipos de archivos que no se reconocen se analizan como archivos binarios. Para obtener más información sobre los tipos de archivos admitidos, consulta Tipos de archivos admitidos.
Para inspeccionar el almacenamiento y las bases de datos en busca de datos sensibles, especifica la ubicación de los datos y el tipo de datos sensibles que Sensitive Data Protection debe buscar. La Protección de datos sensibles inicia un trabajo que inspecciona los datos en la ubicación determinada y, luego, proporciona detalles sobre los infoTypes que se encontraron en el contenido, los valores de probabilidad y mucho más.
Puedes configurar la inspección de almacenamiento y bases de datos con Sensitive Data Protection en la Google Cloud consola, a través de la API de DLP de RESTful o de manera programática en varios lenguajes con una biblioteca cliente de Sensitive Data Protection.
En este tema se incluye lo siguiente:
- Prácticas recomendadas para configurar análisis de repositorios de almacenamiento y bases de datos Google Cloud
- Instrucciones para configurar un análisis de inspección con Sensitive Data Protection en la consola de Google Cloud y, de manera opcional, programar análisis de inspección periódicos
- Muestras de código y JSON para cada tipo de repositorio de almacenamiento Google Cloud (Cloud Storage, Firestore en modo Datastore [Datastore] y BigQuery)
- Una descripción detallada de las opciones de configuración para los trabajos de análisis
- Instrucciones sobre cómo recuperar los resultados de los análisis y cómo administrar los trabajos de análisis que se crean en cada solicitud exitosa
Prácticas recomendadas
Identifica y prioriza el análisis
Es importante evaluar primero tus elementos y especificar cuáles tienen la prioridad más alta para el análisis. Cuando recién comienzas, es posible que tengas una gran cantidad de datos acumulados que necesiten clasificación y será imposible analizarlos de inmediato. En primer lugar, elige los datos que presenten el riesgo más alto posible, por ejemplo, datos a los que se accede con frecuencia, a los que se puede acceder con facilidad o que se desconocen.
Asegúrate de que Sensitive Data Protection pueda acceder a tus datos
Sensitive Data Protection debe poder acceder a los datos que se analizarán. Asegúrate de que la cuenta de servicio de Protección de datos sensibles tenga permiso para leer tus recursos.
Limita el alcance de tus primeros análisis
Para obtener mejores resultados, limita el alcance de tus primeros trabajos en lugar de analizar todos los datos. Comienza con una tabla, un depósito o algunos archivos y usa el muestreo. Como limitaste el alcance de los primeros análisis, puedes determinar mejor qué detectores habilitar y qué reglas de exclusión podrían ser necesarias para reducir los falsos positivos a fin de que los hallazgos sean más significativos. Evita activar todos los Infotipos si no los necesitas a todos, ya que los falsos positivos o los resultados inutilizables pueden hacer que sea más difícil evaluar el riesgo. Si bien son útiles en ciertos casos, los Infotipos como DATE, TIME, DOMAIN_NAME y URL coinciden en una amplia gama de resultados y pueden no ser útiles para activarlos en análisis de datos grandes.
Cuando tomes una muestra de un archivo estructurado, como un archivo CSV, TSV o Avro, asegúrate de que el tamaño de la muestra sea lo suficientemente grande como para abarcar el encabezado completo del archivo y una fila de datos. Para obtener más información, consulta Cómo analizar archivos estructurados en el modo de análisis estructurado.
Programa tus análisis
Usa los activadores de trabajo de Sensitive Data Protection para ejecutar análisis automáticamente y generar resultados de forma diaria, semanal o trimestral. Estos análisis también se pueden configurar para inspeccionar solo los datos que cambiaron desde el último análisis, lo que puede ahorrar tiempo y reducir los costos. La ejecución de análisis con regularidad puede ayudarte a identificar tendencias o anomalías en los resultados de los análisis.
Latencia del trabajo
No hay objetivos de nivel de servicio (SLO) garantizados para los trabajos ni los activadores de trabajos. La latencia se ve afectada por varios factores, como la cantidad de datos que se analizarán, el repositorio de almacenamiento que se analiza, el tipo y la cantidad de Infotipos que se buscan, la región en la que se procesa el trabajo y los recursos de procesamiento disponibles en esa región. Por lo tanto, la latencia de los trabajos de inspección no se puede determinar con anticipación.
Para ayudar a reducir la latencia del trabajo, puedes probar con las siguientes opciones:
- Si el muestreo está disponible para tu trabajo o activador de trabajo, habilítalo.
Evita habilitar Infotipos que no necesites. Si bien los siguientes son útiles en ciertas situaciones, estos infoTypes pueden hacer que las solicitudes se ejecuten mucho más lentamente que las solicitudes que no los incluyen:
PERSON_NAMEFEMALE_NAMEMALE_NAMEFIRST_NAMELAST_NAMEDATE_OF_BIRTHLOCATIONSTREET_ADDRESSORGANIZATION_NAME
Especifica siempre los Infotipos de forma explícita. No uses una lista de Infotipos vacía.
Si es posible, usa otra región de procesamiento.
Si sigues teniendo problemas de latencia con los trabajos después de probar estas técnicas, considera usar solicitudes de content.inspect o content.deidentify en lugar de trabajos. Estos métodos están cubiertos por el Acuerdo de Nivel de Servicio. Para obtener más información, consulta el Acuerdo de Nivel de Servicio de Sensitive Data Protection.
Antes de comenzar
En las instrucciones proporcionadas en este tema, se supone lo siguiente:
Ya habilitaste la facturación.
Habilitaste Sensitive Data Protection.
La clasificación del almacenamiento requiere el siguiente alcance de OAuth: https://www.googleapis.com/auth/cloud-platform. Para obtener más información, consulta Autenticación en la API de DLP.
Inspecciona una ubicación de Cloud Storage
Puedes configurar una inspección de Sensitive Data Protection de una ubicación de Cloud Storage con la Google Cloud consola, la API de DLP a través de solicitudes de REST o RPC, o de manera programática en varios lenguajes con una biblioteca cliente. Para obtener información sobre los parámetros incluidos con los siguientes JSON y muestras de código, consulta “Configura la inspección de almacenamiento” más adelante en este tema.
Sensitive Data Protection se basa en las extensiones de archivos y los tipos de medios (MIME) para identificar los tipos de archivos que se analizarán y los modos de análisis que se aplicarán. Por ejemplo, la Protección de datos sensibles analiza un archivo .txt en modo de texto sin formato, incluso si el archivo está estructurado como un archivo CSV, que normalmente se analiza en modo de análisis estructurado.
Para configurar un trabajo de análisis de un bucket de Cloud Storage con Sensitive Data Protection, sigue estos pasos:
Console
En esta sección, se describe cómo inspeccionar un bucket o una carpeta de Cloud Storage. Si también deseas que Sensitive Data Protection cree una copia desidentificada de tus datos, consulta Cómo desidentificar datos sensibles almacenados en Cloud Storage con la consola de Google Cloud .
En la sección Protección de datos sensibles de la consola de Google Cloud , ve a la página Crear trabajo o activador de trabajo.
Ingresa la información del trabajo de Protección de datos sensibles y haz clic en Continuar para completar cada paso:
En Elige los datos de entrada, asígnale un nombre al trabajo ingresando un valor en el campo Nombre. En Ubicación, elige Cloud Storage en el menú Tipo de almacenamiento y, luego, ingresa la ubicación de los datos que deseas analizar. La sección Muestreo está preconfigurada para ejecutar un análisis de muestra con tus datos. Puedes ajustar el campo Porcentaje de objetos analizados dentro del depósito para ahorrar recursos si tienes una gran cantidad de datos. Para obtener más detalles, consulta Elige los datos de entrada.
(Opcional) En Configurar detección, puedes configurar qué tipos de datos buscar, llamados “infoTypes”. Puedes elegir de la lista de Infotipos predefinidos o seleccionar una plantilla si la hay. Para obtener más detalles, consulta Configura la detección.
En Agregar acciones, selecciona una o más acciones que Sensitive Data Protection realizará después de que se complete el trabajo. Para obtener más información, consulta Habilita las acciones de inspección o análisis de riesgo.
Después de seleccionar las acciones, haz clic en Continuar.
(Opcional) En Programar, para ejecutar el análisis una sola vez, deja el menú configurado en Ninguno. A fin de programar análisis que se ejecuten de forma periódica, haz clic en Crear un activador para ejecutar el trabajo de forma periódica. Para obtener más detalles, consulta Programa.
Haz clic en Crear.
Una vez que se complete el trabajo de protección de datos sensibles, se te redireccionará a la página de detalles del trabajo y recibirás una notificación por correo electrónico. Puedes ver los resultados de la inspección en la página de detalles del trabajo.
(Opcional) Si elegiste publicar los resultados de la protección de datos sensibles en BigQuery, en la página Detalles del trabajo, haz clic en Ver resultados en BigQuery para abrir la tabla en la IU web de BigQuery. Luego, puedes consultar la tabla y analizar los resultados. Para obtener más información sobre cómo consultar los resultados en BigQuery, consulta Consulta los resultados de la protección de datos sensibles en BigQuery.
Protocolo
A continuación, hay un JSON de muestra que se puede enviar en una solicitud POST al extremo de REST especificado de Sensitive Data Protection. En este JSON de ejemplo, se muestra cómo usar la API de DLP para inspeccionar buckets de Cloud Storage. Para obtener información sobre los parámetros incluidos en la solicitud, consulta “Configura la inspección de almacenamiento” más adelante en este tema.
Puedes probar esto de forma rápida en el Explorador de API en la página de referencia de content.inspect:
Ten en cuenta que una solicitud con éxito, incluso en el Explorador de API, creará un trabajo de análisis nuevo. Para obtener información sobre cómo controlar los trabajos de análisis, consulta “Recupera los resultados de inspección” más adelante en este tema. Si quieres obtener información general sobre el uso de JSON para enviar solicitudes a la API de DLP, consulta la guía de inicio rápido de JSON.
Entrada de JSON:
POST https://dlp.googleapis.com/v2/projects/[PROJECT-ID]/dlpJobs?key={YOUR_API_KEY}
{
"inspectJob":{
"storageConfig":{
"cloudStorageOptions":{
"fileSet":{
"url":"gs://[BUCKET-NAME]/*"
},
"bytesLimitPerFile":"1073741824"
},
"timespanConfig":{
"startTime":"2017-11-13T12:34:29.965633345Z",
"endTime":"2018-01-05T04:45:04.240912125Z"
}
},
"inspectConfig":{
"infoTypes":[
{
"name":"PHONE_NUMBER"
}
],
"excludeInfoTypes":false,
"includeQuote":true,
"minLikelihood":"LIKELY"
},
"actions":[
{
"saveFindings":{
"outputConfig":{
"table":{
"projectId":"[PROJECT-ID]",
"datasetId":"[DATASET-ID]"
}
}
}
}
]
}
}
Resultado de JSON:
{
"name":"projects/[PROJECT-ID]/dlpJobs/[JOB-ID]",
"type":"INSPECT_JOB",
"state":"PENDING",
"inspectDetails":{
"requestedOptions":{
"snapshotInspectTemplate":{
},
"jobConfig":{
"storageConfig":{
"cloudStorageOptions":{
"fileSet":{
"url":"gs://[BUCKET-NAME]/*"
},
"bytesLimitPerFile":"1073741824"
},
"timespanConfig":{
"startTime":"2017-11-13T12:34:29.965633345Z",
"endTime":"2018-01-05T04:45:04.240912125Z"
}
},
"inspectConfig":{
"infoTypes":[
{
"name":"PHONE_NUMBER"
}
],
"minLikelihood":"LIKELY",
"limits":{
},
"includeQuote":true
},
"actions":[
{
"saveFindings":{
"outputConfig":{
"table":{
"projectId":"[PROJECT-ID]",
"datasetId":"[DATASET-ID]",
"tableId":"[NEW-TABLE-ID]"
}
}
}
}
]
}
}
},
"createTime":"2018-11-07T18:01:14.225Z"
}
Java
Para obtener información sobre cómo instalar y usar la biblioteca cliente de Sensitive Data Protection, consulta las bibliotecas cliente de Sensitive Data Protection.
Para autenticarte en Protección de datos sensibles, configura las credenciales predeterminadas de la aplicación. Para obtener más información, consulta Configura la autenticación para un entorno de desarrollo local.
Node.js
Para obtener información sobre cómo instalar y usar la biblioteca cliente de Sensitive Data Protection, consulta las bibliotecas cliente de Sensitive Data Protection.
Para autenticarte en Protección de datos sensibles, configura las credenciales predeterminadas de la aplicación. Para obtener más información, consulta Configura la autenticación para un entorno de desarrollo local.
Python
Para obtener información sobre cómo instalar y usar la biblioteca cliente de Sensitive Data Protection, consulta las bibliotecas cliente de Sensitive Data Protection.
Para autenticarte en Protección de datos sensibles, configura las credenciales predeterminadas de la aplicación. Para obtener más información, consulta Configura la autenticación para un entorno de desarrollo local.
Go
Para obtener información sobre cómo instalar y usar la biblioteca cliente de Sensitive Data Protection, consulta las bibliotecas cliente de Sensitive Data Protection.
Para autenticarte en Protección de datos sensibles, configura las credenciales predeterminadas de la aplicación. Para obtener más información, consulta