Registros de Auditoria e Governança de Privacidade de Dados

Rastreamento de auditoria do CloudTrail, detecção de PII do Macie, AWS Config, soberania de dados, estrutura de governança.

Imagine uma falha no pipeline de dados: alguém acidentalmente excluiu dados críticos, um usuário não autorizado acessou um arquivo sensível, ou ocorreu uma violação de conformidade. Quando esses eventos acontecem, você precisa ser capaz de responder "quando, quem e o quê" com certeza. É para isso que servem os logs de auditoria. E quando seus dados envolvem informações pessoais, você também precisa de governança de privacidade de dados — uma abordagem sistemática para proteger esses dados e demonstrar conformidade. Este guia explica como a AWS fornece registro de auditoria, detecção de PII, controles de soberania de dados e estruturas de governança.

 

Logs de Auditoria — Construindo um Registro Completo do Que Aconteceu

Um log de auditoria é um registro cronológico de eventos significativos em um sistema. Ele captura quem realizou uma ação, quando ocorreu, de onde, e qual foi o resultado. Na AWS, dois serviços lidam com a maior parte do registro de auditoria: CloudTrail para atividade da API AWS e CloudWatch Logs para atividade no nível de aplicação.

AWS CloudTrail — A Caixa Preta da sua Conta AWS

O CloudTrail registra cada chamada de API feita na sua conta AWS. Cada vez que um usuário, role IAM ou serviço AWS faz uma solicitação de API — criar um bucket S3, executar um job Glue, modificar um grupo de segurança — o CloudTrail registra isso. Pense nele como a caixa preta de um avião: quando algo dá errado, você pode examinar o histórico do CloudTrail para reconstruir exatamente o que aconteceu.

O CloudTrail registra duas categorias de eventos:

Eventos de Gerenciamento cobrem ações que criam, modificam ou excluem recursos AWS. Iniciar ou parar uma instância EC2, criar ou excluir um bucket S3, alterar permissões IAM, lançar ou parar um job ETL do Glue. Estão habilitados por padrão sem custo adicional.

Eventos de Dados cobrem interações diretas com os dados dentro dos recursos AWS. Ler um objeto S3 (GetObject), fazer upload de um arquivo (PutObject), invocar uma função Lambda, acessar um item do DynamoDB. Os eventos de dados estão desabilitados por padrão porque geram volumes enormes de entradas de log. Você os habilita seletivamente em buckets S3 específicos ou funções Lambda onde precisa de trilhas de auditoria detalhadas. Há um custo adicional por evento registrado.

O CloudTrail Lake é um armazenamento de eventos gerenciado que mantém os eventos do CloudTrail em um formato que você pode consultar diretamente com SQL. Você pode executar consultas como "mostre-me cada chamada de API que acessou o bucket prod-finance nos últimos 30 dias, agrupada pelo role IAM que fez a chamada."

Amazon CloudWatch Logs — Coleta Centralizada de Logs de Aplicação

Enquanto o CloudTrail registra a atividade da API AWS, o CloudWatch Logs coleta os logs operacionais gerados pelos serviços AWS enquanto rodam. Quando um job ETL do Glue executa, ele gera logs sobre quais arquivos processou, erros encontrados e quanto tempo cada etapa levou. Todos esses logs fluem para o CloudWatch Logs.

Principais capacidades do CloudWatch Logs:

A configuração de retenção de logs define por quanto tempo manter os logs — de 1 dia a indefinidamente. Regulamentações podem exigir retenção de 7 anos para logs de auditoria financeira.

O CloudWatch Logs Insights fornece uma interface de consulta interativa para seus logs usando uma linguagem de consulta similar ao SQL. Você pode perguntar "qual função Lambda teve mais entradas de log ERROR na última hora?" sem exportar os dados para nenhum lugar.

Os Filtros de Métricas extraem padrões do texto de log e os convertem em métricas do CloudWatch. Se você criar um filtro de métricas em logs do Glue que corresponda ao texto "ERROR", cada ocorrência incrementa uma métrica error_count. Você pode criar um Alarme do CloudWatch nessa métrica para receber notificações quando ultrapassar um limite.

Integração de Logs Multi-Serviço

Três padrões arquiteturais ajudam a analisar logs de toda a plataforma:

O padrão de centralização do CloudWatch Logs roteia todos os logs de serviços para o CloudWatch Logs e usa o Logs Insights como interface de consulta unificada.

O padrão S3 + Athena armazena logs no S3 para retenção de longo prazo e econômica, e usa o Athena para consultas SQL sob demanda. Ideal para arquivos de auditoria de conformidade.

O Amazon OpenSearch Service lida com pesquisa e visualização em tempo real de grandes volumes de logs. Os logs fluem continuamente via Kinesis Data Firehose, e os operadores usam painéis Kibana para monitorar a plataforma em tempo real.

 

Privacidade de Dados — Protegendo Informações Pessoais

A governança de privacidade de dados determina como proteger informações pessoais — identificar onde vivem os dados sensíveis, aplicar regras sobre quem pode vê-los e garantir que os dados permaneçam na localização geográfica correta.

Identificação de PII — Encontrando Dados Sensíveis

PII (Informações de Identificação Pessoal) é qualquer dado que possa ser usado para identificar um indivíduo específico: nomes, endereços de e-mail, números de telefone, números de identificação nacional, números de cartão de crédito e mais.

O Amazon Macie é um serviço de segurança de dados totalmente gerenciado que usa aprendizado de máquina para descobrir e classificar automaticamente PII em buckets S3. O modelo ML do Macie é treinado para reconhecer dezenas de tipos de dados sensíveis:

Dados financeiros: números de cartão de crédito, números de conta bancária Dados de saúde: códigos de diagnóstico, informações de prescrições Identificadores pessoais: nomes completos, endereços, e-mails, telefones Credenciais: chaves de API, senhas, chaves de acesso AWS em arquivos Identificadores governamentais: números de previdência social, números de passaporte

A integração entre Macie e Lake Formation cria um poderoso fluxo de trabalho de proteção de privacidade. O Macie identifica quais tabelas contêm PII. Você pode então usar o Lake Formation para aplicar controle de acesso a nível de coluna nessas tabelas específicas.

Soberania de Dados — Garantindo que os Dados Fiquem no Lugar Certo

A soberania de dados é o conceito de que os dados estão sujeitos às leis do país onde residem fisicamente.

As Regiões AWS são grupos de data centers fisicamente separados em locais geográficos específicos. Os dados armazenados na Região de Seul (ap-northeast-2) residem na Coreia do Sul e não saem dessa região a menos que você configure explicitamente a replicação.

A Replicação entre Regiões (CRR) do S3 requer governança cuidadosa. Se a lei de privacidade coreana exige que os dados de cidadãos coreanos permaneçam na Coreia, replicá-los para a região us-east-1 seria uma violação.

Backups e snapshots seguem as mesmas regras. As regras do AWS Config podem monitorar cópias de snapshots entre regiões e sinalizá-las como não conformes.

 

Estrutura de Governança — Regras Sistemáticas e Aplicação Automatizada

AWS Config — Monitoramento Contínuo de Conformidade

O AWS Config rastreia o estado de configuração dos seus recursos AWS ao longo do tempo e os avalia em relação às regras que você define.

Exemplos de regras Config relevantes para engenharia de dados:

"Todos os buckets S3 devem ter criptografia do lado do servidor habilitada" — O Config avalia cada bucket S3 e marca qualquer bucket não criptografado como não conforme.

"Os buckets S3 devem bloquear todo o acesso público" — Qualquer bucket onde o acesso público é permitido é imediatamente sinalizado.

"As instâncias RDS devem ser criptografadas" — Instâncias de banco de dados não criptografadas são não conformes.

Quando o Config encontra um recurso não conforme, ele o marca no painel, registra o histórico de conformidade e pode enviar notificações via EventBridge ou SNS. Você também pode configurar ações de correção automática.

Lake Formation como Plataforma de Governança

O Lake Formation fornece a camada de aplicação de políticas para todo o seu data lake. Ele impõe quem pode ver quais dados no momento da consulta, independentemente de qual ferramenta de consulta é usada — Athena, Redshift Spectrum, EMR, Glue.

A linhagem de dados rastreia como os dados fluem pelo seu pipeline — de qual sistema de origem veio, que transformações sofreu, quais sistemas downstream o consomem. O Lake Formation se integra com o Catálogo de Dados do Glue para fornecer visibilidade de linhagem.

Ao compartilhar dados através do Redshift Data Sharing, os filtros do Lake Formation se aplicam aos dados compartilhados. Um parceiro consumindo seus dados Redshift compartilhados só pode ver as colunas e linhas que você permite explicitamente.

 

Referência Rápida para o Exame

| Palavra-chave do Exame | Resposta | |----------------------|----------| | Registrar todas as chamadas de API AWS | AWS CloudTrail | | Registrar leituras e gravações de objetos S3 (requer configuração extra) | Eventos de dados do CloudTrail | | Consultar logs do CloudTrail com SQL | CloudTrail Lake | | Coleta centralizada de logs de aplicação | Amazon CloudWatch Logs | | Consultas tipo SQL em dados de log | CloudWatch Logs Insights | | Converter padrões de log em métricas | Filtros de Métricas do CloudWatch | | Pesquisa e visualização em tempo real de grandes volumes de logs | Amazon OpenSearch Service | | Detectar automaticamente PII no S3 com ML | Amazon Macie | | Monitoramento automatizado de conformidade de regras para recursos | AWS Config | | Armazenar dados em localização geográfica específica por lei | Soberania de dados (seleção de região) | | Plataforma de governança central para data lake | AWS Lake Formation | | CloudTrail vs CloudWatch Logs | CloudTrail=quem chamou qual API, CloudWatch=o que o serviço fez durante a execução |

Voltar à lista do blog