Conceitos Fundamentais de Dados

Se voce e completamente novo no mundo dos dados, este guia explica do zero os tipos de dados, formatos de arquivo como CSV e Parquet, bancos de dados relacionais e NoSQL, e a diferenca entre um data lake e um data warehouse — tudo com exemplos do dia a dia.

Azure DP-900 e a certificacao de dados de nivel inicial da Microsoft. Se voce e completamente novo neste mundo, nao se preocupe — vamos explicar tudo com analogias do dia a dia para que voce entenda nao so o "o que" mas o "por que" de cada conceito.

 

Tipos de dados: Estruturados, Semiestruturados e Nao estruturados

Pense nos diferentes tipos de informacao que voce encontra no cotidiano. Nem toda informacao tem a mesma forma.

Dados estruturados

Imagine o registro de hospedes de um hotel. Cada hospede preenche exatamente o mesmo formulario: nome, data de chegada, numero do quarto, telefone. Cada linha tem as mesmas colunas. Esta e a ideia dos dados estruturados: um esquema (estrutura) fixo que todos os registros devem seguir.

Sao armazenados em bancos de dados relacionais e consultados com SQL.

Exemplos: tabelas de clientes, registros de pedidos, folhas de pagamento

Dados semiestruturados

Agora imagine uma colecao de recibos de compra de lojas diferentes. Alguns tem desconto, outros nao. Alguns tem numero de cartao fidelidade, outros nao. O formato nao e exatamente o mesmo em todos, mas voce consegue identificar campos comuns como "item", "preco" e "data".

Esta e a ideia dos dados semiestruturados: tem alguma estrutura (chaves e tags) mas sem um esquema rigidamente fixo.

Exemplos: arquivos JSON, arquivos XML, e-mails com cabecalhos

Dados nao estruturados

Pense num album de fotos, gravacoes de voz ou uma pasta de PDFs. Nao ha linhas nem colunas. Um computador nao consegue extrair automaticamente "Nome: Joao, Idade: 30" de uma foto — ele so ve pixels. Isso sao dados nao estruturados.

Representam mais de 80% de todos os dados do mundo.

Exemplos: imagens, videos, arquivos de audio, documentos PDF, publicacoes em redes sociais

 

Formatos de arquivo: CSV, JSON, Parquet e mais

Quando voce salva dados em um arquivo, o formato escolhido importa muito. Cada formato tem seu proposito.

CSV (Valores Separados por Virgulas)

O formato mais simples de todos. Os dados sao salvos como texto simples, com cada valor separado por uma virgula. Voce pode abrir um arquivo CSV no Bloco de Notas ou no Excel. Quando voce exporta uma planilha do Excel, CSV e frequentemente uma das opcoes.

Melhor para: conjuntos de dados pequenos, troca de dados, importacao para Excel

JSON (JavaScript Object Notation)

JSON armazena dados como pares chave-valor dentro de chaves: . Tambem suporta estruturas aninhadas. E o formato padrao usado pelas APIs web para trocar informacoes entre aplicativos.

Melhor para: APIs web, arquivos de configuracao, dados semiestruturados

Parquet

Parquet armazena os dados coluna por coluna em vez de linha por linha. Se voce so precisa calcular a media da coluna "Valor de vendas" em uma tabela com um milhao de linhas e 50 colunas, o Parquet vai diretamente para aquela coluna sem tocar nas outras. Isso torna as consultas de analise dramaticamente mais rapidas e o armazenamento mais eficiente.

Melhor para: analitica de big data, Azure Data Lake, Synapse Analytics, Apache Spark

ORC (Optimized Row Columnar)

Conceito similar ao Parquet — armazenamento colunar, otima compressao. O ORC e especificamente otimizado para o ecossistema Hadoop e Hive.

Melhor para: ecossistema Hadoop, consultas Hive

Avro

Avro armazena dados linha por linha e inclui o esquema dentro do proprio arquivo. A vantagem principal e a evolucao do esquema: se voce adicionar um novo campo aos seus dados, os arquivos antigos sem esse campo ainda podem ser lidos sem erros. E ideal para ambientes de streaming.

Melhor para: streaming de dados em tempo real (Kafka), pipelines de eventos

XML (Linguagem de Marcacao Extensivel)

XML envolve os dados em tags descritivas. E muito legivel e autodescritivo, mas o tamanho dos arquivos e maior. Muitos sistemas empresariais antigos ainda usam XML.

Melhor para: integracao com sistemas legados, arquivos de configuracao

| Formato | Armazenamento | Vantagem principal | Uso principal | |---------|--------------|-------------------|--------------| | CSV | Por linhas | Simples e universal | Troca de dados | | JSON | Chave-valor | Estrutura flexivel | APIs, apps web | | Parquet | Por colunas | Consultas analiticas rapidas | Big data | | ORC | Por colunas | Otimizado para Hive | Ecossistema Hadoop | | Avro | Por linhas | Evolucao de esquema | Streaming | | XML | Por tags | Autodescritivo | Sistemas legados |

 

Tipos de banco de dados: Relacional vs Nao relacional

Um banco de dados e simplesmente um lugar organizado para armazenar e recuperar dados. Ha duas filosofias principais.

Bancos de dados relacionais

Imagine um arquivo bem organizado. Cada gaveta e rotulada (Clientes, Pedidos, Produtos). Dentro de cada gaveta, cada documento segue o mesmo formulario. As gavetas podem se referenciar entre si por meio de um ID comum. Tudo esta ordenado, conectado e consistente.

Os bancos de dados relacionais armazenam dados em tabelas e usam SQL para consulta-los. Os relacionamentos entre tabelas sao definidos com Chaves Primarias e Chaves Estrangeiras. Sao ideais quando a consistencia e precisao dos dados sao criticas.

Servicos Azure: Azure SQL Database, Azure Database for MySQL, Azure Database for PostgreSQL

Bancos de dados nao relacionais (NoSQL)

Agora imagine uma bolsa de armazenamento grande e flexivel. Voce pode colocar itens de todos os formatos e tamanhos. Voce ganha flexibilidade e velocidade em escala. Ha quatro tipos principais:

Armazenamentos chave-valor: como um vestiario — cada item tem uma chave unica e e recuperado instantaneamente. Muito rapido para buscas simples. Exemplo: Redis, Azure Cache for Redis

Armazenamentos de documentos: guardam dados como documentos JSON. Cada documento pode ter uma estrutura diferente. Ideal para perfis de usuario, catalogos de produtos. Exemplo: MongoDB, Azure Cosmos DB

Armazenamentos de colunas: agrupam colunas relacionadas para armazenamento e recuperacao eficientes. Projetados para grandes volumes de escrita, como sensores IoT ou sistemas de log. Exemplo: Apache Cassandra

Armazenamentos de grafos: armazenam dados como nos e relacionamentos. Perfeitos para redes sociais e analise de relacionamentos complexos. Exemplo: Neo4j, Azure Cosmos DB (API Gremlin)

 

Data Lake vs Data Warehouse

Ao armazenar grandes volumes de dados para analitica, esses dois termos aparecem constantemente.

Data Lake (Lago de dados)

Imagine um lago natural que coleta agua de rios, chuva e fontes subterraneas — na forma que chegar, sem filtrar. Um data lake funciona da mesma forma: aceita dados brutos em qualquer formato. Voce so decide como organiza-los quando precisar (Schema-on-Read).

Perfeito para armazenar tudo primeiro e decidir depois. Cientistas de dados o adoram para explorar dados e treinar modelos de machine learning.

Servico Azure: Azure Data Lake Storage Gen2

Data Warehouse (Armazem de dados)

Agora imagine um armazem bem gerenciado com prateleiras rotuladas. Antes de qualquer coisa entrar, e inspecionada, limpa e colocada exatamente onde deve ficar (Schema-on-Write). Os dados ja estao processados e prontos para uso.

Voltar à lista do blog