Ciclo de vida do desenvolvimento ML

Domine as 9 etapas do pipeline ML — EDA, preprocessamento, engenharia de features, sobreajuste, metricas de avaliacao e implantacao com SageMaker — explicadas com analogias para iniciantes.

O ciclo de vida do desenvolvimento ML representa aproximadamente 20% do exame AIF-C01. Tópicos principais: coleta de dados, pré-processamento, treinamento de modelos, overfitting, métricas de avaliação e MLOps.

---

 

O pipeline de ML — Analogia culinária

| Etapa ML | Analogia culinária | Objetivo | |----------|-------------------|---------| | 1. Coleta de dados | Obter ingredientes | Dados suficientes e diversos | | 2. EDA | Verificar frescor | Entender distribuições, valores ausentes, outliers | | 3. Pré-processamento | Limpar ingredientes | Tratar nulos, normalizar, codificar | | 4. Engenharia de features | Desenvolver receita | Transformar dados em forma compatível | | 5. Treinamento | Cozinhar | Algoritmo aprende padrões | | 6. Ajuste de hiperparâmetros | Temperar | Otimizar configuração do modelo | | 7. Avaliação | Provar | Medir precisão, recall, F1, AUC | | 8. Implantação | Servir | Fornecer previsões em produção | | 9. Monitoramento | Controle de qualidade | Detectar degradação de desempenho |

!O ciclo de vida de desenvolvimento de ML, da coleta de dados à implantação

Overfitting e métricas de avaliação

Overfitting: O modelo memoriza os dados de treinamento, mas falha com dados novos.

| Métrica | Quando usar | |---------|------------| | Precisão (Precision) | Quando falsos positivos são custosos (filtro de spam) | | Recall | Quando falsos negativos são custosos (diagnóstico de câncer) | | F1 Score | Quando ambos importam igualmente |

---

 

MLOps com SageMaker

| Ferramenta | Papel | |-----------|-------| | SageMaker Model Monitor | Detectar deriva de dados e degradação de desempenho | | SageMaker Pipelines | Automatizar o fluxo de trabalho ML completo | | SageMaker Experiments | Rastrear e comparar experimentos |

---

 

Pontos-chave para o exame

"Verificar distribuições, valores ausentes, outliers" — EDA "Modelo memoriza dados de treinamento, falha com dados novos" — Overfitting "De positivos previstos, quantos são corretos" — Precisão (Precision) "De positivos reais, quantos foram detectados" — Recall "Detectar degradação de desempenho após implantação" — SageMaker Model Monitor

Voltar à lista do blog