Training Job do SageMaker: a unidade básica do treinamento
Cada execução de treinamento no SageMaker funciona como um Training Job — uma tarefa de computação totalmente gerenciada. Quando um Training Job inicia, o SageMaker automaticamente provisiona a instância especificada, executa o contêiner de treinamento e encerra a instância quando o treinamento é concluído. Sem servidores persistentes, sem custos de computação ociosa entre execuções.
Os parâmetros-chave na configuração de um Training Job incluem (imagem de contêiner a usar), (localização S3, nomes de canais e modo de entrada), (tipo e quantidade de instâncias), (caminho S3 para artefatos do modelo) e .
Modos de entrada de treinamento
O modo File copia todo o dataset do S3 para o disco local da instância antes de começar. Simples, mas lento para datasets grandes. O Pipe Mode transmite dados diretamente do S3 sem gravar em disco: início quase imediato, sem limites de armazenamento, mas apenas acesso sequencial. O FastFile Mode combina as vantagens de ambos: interface de sistema de arquivos com streaming sob demanda do S3, acesso aleatório compatível e sem espera de download completo. É o modo recomendado para datasets grandes em fluxos de trabalho modernos do SageMaker.
Treinamento distribuído e Spot Training
O paralelismo de dados distribui o dataset entre múltiplas GPUs, cada uma com uma cópia completa do modelo, sincronizando gradientes via AllReduce. A biblioteca de Dados Paralelos do SageMaker otimiza essa comunicação. O paralelismo de modelos é necessário quando o modelo excede a memória de uma única GPU, particionando as camadas entre múltiplas GPUs. A biblioteca Model Parallel do SageMaker suporta paralelismo de pipeline e de tensores.
O Managed Spot Training usa instâncias Spot da EC2, que custam até 90% menos que On-Demand. O SageMaker gerencia interrupções automaticamente e retoma a partir do último checkpoint quando a instância volta a estar disponível. O checkpointing em é o mecanismo habilitador. Warm Pools mantêm instâncias em estado aquecido entre jobs, eliminando a latência de provisionamento durante ciclos de experimentação ativa.
!Paralelismo de dados vs paralelismo de modelo
Ajuste de hiperparâmetros e avaliação de modelos
O SageMaker Automatic Model Tuning (AMT) automatiza a busca de hiperparâmetros. A busca aleatória é simples e totalmente paralelizável. A busca em grade garante cobertura completa, mas é combinatorialmente explosiva. A otimização bayesiana é a mais eficiente em amostras: constrói um modelo probabilístico e seleciona a próxima configuração com base na melhoria esperada. É o padrão do AMT.
SageMaker Experiments rastreia execuções de ML: hiperparâmetros, métricas e artefatos. SageMaker Debugger captura valores de tensores e métricas do sistema durante o treinamento, com regras integradas que detectam gradientes que desaparecem, sobreajuste e gargalos de GPU. SageMaker Clarify detecta vieses pré e pós-treinamento e fornece valores SHAP para explicabilidade do modelo.
As principais métricas de classificação incluem Precisão (otimizar quando FPs são custosos), Recall (otimizar quando FNs são custosos), F1 Score (média harmônica para desequilíbrio de classes) e AUC-ROC (desempenho independente do limiar). Para regressão: RMSE (sensível a erros grandes) e MAE (robusto a outliers).
Dicas para o exame
"Dataset grande, minimizar tempo de início" -- FastFile Mode ou Pipe Mode "Reduzir custos de treinamento, interrupções aceitáveis" -- Managed Spot Training + checkpointing "Experimentação iterativa, minimizar espera entre execuções" -- SageMaker Warm Pools "Modelo grande demais para uma única GPU" -- SageMaker Model Parallel Library "Otimização automatizada de hiperparâmetros, mais eficiente" -- Otimização Bayesiana (padrão do AMT) "Diagnosticar gradientes que desaparecem, gargalos de GPU" -- SageMaker Debugger + Profiler "Rastrear hiperparâmetros de experimentos, comparar resultados" -- SageMaker Experiments "Detecção de viés + explicabilidade SHAP" -- SageMaker Clarify "Desequilíbrio de classes, métrica única" -- F1 Score ou AUC-ROC "Alto custo de falsos positivos" -- Otimizar Precisão "Alto custo de falsos negativos (diagnóstico médico)" -- Otimizar Recall