Infraestrutura de implantação e estratégias de escalabilidade

Implantar um modelo treinado em produção é uma das etapas mais complexas de um pipeline de ML. Este guia aborda os quatro modos de inferência do SageMaker (tempo real, batch, serverless, async), como escolher entre eles e como aplicar estratégias de Auto Scaling e seleção de instâncias.

A decisão de implantação: qual infraestrutura escolher

Implantar um modelo treinado em produção de forma confiável costuma ser mais complexo do que treiná-lo. O SageMaker oferece quatro modos de inferência distintos. Os três critérios-chave são: tolerância à latência, tamanho do payload e padrão de tráfego.

 

Endpoints em tempo real

Os endpoints em tempo real do SageMaker são a escolha certa quando um aplicativo precisa de previsões em centenas de milissegundos. Casos típicos incluem motores de recomendação, detecção de fraude e análise de imagens em tempo real. Para seleção de instâncias, modelos de deep learning exigem GPU (ml.g4dn, ml.g5, ml.p3), enquanto modelos tradicionais funcionam bem em CPU (ml.c5, ml.m5). Instâncias baseadas em AWS Inferentia (ml.inf1, ml.inf2) podem oferecer até 70% de economia versus GPU com alto throughput. Variantes de produção permitem dividir o tráfego entre versões de modelo para A/B testing.

 

Batch Transform

O Batch Transform é ideal para processar grandes volumes de dados armazenados no S3 quando a resposta em tempo real não é necessária: pontuação em lotes noturnos, pré-processamento em pipelines de dados, geração offline de recomendações. As instâncias são encerradas automaticamente ao término do job.

 

Inferência serverless e inferência assíncrona

A inferência serverless é projetada para tráfego intermitente ou imprevisível. Paga-se apenas pelo tempo de computação utilizado, mas há latência de cold start quando o contêiner ficou inativo. A inferência assíncrona é a escolha certa para payloads grandes (até 1GB) ou tempos de processamento longos. As solicitações são colocadas em fila e os resultados são salvos no S3.

 

Tabela comparativa

| Modo | Latência | Payload máx. | Modelo de custo | Caso de uso | |------|---------|--------------|-----------------|-------------| | Endpoint tempo real | Milissegundos | 6MB | Tempo de instância | Recomendações em tempo real | | Batch Transform | N/A | Ilimitado | Duração do job | Pontuação offline em massa | | Serverless | Dezenas-centenas de ms | 4MB | Invocações + duração | Tráfego intermitente | | Async | Segundos-minutos | 1GB | Tempo de instância | Processamento de arquivos grandes |

!Os 4 modos de inferência do SageMaker

MME, Neo, Inferentia e Auto Scaling

Os endpoints multi-modelo (MME) servem milhares de modelos similares a partir de um único endpoint, carregando-os dinamicamente do S3. O SageMaker Neo compila modelos para hardware específico (EC2, dispositivos edge, Inferentia). As instâncias Inf1/Inf2 oferecem maior eficiência de custo para inferência. O Auto Scaling suporta rastreamento de destino, escalonamento por etapas e escalonamento programado, com métricas como InvocationsPerInstance.

 

Contêineres e VPC

O SageMaker fornece contêineres pré-construídos para os principais frameworks. Para necessidades especiais, use BYOC (traga seu próprio contêiner) com ECR. Em produção, os endpoints são geralmente implantados dentro de uma VPC. Para dispositivos edge, combine SageMaker Neo com IoT Greengrass e SageMaker Edge Manager.

 

Pontos-chave para o exame

"Latência de milissegundos, tráfego contínuo" -- Endpoint em tempo real "Processar grande dataset em lote, resultados no S3" -- Batch Transform "Tráfego intermitente, minimizar custo" -- Inferência serverless "Payload de 1GB, processamento longo" -- Inferência assíncrona "Milhares de modelos, pouco tráfego individual" -- MME "Reduzir custo de inferência GPU" -- AWS Inferentia "Compilar para dispositivo edge" -- SageMaker Neo + IoT Greengrass

Voltar à lista do blog