AIP-C01: Seleção de modelos FM e design de soluções

Fundamentos do exame AIP-C01: compare as opcoes do catalogo de modelos do Amazon Bedrock, ajuste os parametros de inferencia e entenda os compromissos entre Provisioned Throughput e inferencia sob demanda.

O exame AIP-C01 avalia a capacidade de mapear requisitos de negocio a caracteristicas de modelos FM. Este guia aborda o catalogo de modelos do Amazon Bedrock, ajuste de parametros de inferencia e criterios de selecao do Provisioned Throughput.

 

Analise de requisitos

Antes de selecionar um modelo, analise tres eixos: modalidade de entrada/saida, o triangulo de compromisso custo-latencia-qualidade e o tamanho da janela de contexto. A modalidade determina a viabilidade; o triangulo define qual restricao domina; a janela de contexto e decisiva para documentos longos.

!O trade-off Custo-Latência-Qualidade

Catalogo de modelos Amazon Bedrock

Amazon Bedrock e um servico totalmente gerenciado que fornece acesso a FMs de varios provedores por meio de uma unica API.

Claude (Anthropic): Haiku (baixa latencia), Sonnet (equilibrio), Opus (maxima qualidade) — todos com 200K tokens Titan (AWS): Text para geracao, Embeddings V2 para RAG, Image Generator para imagens Llama (Meta): Open-source, ideal para fine-tuning de dominio especifico Mixtral (Mistral): Arquitetura MoE, qualidade de 70B a custo reduzido Cohere: Command para fluxos multilinguais, Embed para busca semantica

 

Parametros de inferencia

temperature controla a diversidade (0.0 para deterministico, 1.0 para criativo). top-p usa amostragem por massa de probabilidade acumulada. top-k restringe o conjunto de tokens candidatos. max_tokens controla diretamente o custo. stop_sequences interrompe a geracao ao encontrar strings especificas.

 

Provisioned Throughput vs Sob Demanda

O modo sob demanda cobra por token sem reserva, adequado para trafego impredizivel. O Provisioned Throughput reserva Model Units (MU) com taxa horaria, garantindo throughput — essencial para producao com SLA e obrigatorio para modelos fine-tuned. Compromissos de 6 meses sao aproximadamente 40% mais baratos. O Inference Profile multirregional agrupa endpoints em varias regioes AWS para distribuicao de carga e failover automatico.

Voltar à lista do blog