Aprendizado por Reforço, RLHF e Métricas de Avaliação

Cobre RL, RLHF, ajuste de modelo (sobreajuste/subajuste), matriz de confusão, Precisão/Recall/F1/AUC-ROC, e métricas de LLM (ROUGE, Perplexidade) — tudo em um foco de exame

Aprendizado por Reforço, RLHF e Métricas de Avaliação de Modelos

---

 

Aprendizado por Reforço (RL)

O RL é aprender por tentativa e erro. Um agente interage com um ambiente, toma ações e recebe recompensas ou penalidades.

| Elemento | Descrição | |---|---| | Agente | O que aprende e decide | | Ambiente | O mundo com o qual interage | | Ação | O que o agente pode fazer | | Recompensa | Feedback do ambiente | | Estado | Situação atual | | Política | Estratégia para escolher ações |

---

 

Matriz de Confusão

| | Real SIM | Real NÃO | |---|---|---| | Previsto SIM | VP (verdadeiro positivo) | FP (falso alarme) | | Previsto NÃO | FN (positivo perdido) | VN (verdadeiro negativo) |

!A matriz de confusão: verdadeiros/falsos positivos e negativos

Métricas de Classificação

| Métrica | Fórmula | Quando Usar | |---|---|---| | Acurácia | (VP+VN)/Total | Conjunto de dados equilibrado | | Recall | VP/(VP+FN) | Perder um positivo é perigoso | | Precisão | VP/(VP+FP) | Falsos positivos são custosos | | F1 Score | Média harmônica de P e R | Dados desequilibrados |

---

 

Pontos-Chave do Exame

RL tem 6 elementos: Agente, Ambiente, Ação, Recompensa, Estado, Política. RLHF alinha LLMs com preferências humanas em 4 etapas. Sobreajuste = alta variância; subajuste = alto viés. Recall: minimizar FN (detecção de fraudes/câncer). Precisão: minimizar FP (filtro de spam, teste de drogas).

Voltar à lista do blog