Aprendizado por Reforço, RLHF e Métricas de Avaliação de Modelos
---
Aprendizado por Reforço (RL)
O RL é aprender por tentativa e erro. Um agente interage com um ambiente, toma ações e recebe recompensas ou penalidades.
| Elemento | Descrição | |---|---| | Agente | O que aprende e decide | | Ambiente | O mundo com o qual interage | | Ação | O que o agente pode fazer | | Recompensa | Feedback do ambiente | | Estado | Situação atual | | Política | Estratégia para escolher ações |
---
Matriz de Confusão
| | Real SIM | Real NÃO | |---|---|---| | Previsto SIM | VP (verdadeiro positivo) | FP (falso alarme) | | Previsto NÃO | FN (positivo perdido) | VN (verdadeiro negativo) |
!A matriz de confusão: verdadeiros/falsos positivos e negativos
Métricas de Classificação
| Métrica | Fórmula | Quando Usar | |---|---|---| | Acurácia | (VP+VN)/Total | Conjunto de dados equilibrado | | Recall | VP/(VP+FN) | Perder um positivo é perigoso | | Precisão | VP/(VP+FP) | Falsos positivos são custosos | | F1 Score | Média harmônica de P e R | Dados desequilibrados |
---
Pontos-Chave do Exame
RL tem 6 elementos: Agente, Ambiente, Ação, Recompensa, Estado, Política. RLHF alinha LLMs com preferências humanas em 4 etapas. Sobreajuste = alta variância; subajuste = alto viés. Recall: minimizar FN (detecção de fraudes/câncer). Precisão: minimizar FP (filtro de spam, teste de drogas).