Aprendizaje por Refuerzo, RLHF y Métricas de Evaluación de Modelos
---
Aprendizaje por Refuerzo (RL)
El RL es aprender por ensayo y error. Un agente interactúa con un entorno, toma acciones y recibe recompensas o penalizaciones.
| Elemento | Descripción | |---|---| | Agente | El que aprende y decide | | Entorno | El mundo con el que interactúa | | Acción | Lo que el agente puede hacer | | Recompensa | Retroalimentación del entorno | | Estado | Situación actual | | Política | Estrategia para elegir acciones |
---
Matriz de Confusión
| | Real SÍ | Real NO | |---|---|---| | Predicho SÍ | VP (verdadero positivo) | FP (falsa alarma) | | Predicho NO | FN (positivo perdido) | VN (verdadero negativo) |
!La matriz de confusión: verdaderos/falsos positivos y negativos
Métricas de Clasificación
| Métrica | Fórmula | Cuándo Usar | |---|---|---| | Exactitud | (VP+VN)/Total | Conjunto de datos equilibrado | | Recall | VP/(VP+FN) | Perder un positivo es peligroso | | Precisión | VP/(VP+FP) | Los falsos positivos son costosos | | F1 Score | Media armónica de P y R | Datos desequilibrados |
---
Puntos Clave del Examen
RL tiene 6 elementos: Agente, Entorno, Acción, Recompensa, Estado, Política. RLHF alinea los LLMs con las preferencias humanas en 4 pasos. Sobreajuste = alta varianza; subajuste = alto sesgo. Recall: minimizar FN (detección de fraudes/cáncer). Precisión: minimizar FP (filtro de spam, prueba de drogas).