Aprendizaje por Refuerzo, RLHF y Métricas de Evaluación

Cubre RL, RLHF, ajuste de modelos (sobreajuste/subajuste), matriz de confusión, Precisión/Recall/F1/AUC-ROC, y métricas de LLM (ROUGE, Perplejidad) — todo en un enfoque de examen

Aprendizaje por Refuerzo, RLHF y Métricas de Evaluación de Modelos

---

 

Aprendizaje por Refuerzo (RL)

El RL es aprender por ensayo y error. Un agente interactúa con un entorno, toma acciones y recibe recompensas o penalizaciones.

| Elemento | Descripción | |---|---| | Agente | El que aprende y decide | | Entorno | El mundo con el que interactúa | | Acción | Lo que el agente puede hacer | | Recompensa | Retroalimentación del entorno | | Estado | Situación actual | | Política | Estrategia para elegir acciones |

---

 

Matriz de Confusión

| | Real SÍ | Real NO | |---|---|---| | Predicho SÍ | VP (verdadero positivo) | FP (falsa alarma) | | Predicho NO | FN (positivo perdido) | VN (verdadero negativo) |

!La matriz de confusión: verdaderos/falsos positivos y negativos

Métricas de Clasificación

| Métrica | Fórmula | Cuándo Usar | |---|---|---| | Exactitud | (VP+VN)/Total | Conjunto de datos equilibrado | | Recall | VP/(VP+FN) | Perder un positivo es peligroso | | Precisión | VP/(VP+FP) | Los falsos positivos son costosos | | F1 Score | Media armónica de P y R | Datos desequilibrados |

---

 

Puntos Clave del Examen

RL tiene 6 elementos: Agente, Entorno, Acción, Recompensa, Estado, Política. RLHF alinea los LLMs con las preferencias humanas en 4 pasos. Sobreajuste = alta varianza; subajuste = alto sesgo. Recall: minimizar FN (detección de fraudes/cáncer). Precisión: minimizar FP (filtro de spam, prueba de drogas).

Volver a la lista del blog