Modelos Supervisados
Random Forest
XG Boost
K Nearest Neighbors
Support Vector Machine
100

¿Qué es el overfitting (sobreajuste)?

Este problema ocurre cuando un modelo aprende demasiado bien los datos de entrenamiento y pierde capacidad de generalizar.

100

Random Forest es un ____ construido a partir de ______.

Random Forest es un ensemble construido a partir de muchos de estos modelos base.

100

¿Qué es max_depth?

Este hiperparámetro limita la profundidad máxima de cada árbol para controlar la complejidad y evitar overfitting.

100

¿Qué es K?

Este es el hiperparámetro principal de KNN: define cuántos vecinos se consideran para la predicción.

100

¿Qué es el margen?

SVM busca el hiperplano que separa las clases maximizando esta distancia.

200

¿Qué es la matriz de confusión?

Esta matriz resume los aciertos y errores de un modelo de clasificación, mostrando verdaderos/falsos positivos y negativos.

200

¿Qué es el bagging (bootstrap aggregating)?

Esta técnica entrena cada árbol con una muestra aleatoria con reemplazo del dataset original.

200

¿Cómo se diferencia XG Boost de Random Forest?

XGBoost construye los árboles de forma secuencial (boosting), donde cada árbol corrige los errores del anterior.

200

¿Qué es la distancia euclidiana?

Esta es la métrica de distancia más usada por defecto en KNN.

200

¿Qué son los vectores de soporte?

Así se llaman los puntos de datos más cercanos al hiperplano, los que determinan su posición.

300

¿Qué es la validación cruzada (k-fold cross-validation)?

Esta técnica divide los datos en k subconjuntos para evaluar el modelo de forma más robusta.

300

¿Para que es la votación mayoritaria?

En clasificación, así es como Random Forest realiza las predicciones de sus árboles individuales.

300

¿Qué es early stopping?

XGBoost usa esta técnica para detener el entrenamiento cuando el modelo deja de mejorar sobre el set de validación.

300

¿Qué es escalar / normalizar los datos?

Antes de aplicar KNN es fundamental hacer esto con las variables numéricas, porque el algoritmo es sensible a la escala.

300

¿SVM solamente puede resolver problemas donde las clases pueden separarse mediante una línea recta?

No. Utilizando kernels, SVM puede construir fronteras de decisión no lineales.

400

¿Qué es la regularización L1 (Lasso)?

Esta técnica de regularización agrega una penalización proporcional al valor absoluto de los coeficientes, y puede llevar algunos a cero, funcionando como selección de variables.

400

¿Cómo resuelve Random Forest un problema de regresión?

Realiza un promedio sobre el resultado de cada uno de las predicciones de los árboles.

400

¿Qué función cumple el learning rate en XGBoost y qué ocurre si utilizamos un valor demasiado alto?

Controla cuánto contribuye cada nuevo árbol al modelo. Si es demasiado alto, el modelo puede aprender demasiado rápido, perder precisión y ser más propenso al overfitting.

400

Tienes dos variables: edad entre 18 y 80, y salario entre 20.000 y 200.000. ¿Qué problema puede aparecer en KNN si no escalas las variables?

El salario dominará el cálculo de distancia, haciendo que la edad tenga mucha menos influencia.

400

¿Qué es el kernel trick?

Esta técnica permite a SVM resolver problemas no linealmente separables sin calcular explícitamente coordenadas en un espacio de mayor dimensión.

500

¿Qué es el data leakage (fuga de datos)?

Este problema ocurre cuando información del target o del futuro se filtra accidentalmente en las variables predictoras durante el entrenamiento.

500

¿Por qué Random Forest suele ser menos propenso al overfitting que un único árbol de decisión?

Porque combina muchos árboles entrenados con diferentes muestras y subconjuntos de variables, y luego combina sus predicciones, reduciendo la varianza y evitando depender demasiado de un solo árbol.

500

¿Qué sucede en XGBoost si agregamos demasiados árboles y no controlamos la complejidad del modelo?

Puede producirse overfitting, porque el modelo comienza a ajustarse demasiado a los datos de entrenamiento.

500

¿Qué es KNN ponderado por distancia (weighted KNN)?

Esta variante de KNN, en vez de dar el mismo peso a todos los vecinos, le da más peso a los vecinos más cercanos al momento de votar o promediar.

500

Si aumentamos mucho C en SVM, ¿el modelo prioriza un margen más amplio o penalizar fuertemente los errores de clasificación?

Penalizar fuertemente los errores, lo que puede generar una frontera más compleja y aumentar el riesgo de overfitting.

M
e
n
u