SVC de sklearn con RBF
El baseline tabular no lineal por defecto. Funciona bien en datasets pequeños/medianos donde el deep learning sobreajusta.
from sklearn.svm import SVC
clf = SVC(kernel='rbf', C=1.0, gamma='scale').fit(X, y)Nombra las cosas pensando en quien lee, no en quien escribe.
Nombra las cosas pensando en quien lee, no en quien escribe.
Máquinas de Vectores de Soporte
Las SVM lineales solo pueden trazar fronteras de decisión rectas — pero la mayoría de los datos interesantes no son linealmente separables. El truco del kernel convierte SVMs lineales en clasificadores universales sin calcular nunca las características explícitamente. La clave viene del dual: depend
El truco del kernel reemplaza por — elevación implícita de características sin calcularlas explícitamente.
Las SVM lineales solo pueden trazar fronteras de decisión rectas — pero la mayoría de los datos interesantes no son linealmente separables. El truco del kernel convierte SVMs lineales en clasificadores universales sin calcular nunca las características explícitamente. La clave viene del dual: depende de solo a través de productos internos . Reemplaza cada producto interno por una función kernel , y estás operando implícitamente en un espacio de características distinto tal que — sin calcular nunca .
El dual kernelizado es y la función de decisión es una suma ponderada por kernel sobre los vectores de soporte. Un kernel válido debe ser semidefinido positivo (condición de Mercer): para cualquier , la matriz de Gram debe ser PSD. Solo esos kernels corresponden a productos internos genuinos en algún espacio de características.
Tres kernels cubren el 90% de las aplicaciones. Polinomial mapea implícitamente a características polinómicas de grado — barato e interpretable. Función de Base Radial (RBF) mapea a un espacio de características infinito-dimensional y es la opción por defecto para la mayoría de problemas. Sigmoide (no siempre PSD — cuidado) da un sabor de red neuronal poco profunda.
La elección del kernel y sus hiperparámetros son las decisiones principales de modelado. El ancho de banda RBF controla la suavidad: pequeño da una frontera muy flexible y ondulada (riesgo de sobreajuste); grande da una frontera casi lineal (riesgo de subajuste). Combinado con la penalización , las SVM RBF tienen dos hiperparámetros — — que se eligen normalmente por validación cruzada sobre una grilla logarítmica. Esa simplicidad y regularización fuerte fue la razón por la que las SVM RBF fueron el estado del arte durante décadas.
Más allá de las SVM, los kernels potencian la regresión ridge con kernel, los procesos gaussianos, kernel PCA y kernel $k$-means. Ilustran un principio profundo: cualquier algoritmo que use los datos solo a través de productos internos puede ser kernelizado. El costo es en memoria para la matriz de Gram, lo que limita los kernels clásicos a decenas de miles de puntos. Las variantes escalables modernas — aproximaciones de Nyström, características aleatorias (Rahimi-Recht) y neural tangent kernels — preservan la mentalidad del kernel mientras escalan a millones de muestras.
Python (in browser)
Esperado: RBF significantly outperforms linear on this non-linearly-separable dataset
Python runs entirely in your browser via Pyodide (~6 MB on first Run, cached after).
El baseline tabular no lineal por defecto. Funciona bien en datasets pequeños/medianos donde el deep learning sobreajusta.
from sklearn.svm import SVC
clf = SVC(kernel='rbf', C=1.0, gamma='scale').fit(X, y)Los kernels Weisfeiler-Lehman y de edición de grafos permiten clasificar grafos moleculares con SVM sin aprender representación — aún competitivos en datasets químicos pequeños.
FAVOR+ reemplaza la atención softmax con una aproximación de kernel por características aleatorias, haciendo la atención lineal en la longitud de la secuencia.
Pon a prueba tu comprensión. Puntos por acierto + racha + velocidad.
3 preguntas rápidas. Acertá 2 para marcar esta lección como completada.