Diarización de hablantes (quién habló cuándo)
La huella vocal de cada hablante es un componente de un GMM sobre características MFCC. EM separa hablantes sin etiquetas.
Nombra las cosas pensando en quien lee, no en quien escribe.
Nombra las cosas pensando en quien lee, no en quien escribe.
Modelos de Mezclas Gaussianas
Un Modelo de Mezcla Gaussiana (GMM) asume que los datos provienen de K clusters subyacentes, cada uno gaussiano con su propia media y covarianza: p(mathbf{x}) = sum_{k=1}^{K} pi_k\, mathcal{N}(mathbf{x}; boldsymbolmu_k, Sigma_k), donde pi_k geq 0 y sum_k pi_k = 1 son los pesos de mezcla. Los GMM hac
GMM: — un modelo de densidad con clustering suave.
Un Modelo de Mezcla Gaussiana (GMM) asume que los datos provienen de clusters subyacentes, cada uno gaussiano con su propia media y covarianza: donde y son los pesos de mezcla. Los GMM hacen *clustering suave* — cada punto tiene una probabilidad de pertenecer a cada cluster, no una etiqueta dura. Generalizan -means (que es aproximadamente un GMM con covarianzas esféricas compartidas) y son la herramienta estándar para estimación de densidad y clustering basado en modelos.
Ajustar un GMM por máxima verosimilitud es difícil: la log-verosimilitud no tiene máximo en forma cerrada por culpa del . Aquí entra el algoritmo Expectation-Maximization (EM) — un procedimiento iterativo que aumenta monótonamente la verosimilitud alternando dos pasos. EM es el caballo de batalla de cualquier modelo con variables latentes.
El paso E calcula, para cada punto y cluster , la responsabilidad (probabilidad posterior del cluster dado el punto bajo los parámetros actuales): Las responsabilidades son asignaciones suaves de cluster — si un punto pertenece claramente al cluster 3, ; si está entre los clusters 1 y 2, reparte masa entre ambos.
El paso M actualiza los parámetros para maximizar la log-verosimilitud completa esperada, usando las responsabilidades como pesos: Estas son exactamente la media muestral ponderada, la covarianza muestral ponderada y la proporción muestral ponderada. La actualización en forma cerrada es la recompensa por introducir variables latentes.
EM tiene garantizado aumentar monótonamente la verosimilitud y converge a un máximo local. La inicialización importa: arranques aleatorios pueden caer en óptimos locales pobres, así que la siembra con -means++ es habitual. También acechan singularidades — si una gaussiana colapsa a un solo punto, su varianza tiende a y la verosimilitud a . Regulariza sumando a cada covarianza o con priors bayesianos. Más allá de los GMM, EM entrena HMMs, latent Dirichlet allocation, análisis factorial y muchísimos otros modelos de variables latentes.
Ejemplo resuelto — una iteración de EM en datos 1D: Datos , inicializa con . Paso E: para , , , así que . Por simetría . Paso M (cluster 1): , . La media saltó al promedio empírico del cluster izquierdo.
Python (in browser)
Esperado: Means cluster near [0,0], [5,1], [2,5]
Python runs entirely in your browser via Pyodide (~6 MB on first Run, cached after).
La huella vocal de cada hablante es un componente de un GMM sobre características MFCC. EM separa hablantes sin etiquetas.
Ajusta un GMM al tráfico normal. Puntos con densidad muy baja bajo la mezcla se marcan. Usado en detección de fraude e intrusos.
La intensidad de cada píxel a lo largo del tiempo se modela como un GMM; los píxeles en componentes de baja probabilidad pasan a primer plano.
Los VAEs entrenan codificador + decodificador maximizando la ELBO, la misma cota inferior que EM — solo con latentes continuos e inferencia amortizada.
Pon a prueba tu comprensión. Puntos por acierto + racha + velocidad.
3 preguntas rápidas. Acertá 2 para marcar esta lección como completada.