Reducí una matriz de un millón de columnas a diez y perdés menos información de la que imaginás: así funcionan SVD y PCA, el dúo de álgebra lineal que sostiene los sistemas de recomendación, la compresión de imágenes y buena parte del machine learning moderno.

Un libro publicado el 11 de julio de 2026 en arXiv por Afonso Bandeira, Amit Singer y Thomas Strohmer, titulado "Mathematics of Data Science", dedica un capítulo entero a esta técnica junto a otros 15 sobre los fundamentos matemáticos de la ciencia de datos: desde geometría en dimensiones altas hasta redes neuronales profundas. Este artículo toma ese capítulo como punto de partida y lo explica desde cero, con código en Python.

TL;DR

Vas a entender qué hace matemáticamente la descomposición en valores singulares (SVD), paso a paso.- Vas a poder implementar PCA desde cero con NumPy, sin depender de una caja negra.- Vas a saber elegir cuántas componentes principales conservar usando la varianza explicada.- Vas a distinguir cuándo usar PCA/SVD y cuándo conviene t-SNE, UMAP o un autoencoder.- Vas a comprender por qué la maldición de la dimensionalidad hace que las distancias pierdan sentido.- Vas a poder comprimir una matriz o imagen calculando su aproximación de rango bajo con SVD.- Vas a saber verificar que tu PCA está bien calculado revisando explained_variance_ratio_.