La compresión de datos es la tecnología clave para la televisión y el video digital, es muy interesante y casi nadie sabe que existe, así es que sin más preámbulos, aquí voy con mi compresión para dummies.Fue Claude Shannon, el gran papi de la Teoría de la información, a él se le ocurrió la idea. En realidad fue el primero que se cuestionó en serio sobre que significa "información" y descubrió que información es aquello que no se puede predecir. Un ejemplo sencillo: supongamos que yo decido no usar nunca más la letra "a", entonces escribo "hol mis migos" y todos entienden igual lo que quise decir. Puedo escribir un libro completo sin usar la "a" y todos lo entenderían, solo por el contexto. Eliminamos datos pero la información sigue intacta.
Una de las principales consecuencias de este descubrimiento de Shannon fue que la información normalmente es redundante, contiene muchos datos innecesarios que se podrían eliminar sin que se pierda el contenido "informativo". Nuestro cerebro usa la compresión de manera abundante, si no descartáramos datos superfluos no podríamos pensar por la inmensa cantidad de datos que necesitaríamos procesar a cada instante. Bueno, Shannon -ejem. ingeniero electrónico, ejem- no se quedó solo en eso sino que matematizó su descubrimiento en su paper más famoso llamado Mathematical Theory of Communication.
Lo que hizo fue un método para medir cuanta información había contenida dentro de cualquier cosa, equiparando la información al espinudo concepto físico de la entropía (en estadística asociado al desorden o impredictibilidad), en fin esa es la base de todo: información es la parte de un mensaje que no se puede predecir.
La compresión se basa entonces en descartar todo lo predecible para hacer un comprimido, y después predecir lo que falta cuando restauramos. Parece complicado pero los principios son bien simples.
Hay dos clases de compresión: cuando se pierde calidad y cuando no se pierde. Por ejemplo si comprimimos una imagen o una película, compuesta de miles de millones de puntitos (pixeles) ni nos daremos cuenta al perder unos miles o cientos de miles, lo mismo ocurre con el sonido. Pero al comprimir un texto no podemos darnos el lujo de perder ni una coma ni un espacio, por eso se usan dos formas distintas según que estemos comprimiendo.
Para comprimir textos podemos, por ejemplo, hacer un diccionario con cada palabra que aparece en el texto, las veces que se repite y su ubicación relativa, la compresión de textos casi siempre se basa en buscar datos repetidos y hacer una especie de diccionario, colocándolos solo una vez, más la información que permita restaurar el texto. Dependiendo de cuanta repetición tenga un texto se puede comprimir a un décimo o menos de su tamaño original.
Una imagen que tenga muchos colores, graduaciones y forma irregular, casi no se puede comprimir manteniendo su calidad, lo que se hace entonces es bajar la calidad, la compresión más popular es con el método JPG que da una de las mejores relaciones de compresión/pérdida de calidad, por eso casi todas las imágenes en Internet están en ese formato.
El video es lo que da mejores resultados para comprimirse y la razón es que un video consiste en muchísimas imágenes (fotogramas) muy parecidas entre si. Imaginen que para dar la sensación de movimiento son unos 50 cuadros por segundo cada uno tiene diferencias mínimas, entonces la posibilidad de comprimir es enorme.
Una forma -por ejemplo- es tomar el primero y el último de una serie de fotogramas similares (por ejemplo una toma en una mismo lugar), se conserva el primero y el último fotograma más la información de los pixeles que cambian solamente. Los que no cambian, como por ejemplo el fondo, no se almacenan repetidos y así se reduce mucho el tamaño del archivo.
Otras formas para comprimir son bajar los matices y resolución de color, eliminar partes pequeñas, casi invisibles, etc. Si no fuera por la compresión el video digital no podría existir, por la cantidad enorme de información que genera se necesitarían discos gigantescos y sería sumamente lento. Las cámaras de video digital usan una compresión llamada DV y normalmente generan archivos en formato AVI de Microsoft, Quick Time de Apple, MPEG u otros por el estilo.
Mi querida suegra es el ejemplo más perfecto de la redundancia, cuando habla de algo que ha conversado repite todo, palabra por palabra y hasta el último detalle, sin llegar nunca al grano, se demora 20 minutos en contar algo que podría haber dicho en 30 segundos, que enfermante.
En fin, yo estoy más o menos igual, esta entrada podría haber sido mucho más corta y no se habrían perdido nada. Que diablos.