sexta-feira, 29 de janeiro de 2021

Telegram, computacionalmente, apesta. Aun así lo prefiero a Whatsapp.

 El título de este texto es un resumen de mi postura, vamos a desgranar un poco la cuestión de porqué digo que Telegram apesta.

Desde el punto de vista computacional, WhatsApp, como programa, es muy seguro. Tiene un sistema de garantía de privacidad que es de los más confiables en este momento. Esta basado en un tipo de cifrado de datos que se llama "punto a punto", o de "lado a lado". Cada conversación está cifrada en cada teléfono participante en la conversación. Una llave privada que está asociada al número telefónico, aparato y usuario es requerida para descifrar la conversación, incluyendo fotos, videos y ubicaciones. Las llaves privadas son muy complejas, no son claves escogidas por el usuario, y el algoritmo de cifrado pertenece a una serie de resultados matemáticos de cifrado sobre los cuales está demostrada su seguridad. Los algoritmos son difíciles de explicar sin meternos en teoría de números profunda, pero baste decir que las llaves ni siquiera se tienen que compartir entre los puntos de la comunicación. Las llaves de cifrado y descifrado solo tienen que "ser compatibles" en un sentido matemático, pero cada usuario tiene las suyas.  Otra cuestión a favor de WhatsApp es que la compañía no guarda las conversaciones en servidores, hasta ahora. Todo se guarda en los aparatos telefónicos, es por ello que no podemos acceder a una conversación en la compu sin "sincronizarla" con el teléfono. Estas dos maniobras hacen que WhatsApp, como aplicación, sea bastante fiable.

Pero WhatsApp como empresa no lo es y por eso el público reaccionó desfavorablemente ante los cambios del contrato. En quien no debemos de confiar es en Facebook, Inc., una empresa monstruosamente grande y con un poder totalmente desbalanceado y fuera de control (legal, ético, y cualquier otro control). En un momento vamos a eso, primero, Telegram.

Telegram, es, como empresa, una empresa privada también, gobernada por los mismos principios capitalistas de maximizar ganancias, y como App, es bastante más pobre en cuestiones de seguridad y privacidad. Empecemos por lo segundo: Telegram no usa encriptación punto a punto en las conversaciones a menos que explícitamente lo pidamos, las llamadas conversaciones secretas. Las conversaciones están cifradas en un servidor central y la llave de cifrado esta asociada al password del usuario, cosa bastante mala: es relativamente fácil robar passwords, adivinarlos o encontrarlos probando a lo güey.  Las conversaciones están almacenadas en servidores centrales, en manos de los dueños de la empresa. En principio eso nos permite acceder a nuestras conversaciones sin necesidad de sincronizar un teléfono, pero tiene obvias desventajas en seguridad. Telegram tiene otros fallos que son anunciados como virtudes: los grupos y canales no tienen límite de personas, es fácil crear bots de espam (aunque son también fácilmente destruidos), y es fácil interactuar con sistemas fuera de la aplicación. Es todo un estuche de monerías. 

Pero hay otra que nos debemos fijar: no es en la privacidad de nuestras conversaciones donde está el jugo para FB/Telegram... es en otros datos y metadatos que pueden extraer de nuestro uso de la app.  Hay una tabla rondando por Internet que muestra que datos recopilan diversos sistemas de mensajería. Aquí les pongo una versión muy extensa donde no aparece Signal, aunque aparece el mensajero de Apple a la extrema izquierda. La imagen es grande, piquenla pa' verla bien.



Telegram aparentemente no abusa de ordeñar datos de uso del usuario, WhatsApp tiene un montón de cosas ligadas aparentemente a "marketing", y el mensajero de FB... bueno, eso ni cuenta. FB nunca tuvo como enfoque la privacidad, sino "au contraire, mon ami". FB quiere que todas tus interacciones sean públicas y ordeñables por empresas de marketing. El pancho aquí es que Fb es dueña de WhatsApp desde el 2014. 

El mayor ordeñamiento de datos de WhatsApp está en la interacción con cuentas de negocios (no en tenerlas, en interactuar con ellas). Ahí se recopilan datos de información financiera y hábitos de gastos, contactos, y el famoso "otros datos del contacto", que nunca es nada claro. Uno de los avisos del cambio de contrato de este año fue que avisaron que las cuentas de negocio pueden ser almacenadas en servidores privados de los negocios... y estudiadas y ordeñadas a su vez, pues estás por default no están encriptadas. Por cierto, nada de esto es oculto: está en el contrato. WhatsApp/Fb nos garantizan que esto se hace con respeto a los usuarios y que es para "mejorar la interacción con las app y con los diversos productos de FB". A estas alturas del partido (empezó en el 2007, eh) ya sabemos que no es para nada el interés del usuario lo que gana con el ordeñamiento de datos. Fb ha estado involucrado en escándalos monstruosos de extracción no ética de datos, y de permitirles a terceros explotar esos datos con fines no sólo de lucro, sino de tomas de poder políticas (Cambridge Analítica, cof cof). Creer que Fb integrará algunas funciones de WA en Fb para "mayor comodidad del usuario", o "mejor experiencia de uso" es un poco inocente en estos momentos. Además, dicha cuestión pone en duda el cifrado punto a punto. Los mensajes de Fb no están cifrados,  y están en servidores centrales así que ¿como van a unir los sistemas? Al final parecen haber reculado mucho de estos cambios, y se la han pasado mandado avisos y entrevistas sobre como nuestras conversaciones están seguras. Buen punto, de acuerdo. Pero Fb, como empresa, no es confiable ya. Cada vez que han tenido un escándalo de "fuga" de datos, hacen la misma rutina. Mark Zuckerberg pide disculpas mecánicamente, dice que no volverá a pasar, y que nuestra privacidad es muy importante para Fb. Hacen alguna correcciones, cierran algunas puertas explotables... y cambian políticas para extraer más info de sus usuarios y hacerlos más y más dependientes de la plataforma. La gran jugada es ahora convertir a WhatsApp en un medio de pago. Muy conveniente ...¡para ellos! Darle además ahora control financiero a Fb es,  a mi parecer, una idea terrible. Citando a Molotov, "si le das más poder al poder, mas duro te van a venir a joder".

¿Como está Telegram FZ LLC (la empresa que controla la app) en  estas cuestiones? Pues... dado todos los fallos de seguridad que tiene, está sorprendentemente bien. Para ello hay que entender que los hermanitos Durov, y Axel Neff, son personas muy diferentes de Mark Zuckerber: tienen una ideología y una ética. No estoy de acuerdo con ellos (son libertarios) pero claramente tienen principios. Cuando a Pavel Durov las agencias de seguridad rusas le pidieron los datos de los protestantes en Ucrania, en el 2014, se negó y defendió legalmente su postura frente a los gobiernos ruso y ucraniano. En aquel entonces la empresa era otra, se llamaba VK. Finalmente VK fue adquirida por aliados de Putin, Durov fue obligado a renunciar y vender su parte, y finalmente, orillado a abandonar Rusia.  La biografía de los tres jefes de Telegram muestra que están mucho más dispuestos a aliarse con sus usuarios que con los anunciantes y  otras formas de ingreso que pululan en Telegram. Por otra parte, la historia de la app muestra hasta ahora tres "escandalos de seguridad", uno en 2016 y dos en 2020. Todos están vinculados al gobierno de Iran. Telegram ha hecho todo lo posible por cerrar esas vías de ataque, protegiendo, no a los inversionistas, sino a disidentes políticos en Iran. 

Así que... como sistema de seguridad computacional, Telegram apesta, y WA es muy bueno... hasta ahora. Como empresa, Fb es absolutamente indigna de mi confianza, y Telegram, hasta ahora  se ha comportado con decencia. 

 

 

Para cerrar hablaré un poco de otras plataformas. El mensajero de Apple es bastante fiable, y aunque Apple como empresa me caiga muuuuy mal, nunca ha cedido a la presión del gobierno gringo de abrir puertas de entrada traseras en sus sistemas. Son bastante conscientes de que eso minaría uno de su puntos de venta más fuerte... y sería una pesadilla para sus desarrolladores, que se les pagan millones de dolares por cerrar vias de ataque, no por abrirlas. 

Finalmente Signal: Signal es lo mejor de WhatsApp sin Fb o Mark Zuckerberg. Es, en este momento, absolutamente la mejor opción. Cifrado lado a lado, no hay copias de las pláticas en servidores centrales, integración con SMS tradicional, código abierto... ¿Código abierto es seguro?. Si, claro. A diferencia el código cerrado, en código abierto todos los programadores del  mundo pueden examinar tu programa. Quienquiera pueda hackear, crackear, violar, cualquier puerta de seguridad... y por ende es mucho más rápido encontrar las fallas. La misma exposición a los ojos y teclados del mundo entero te hace fuerte. Lo que hace que un cifrado sea bueno no es que sea secreto, au contraire, mon amí:Es que todo mundo sepa como funciona y que la teoría matemática que lo soporta esté bien demostrada. Después de eso solo es generar claves de cifrado y no compartirlas. 

Yo estaré usando Telegram mientras no tenga suficientes amigos que usen Signal. Dado que una app de mensajería requiere también una comunidad, me gustaría que más gente probara ambas opciones, pero Telegram ya es muy popular y no necesita mi apoyo tanto.


PostData:

Enviando videos por Telegram descubrí otra característica que revela que algo de lo que nos dicen en WhatsApp no es completamente cierto. En Telegram los videos y fotos se envian "como son", y llegan "como son", no son recodificados (reencoded) a formatos más ligeros y de menor calidad. En WhatsApp las fotos y los videos llegan con calidad disminuida siempre, aunque no tanto como para que sea molesto. Mucha gente ve en eso una virtud, dado que que en Telegram las imagenes y video resultan muy pesados y lentos de descargar. Pero hay algo raro: cambiarle la codificación a un video es una tarea computacionalmente intensiva, que requiere mucho poder de CPU... y eso no ocurre en el teléfono. Aparentemente eso ocurre en los servidores que redirigen los mensajes a los usuarios. Ahora bien, WhatsApp asegura que no mantienen una copia y si el emisor borra el video/foto, ya no está disponible para los demás. Creamosle eso. Sin embargo, aunque no mantengan una copia, si saben que mandaste video o fotos. Entonces, al menos, esa info de tu conversación si la pueden detectar. 






quinta-feira, 21 de janeiro de 2021

Porque yo voy a dejar de usar Whatsapp.

 Este Enero del segundo año del Covid19, Whatsapp "actualizó" (es decir, modificó unilateralmente) sus términos de uso y condiciones. La reacción de muchos usuarios no fue positiva, y varios empezarón a instalar aplicaciones de mensajería diferentes, principalmente Telegram y Signal.

Mucha gente decidió probar las alternativas por la noción de que Whatsapp/Facebook estaba espiando las conversaciones, o otras formas de espionaje. Esta noción es errada, o al menos muy imprecisa, y por lo tanto se refuta fácilmente por aquellos que creen que prefieren continuar usando Whatsapp o que trabajan en Whatsapp. Es notorio que muchas veces los usuarios son mejores defensores de la aplicación que la compañía misma. 

 Aclaremos como funciona el sistema de encriptación de conversaciones de Whatsapp.  La aplicación cifra las pláticas entre dos usuarios de forma que las llaves para desencriptarlas y poder leerlas están en los teléfonos mismos involucrados en una conversación. Las conversaciones, asimismo, están guardadas únicamente en los teléfonos involucrados. Esto se llama cifrado de lado a lado, o más coloquialmente, de cabo a rabo.  Es por eso que para usar Whatsapp web tienes que tener el telefono activado y conectado a internet: el aparato de mano envía la conversación a la compu a traves del Internet, y si esté se desactiva no hay manera de acceder a la conversación. Estamos partiendo de que lo que nos dice la compañia es cierto, por supuesto, y que ellos no tienen copia de las conversaciones ni de las llaves de cifrado. Yo estoy bastante convencido de que es cierto, dado que esto forma un protocolo de seguridad bastante confiable y hasta ahora no hemos visto mayores escándalos de fuga de datos de Whatsapp, a diferencia de otras plataformas. Además, Whatsapp fue desarrollada fuera de Facebook, por personas muy interesadas en este tipo de mensajería segura, y cambiar el protocolo después de la compra por parte de Fb hubiera sido difícil y básicamente tirar a la basura su compra. El éxito de Whatsapp era precisamente porque era una forma segura y barata de mandar mensajes, sin depender mucho de servidores centrales. Así que dudo mucho que Fb esté espiando las conversaciones directamente. El interés por encontrar un fallo de seguridad es muy alto, no es como que no haya incentivos para lograrlo. 

Dicen varios críticos de la migración, "¿tu crees que a Whatsapp le interesan tus conversaciones pendejas y tus memes y fotos de chichis? Tal vez si fueras famoso pero no la mayoría no lo somos, no les interesa lo que ponemos." Esta afirmación es equivocar el punto totalmente. Efectivamente no les interesa nuestra conversación exacta, ni aunque fueramos famosos o importantes nivel Carlos Slim o Presidente del Bank of America. Su negocio no es chantajear como si fueran mafiosillos de tercera. ¿ O alguién cree que le habla Mark Zuckenberg a Angela Merkel diciendo que va a soltar su plática erótica con Putin si no le da... no se... un billon de euros? El poder de la recopilación de datos no funciona así. Además, dado que la compañia de la que estamos hablando es Facebook, que  básicamente funciona publicando nuestros actos privados o semi privados, ¿porqué tendrían que espiar nuestras conversaciones, si tenemos cuentas en Fb e Instagram? Usar estos servicios es básicamente decidir ( espero que como ente consciente ) en renunciar a tu privacidad, al menos en cierto grado. Por cierto, el chat de fb y su aplicación movil no usan cifrado de cabo a rabo. No es que Zuckenberg necesite realmente revisar nuestras pláticas en Whatsapp pa saber de que hablamos. Ese no es lo que me molestó a mi y a muchos otros. Pero incluso en esto no podemos confiar que respeten, como veremos más adelante.

 La forma en que Whatsapp recopila datos de los usuarios es sutil, tecnologicamente compleja, y muy dependiente de grandes números de uso. El cambio que hicieron era el siguiente. Originalmente uno podía negarle a Whatsapp compartir cierta información con Fb. El nuevo contrato especificaba que eso ya no iba a ser posible, y que se iban a compartir:

  • La información del registro, incluyendo el número de teléfono
  • Información sobre el aparato telefónico
  • Dirección IP
  • Las conversaciones ya NO iban a estar encriptadas por default. Un caso de "tulle tu propio producto".
  • Cito lo siguiente (la traducción es mía) : "Algunos negocios podrán usar la compañía madre de whatsapp, Fb, para guardar mensajes y responder a clientes. Si bien Fb no podrá acceder a esos mensajes, los mensajes podrán ser usados por dichos negocios para propósitos de marketing". 
  • Información sobre como interactúas con otros, incluyendo negocios.

Lo más  gracioso, creo yo, es el punto que resalté en negritas. La conversaciones se van a comenzar a guardar en servidores de Fb en los USA, con el propósito de "integrar mejor los servicios", es decir, poderles vender más servicios a otros negocios. Hago notar que estos cambios no aplican en Europa: resulta que las leyes anti monopolio de Europa le impiden a Fb "integrar eficientemente" sus servicios usando estos métodos. Considérese esto. 

Whatsapp no quiere  espiar específicamente a mí o a tí o a Angela Merkel. Pero con acceso integrado a muchas cuentas de usuarios, puede obtener patrones definidos de acción, y eso es lo que le interesa. Además, lo hace con mucha alevosía, dado que sabe que la gente es comodina y prefiere "lo fácil" y "conveniente" a hacer un acto de resistencia mínimo, o que simplemente ignoran otras opciones. 

 Una razón más para resistirme a estos cambios de contrato es que Fb ya tiene muchísimo poder, ¿porqué habría yo de asistirlo voluntariamente en tener más? No es una entidad que haya demostrado usarlo responsablemente hasta ahora... más bien al contrario, si recordamos los abusos emocionales en los que está basada la adicción al Fb, el escándalo con Cambridge Analítica, o con los Peña Bots aquí en México, etc etc.

Whatsapp/Facebook no respetan a sus usuarios, en la misma forma en que una compañia minera no respeta las vetas mineras: las explota. Los usuarios de Whatsapp son material crudo que Fb usa para ganar mas poder. A estos niveles, ya no es dinero lo que buscan: es poder en el sentido más maligno del término. Fb ya cuenta con el poder de cambiar régimenes de gobierno y lo ejerce.  Sin embargo eso no quiere decir que no tengamos nosotros un poder frente a Fb.Ni siquiera mucha gente ha desinstalado el programa y ya sintieron un pequeño desajuste de sus cuentas. La mera descarga e instalación de Telegram y Signal en este mes asustó a Zuckenberg y Cia: sus acciones bajaron de valor  y recularon en sus términos de contrato, mandando mensajes de conciliación muy ridículos por medio del mismo Whatsapp. También publicaron un enorme FAQ insistiendo mucho en que no tenía acceso a las conversaciones que estuvieran previamente cifradas, incluso resaltando que usaban el mismo cifrado que Signal. Pero la extracción de datos puede ser mucho más sutil que leer mensajes o buscar patrones de movilidad. La forma en que whatsapp está tratando de convencencernos de que nos respeta es confusa. ¿Qué van entonces a "integrar" a las "otras compañías de Fb"?

No me cuesta nada usar aplicaciones de mensajería alternativas, y en otro texto discutiré sobre sus ventajas o desventajas. Baste ahora mencionar que Telegram es peor aplicación desde el punto de vista de privacidad computacional. Sin embargo yo lo uso ya desde hace tiempo y lo seguiré usando. ¿La razón más fuerte para mí? Que no es Fb. Dado que esta cosa es un monopolio de la conversación en Internet, cualquier mella que le podamos hacer cuenta. Los monopolios son malignos por su misma configuración: no les interesa evolucionar sino preservarse a toda costa. ¿No recuerdan el desesperado intento de Google y FB de aplastar a Zoom al inicio de la pandemia? Zoom ofrecía un servicio ligeramente diferente a Google Hangouts y llamadas de Facebook. Bueno, este par de monstruos no pudieron tolerar que alguien nuevo llegara a lo que ellos creen que es su rancho. Ni siquiera competía con ellos, pero hicieron todo lo posible por aplastar a Zoom desde una postura encumbrada, ofreciendo copias del servicio de Zoom. Eso es absolutamente deplorable. 

Fb insiste en ser el único regulador de la conversación por internet. Ha tenido mucho éxito hasta ahora, y no por las mejores razones. No necesita mi sometimiento, alias, uso. 




 

sexta-feira, 12 de junho de 2020

La función exponencial y el nCovid19, parte 5

En la última entrada de este blog comencé por hablar del fenómeno de "entumecimiento estadístico", el problema de que cuando empezamos a hablar de desgracias que le ocurren a grandes números de personas, perdemos la empatía con ellos, dado que dejamos de poder concebir a cada individuo que conforma los miles, las decenas de miles, los millones. Urgía yo en ese párrafo a usar las herramientas que las Matemáticas y la Estadística nos confieren justo para aprehender, cachar, agarrarle el pedo a esas cifras, a entender los fenómenos en sus magnitudes reales, a sentir lo grande con su peso justo sin perder el sentido de la tragedia humana conformada por masas enormes. En mi caso particular, en parte por entrenamiento y tal vez por naturaleza, no sufro de este entumecimiento de insensibilidad a los grandes números, sino justo lo opuesto: las estadísticas de las desgracias me apabullan con su tristeza y su dolor, y justo empiezo a rehuir de los datos por ello. Es por eso que he pausado un poco las entregas de esta serie. La causa externa que dispara esa sensación es lo que voy a discutir en esta entrada. 

A pesar de que creo que la sociedad mexicana no ha sido particularmente irresponsable en su manejo de la pandemia, tampoco ha sido ejemplar, y las siguientes gráficas lo van a mostrar. Es falso que se aplanó la curva cuando Lopez Gatell lo dijo. Aunque si es una curva que ha ralentizado su crecimiento, especialmente al principio, y nos salvamos de tener un ritmo de duplicación super acelerado como el de EUA (véase la tercera parte de esta serie), desde entonces no ha cambiado mucho la situación. El comportamiento sigue pareciendo exponencial, aunque con un ritmo lento, y la tasa de mortandad es particularmente alta. En las últimas tres semanas México ha estado en el primer lugar de muertos diarios con cifras que casi duplican a quien sea que esté en segundo lugar. Esto no sería tan grave si dichos números se mantuvieran en las decenas, pero estamos hablando de números que se acercan a los mil muertos diarios, cifras que rebasan con creces las adjudicadas a la violencia criminal, la otra gran tragedia mexicana, unos aproximadamente 90 diarios, con una regularidad monstruosa y predecible.

Comencemos por una gráfica normal comparativa.
Esta vez elegí a Brasil como comparador. A cada país le pondremos su número de casos confirmados y su número de decesos oficial. En la primera gráfica pondremos a EUA para establecer un punto.




Lo primero que sucede con la gráfica anterior es que EUA está tan fuera de la escala que impide ver que está pasando con los otros países. Así que vamos a dejarlos fuera del rango y dibujar hasta donde los casos de Brasil llegan.



Ahora es el caso de Brasil el que aplasta la gráfica. Para evitar esto podemos volver a la representación semilogarítmica, donde los números que son 10 o 100 veces más grandes están desplazados uno o dos renglones hacia arriba. Pero antes de hacer eso notemos en la gráfica anterior algo: la curva que describe Brasil es semejante a lo que se alcanza a ver de EUA, ligeramente menos empinada. Hagamos un último acercamiento en escala normal poniendo los casos totales confirmados en México como medida de la escala.


En esta gráfica podemos sospechar que el crecimiento de casos tanto en Brasil como en México sigue siendo exponencial. Los Muertos en EUA ya parecen comportarse de otra forma, presumiblemente lineal o tal vez aun más lento. La pareja de curvas de Brasil (total casos y muertos) y la de México parecen tener un comportamiento análogo, abriéndose en algo que parece ser una diferencia de un factor. Sin embargo nada de esto es apreciable en el papel normal. Pasemos a las representaciones semilogarítmicas otra vez y veamos que nos revelan.

La gráfica esta un poco densa de información, pero podemos ver algunas cosas. La curva de EUA parece haberse aplanado tanto que ya no podemos decir a ojo si es exponencial muy lenta o es lineal muy rápida (recordemos que se mueve en números muy altos). Viendo la primera gráfica sabemos que es lineal... muy crecida ya. Siguen estando en problemas serios. Su número de muertos en cambio parece aun más plano, después de haber explotado de forma similar a los contagios. Esto puede ser un buen dato: tal vez están pudiendo reducir la mortandad. Los casos totales de Brasil siguen indiscutiblemente una recta empinada en el papel semilog, por lo tanto, son exponenciales y tienen un ritmo de duplicación rrápido. Malas noticias. Los muertos brasileños parecen ir aplanando mejor la curva, al irse empinado cada vez menos, pero es muy sutil como para cantar alabanzas.
El caso de México tiene una curiosidad. Tristemente no veo que haya cambiado mucho la curva desde el articulete anterior, sigue pareciendo una exponencial, y no mucho más lenta que la de Brasil, aunque si más abajo. Recordemos que eso no es necesariamente buena noticia: es muy aparente que México, con su bajísima cantidad de pruebas realizadas, sólo está reportando los casos más obvios, ya sea por síntomas graves o porque son gente cercana a otros ya contagiados (médicos, principalmente, y viajeros en segundo lugar).
Pero hay algo aun más curioso. Veamos si lo notan en una gráfica mucho más simple. Para hacerlo patente voy a hacer una representación muy minimalista: sin ejes, ni escalas. Sólo aquello que me gustaría que vieran.

¿Lo ven? Lo voy a hacer un poco más evidente.

Moví los puntos de la curva de fallecidos, 10 días a la izquierda, y la multipliqué por 6, que en escala semilog equivale a desplazarla hacia arriba un poco. ¿Ven lo que quiero decir? La curva de muerte empalma bastante bien con la de contagio. Tan bien que podemos estar seguros de algo: de cada 7 personas que México cuenta como enfermos confirmados uno se muere, diez días después. Esta es una aproximación muy gruesa, sin embargo le pega a los números bastante bien.
México esta teniendo un ritmo casí perfecto de duplicación de casos, y un ritmo casí igual de duplicación de muertos. Tenemos una tasa de mortandad prácticamente constante y aparentemente de las más elevadas del Mundo. Esto último puede no ser tan grave por la misma razón que nuestra curva de casos está baja: México sólo está contando una fracción muy muy baja de los enfermos, y, optimitamente insisto: los muertos son mucho más difíciles de ocultar. Puede que tengamos tres veces más muertos, pero es casi seguro que tenemos al menos 20 veces más casos. Algunos estimados dicen que hasta 30. Lo que creo que es más relevante de esta gráfica son dos cosas: México esta haciendo un muestreo que es consistente con lo que cabría esperar de un fenómeno natural, así que los datos no parecen estar trucados, por un lado. Por otro lado, no parece estar disminuyendo la proporción de muertes respecto a los enfermos graves. Es tan bueno el ajuste, que parece ser que no ha cambiado el éxito de los tratamientos en lo más mínimo desde que comenzó esta pandemia. Esta es probablemente la parte más fea de este análisis.

Sólo para cerrar, hagamos un poco de ajuste numérico a los datos de Brasil y México, esperando desengañarnos en algo.

Okey, vemos que el ojímetro no es tan malo pero tampoco tan bueno. Aquí están las mejores curvas exponenciales (que se ven rectas en papel semilog) que pude ajustar. Hay cierta consistencia en que todos los números son mas o menos parecidos. México parece haber mejorado ligeramente en las últimas semanas, su periodo de duplicación de casos es de 12 y medio días, aun contando los datos anteriores. Se ralentizó de 9.4 a 12.5. Eso si ya empieza a parece que se está aplando la curva, pero muy lento. La mortandad va ligeramente más lenta, así que tal vez si indica un progreso (si fuera sólo una fracción del total tendrían el mismo ritmo de crecimiento). Aun así la diferencia no es tanta como para celebrar. Brasil está teniendo un crecimiento más rápido, y un ritmo de mortandad aparentemente significativamente más lento. Tomando los datos de buena fe ( me cuesta trabajo con Bolsonaro, pero la verdad no es él el que está dictando como se hace ), puede ser que al estar aumentando el ritmo de pruebas, el número de casos crezca más aceleradamente que el de muertos, porque es más difícil contar mal los muertos. Es decir, el número que indican ya es bastante buen muestreo. Sin embargo hay un elemento que me hace dudar un poco de esta esperanza: los datos más elevados de contagios están en el Norte de Brasil, una zona extremadamente más pobre que el Sur y mucho más rural, o inclusive selvática. Es mucho más fácil ahí perder la estadística de los muertos. Realmente no sabemos que esté pasando en las comunidades indígenas semi aisladas del Brasil. O en las de México tampoco.

Por otra parte, parece ser que si hemos tenido suerte. Hace meses, al empezar, señale un estudio de China en donde parecía que la sangre O está menos afectada por los sintomas más graves, mientras que la A parece ser la más afectada. Al estudio nadie le hizo mucho caso hasta que hace poco lo replicaron en un estudio más amplio en Europa. Si les molesta el tufo a Eurocentrísmo no son los únicos, pero los estudios médicos requieren mucho más replicaciones que otros, asi que es buena idea hacerlos. Puede que los Mexicanos no seamos tan gueyes para cuidarnos, pero también puede que nos haya ayudado la genética un poco.

Aun seguimos metidos en esto hasta el cuello. México no logra disminuir efectivamente el ritmo de contagio y la presión económica y social por terminar el confinamiento es grande. Sin una cura a la vista, esto podría llevar a una mortandad sin precedentes. Seamos prudentes con las decisiones que hacemos como colectivo. Sin ánimo patriotero, el lema debe ser en este momento, "¡qué viva México!". La manufactura industrial y los trabajos de oficina pueden esperar. La Muerte es irreversible.



sexta-feira, 22 de maio de 2020

La función exponencial y el nCovid19, parte 4.

Un aforismo, atribuido a Stalin, reza así: " Un Muerto es una desgracia, un millón de muertos es una estadística". Podemos entender que quiere decir fácilmente. Nuestro cerebro humano puede empatizar con la desgracia individual o de pocos números, podemos imaginarnos claramente a una persona sufriendo, o a dos, o a cinco, pero no a diez mil. Nuestra percepción empática se vuelve borrosa, no estamos naturalmente preparados para lidiar con esos números.
Aunese a esto que la Estadística, como disciplina, tiene una fama de frialdad y utilitarismo, especialmente al servicio de los poderosos ( del Estado, de ahí su nombre) y pues nos hace ver que la sentencia dice que básicamente muchísimos muertos no logran generar la misma empatía ( y resistencia ) que unos pocos.

Yo creo que es justo la Estadística la que nos puede salvar: tal vez nuestro cerebro no cuenta naturalmente con mecanismos de comprensión de los grandes números, pero puede ser entrenado. La Estadística es un gran programa de entrenamiento. Cuenta con excelentes herramientas que nos ayudan a aprehender esos números en nuestra conciencia; si interiorizamos, tanto analíticamente como empáticamente, su significado. Media, mediana, desviación estándar, moda, cuantil, etcétera, significan grupos de fenómenos concretos, personas, situaciones, actos heroicos y desgracias.

Un millón de muertos es una estadística. También es un millón de desgracias. Y también es una desgracia de otra categoría, ya que significa un fenómeno avasallador detrás de cada una de las muertes.

Quiero que al leer esto tengas presente que cada uno de los puntos en esta gráfica representa una cantidad grande de personas que murieron por este virus. Debemos tratar estos datos con respeto, aunque nuestros análisis no sean profesionales o profundos. Te encomiendo a sentir que quiere decir una expresión engañosamente descriptiva como "periodo duplicación del número de muertos".

Comencemos pues, el análisis gráfico. Una vez más, empecemos por una simple inspección visual general de los datos. Todos los datos provienen de la Wikipedia en sus artículos en ingles sobre la epidemia en cada país.


Aquí están los datos que quiero comparar en escala convencional. Esto es el número de muertos por nCovid19 confirmados oficialmente por EUA, México, Italia y Rusia. Escogí dos casos muy escandalosos pero diferentes: el caso de Italia, que fue el primer país donde la mortandad llegó decenas de miles, y el de Estados Unidos, que básicamente ya rebasó en muertos estadounidenses a la Guerra de Vietnam. Los dos muestran comportamiento muy disimilar, como vemos por las curvas. Rusia está aquí porque se parece en comportamiento mucho a México... y no sabemos porqué.

Se que el número reportado de muertos es controversial, pero podemos tomar eso en cuenta. Se estima que México esta contando sólo una tercera parte de sus muertos por esta enfermedad. Hay países que usan criterios muy rigurosos, y sólo reportan aquellos casos que tuvieron prueba positiva antes de morir, confirmado, y que murieron en tratamiento intensivo. Hay países donde muchos quedan como "neumonía atípica". Hay países que son menos rigurosos y permiten que los familiares no los reporten como nCovid19, pues esto evita que los familiares se puedan acercar a su Ser Querido en sus últimos momentos de vida, e incluso en sus primeras horas de muerto. México es una ensalada de todos estos casos. Aun así, se estima México podría tener "solamente" tres veces más de muertos por coronavirus. Digo solamente porque en realidad este factor es pequeño: no indicaría una clara malignidad en el manejo de los datos, sino un escasez en el muestreo manejable, si se quiere manejar, por supuesto. Es difícil pensar que tenemos diez veces más muertos, habría fenómenos visibles en las calles cotidianamente: abarrotamiento de casas funerarias por ejemplo. Esto se empezó a ver apenas hace unos dias, sin embargo el New York Times estaba acusando  a México de un mal manejo de muertos oficiales desde hace tiempo. Debemos de entender muy bien cual es la diferencia entre muertos confirmados y muertos totales. Nadie sabe el número de muertos totales aún. Los muertos confirmados nos dan un estimador. Lo único que podemos estar seguro es que todos los países tienen más muertos que los reportados. Nadie está "inflando" los números de muertos. En todo caso está ocurriendo lo contrario. Acaban de cachar a dos estados gringos (Georgia y Florida) manipulando sus datos para que parezca que tienen la situación bajo control y se les permita reabrir el comercio e industria. Hijos de tigre, pintitos.

Retomemos la gráfica: podemos ver que EUA y México tienen comportamientos que emulan los números de contagios totales que mostré en los artículetes anteriores. Esto es esperado: el número de muertos debe ser aproximadamente proporcional al número de casos, y por lo tanto la curva debe ser aproximadamente una sombra pequeña de la curva de casos confirmados. Esto mientras no ocurra un agravante, como que colapse el sistema sanitario. En ese caso el número de muertos iría aumentando en tasas continuamente crecientes y no  a la esperada por la tasa de mortandad. O también podría ser que cada vez encontráramos mejores tratamientos. En ese caso la curva también dejaría de seguir la curva de contagios confirmados y se haría cada vez más pequeña. Pero ninguna de las dos cosas parece estar pasando en EUA y México. EUA muestra los dos comportamientos lineales unidos por un codo, y México está con su crecimiento lento.  También estas curvas deben de mostrar un retraso de unos días en su comportamiento cualitativo respecto a las anteriores. Los enfermos tardan en morir. Los más rápidos, entre su detección y su fallecimiento, un par de días. Otros, un par de semanas. La curva debe estar desplazada a la derecha mas o menos por el promedio de ese efecto. 

La curva de Italia después del periodo de crecimiento rápido, muestra un comportamiento aun menor que el lineal. Cada vez que tratamos de ajustar una recta para ver que tan empinado están los puntos, los siguientes puntos quedan por debajo. Esto quiere decir que cada vez es menos empinada, y por lo tanto esta creciendo a una tasa menor que la lineal. Esto es una excelente señal. A esto si le podemos llamar "aplanar la curva": empieza a parecer justamente una recta plana. El caso de EUA es grave: incluso habiendose terminado el crecimiento exponencial, no se ve que despúes de ello la curva se aplane: continua estando en el ritmo de sus últimos momentos de crecimiento exponencial. Las curvas de Rusia y México son tan pequeñas que no se aprecia bien el tipo de crecimiento, pero a ojo de buen cubero parecen ser exponenciales que andan en un ritmo muy bajo, o que empezaron después. Para confirmarlo vayamos al plano semilogarítmico.



Helo ahí. Esta vez coloqué las lineas horizontales en una doble secuencia. Primero, 2,4,6,8 y 10 (no se porqué falta la etiqueta del 10 y sus potencias). Luego multipliqué esta secuencia por diez y puse en esos los siguientes renglones, y continué de esa forma. Los renglones están separados equidistantemente por múltiplos, pero aquellos que difieren en un valor que se suma se van acumulando. Por ejemplo, 6, 60, y 600, 6000 y 60000 están separados por la misma distancia entre ellos. La distancia que hay entre 6 y 8 es la misma que entre 60 y 80 y la misma que hay entre 600 y 800. El papel logarítmico que se vendía antes en las papelerías se veía así. Ayuda a visualizar las cantidades cuando uno se acostumbra a su interpretación. 

Mencioné arriba que el número real de fallecidos podía ser unas tres veces superior al confirmado. Esto no cambiará mucho el análisis mostrado. Esto es porque un factor constante sólo desplaza la curva en el plano logarítmico hacia arriba o hacia abajo. Eso se puede ver en las rectas horizontales que marqué. Multiplicar todo por diez sube la gráfica al siguiente bloque de renglones. Pero lo empinado de los puntos sigue siendo el mismo. Una vez más, insisto, eso no quiere decir que no sea grave que estén muertos tres, cuatro o 10 veces más personas que las reportadas. Es un hecho que hay más muertos que los reportados. Pero esto no cambia la tasa de duplicación, si el muestreo es consistente. Y dado que es muy difícil "cucharear" una curva exponencial de forma creíble, asumo que los datos reportados forman un submuestreo honesto, pero un submuestreo de cualquier forma. Para convencencernos de ello hagamos una gráfica mostrando los muertos confirmados de México, una versión multiplicada por tres y una por diez. Dejemos los datos de EUA como referencia. 

En el peor estimado posible la curva casí alcanza la oficial de EUA, y es más empinada ahora de lo que está está en este momento. Eso es un estimado gravemente pesimista, pero no fuera de la realidad del todo. Aun así, podemos estar seguros de algo: si la curva de México está más empinada que la de EUA y no se corrige, más pronto que después la rebasará, no importando que tan abajo comience. Ahora bien, regresemos al gráfico de datos oficiales de cuatro paises, pero agregemosle esta vez las lineas de ajuste a los invervalos que dan la aparienca de rectas ( ¡en el papel semilog! ):



Aquí están las "curvas" ( en el sentido general son curvas ) que representan funciones exponenciales. A cada una la acompañe de un número que indica el periodo de duplicación en días. Un número menor implica mayor velocidad en la acumulación de muertos, y es por lo tanto un indicador de algo muy malo. El peor caso es el de Italia, que durante el final de febrero y la primera mitad de marzo duplicó cada dos y medio días su cantidad de fallecidos. Eso fue lo que escandalizó al mundo. Sin embargo y después de un periodo de aproximadamente un mes de "doblarle el codo" a la curva, podemos ver que la gráfica empieza a parecer plana. Helo ahí, el habladísimo "aplanamiento de la curva". Tienen razón para salir a celebrar con un espresso, aunque el riesgo del rebote sigue siendo real. El caso de EUA se ve similar, pero su codo aun sigue mámás empinado. Su crecimiento es lineal ( y se ve como una recta en papel convencional) pero muy empinado aun. Su periodo de crecimiento exponencial parece haber durado lo mismo que en Italia, y ligeramente menos empinado, pero comenzó a duplicar un número más grande de muertos inicialmente: 60 en lugar de 10. Esa fue la famosa reacción tardía de EUA: durante la segunda mitad de marzo no hubo ninguna muestra de ralentización del fenómeno. 


México y Rusia parecen sólo haber cambiado una exponencial terrorífica por una ligeramente menos terrorífica. Si bien es cierto que aparentemente tuvimos siempre un ritmo de crecimiento más lento, 3.3 días no es tan diferente de 2.7. Aunque tener una tasa de duplicación de 9.4 días en el caso de México ya suena a un aliviane, no hay un "codo" en la curva claro como en EUA o Italia. Si se mantiene el rítmo así, podemos tener para finales de Mayo 12'000 muertos confirmados, para finales de Junio 96'000, y eso ya es otra categoría de desgracia. ¿Ha funcionado la estrategia de México? No lo sabemos certeramente. Claramente desde que inició la campaña de "Quedate en Casa" y "Susana Distancia", los periodos de duplicación aumentaron. Pero no parece haber detenídose el crecimiento exponencial. ¿No mencioné que esta curva está atrasada con respecto a los contagios? 
Así es. En el próximo artículete compararemos muertos y casos confirmados y veremos donde estamos.

Aclaración:


Hay rectas ( que representan funciones exponenciales, recuérdese) ajustadas a intervalos de puntos. También aquí hay una diferencia con los ajustes que hice en los artículos anteriores y me gustaría explicarla. Hay principalmente dos formas de ajustar una exponencial ( o cualquier otra función ) a una serie de datos. Una es tomar en cuenta los errores absolutos de los datos, y otra es tomarlos relativos. A la primera forma se le conoce como aditiva, y a la segunda multiplicativa. Pongamos un ejemplo. Supongamos que tenemos dos datos, digamos, 10 muertos en un lunes, y otro dato son 100 muertos el domingo. Si la curva de la función pasa a 1 muerto del primer día y a un muerto del segundo día, y usamos el criterio aditivo, contamos esos dos errores al ajustar la curva por igual. Si usáramos el criterio multiplicativo, el error del primer punto y del segundo serían diferentes. El primero sería un error de 0.1 del total, ( el 10%), mientras que el segundo sería del 0.01 ( el 1%). Entonces para ajustar la curva tomamos en cuenta esos errores relativos y tratamos de minimizar esa cantidad sumada. Esto tiene el efecto de que "a ojo" la curva así ajustada se ve mejor en el papel semilog, mientras que en el papel normal parece desviarse mucho de los datos pequeños. El otro criterio se ve mejor en el papel normal, pero peor en el semilog. 

¿Porqué preferíriamos ver la función mejor en el papel "alterado"? A fin de cuentas la realidad indica que los muertos son muertos, ¿no? Está raro ajustar la curva al "logarítmo de los muertos", ¿no? Cada muerto cuenta igual, ¿no? Algo así fue lo que me pasó cuando hice los ajustes anteriores. También probé los otros, y para el caso de México no cambiaba mucho la tasa de duplicación (que era lo que me importaba) así que ya no cambié de criterio. Sin embargo en este tipo de ejercicio es mejor usar el ajuste multiplicativo. Es una de esas cosas donde la estadística nos ayuda a abrazar conceptos que nuestra intuición cotidiana puede confundir. No se trata de minimizar el muerto extra porque ya hay cien, y darle más importancia a los que ocurren cuando hay pocos casos. Se trata de darle la misma importancia al ritmo de crecimiento a lo largo de todo el ajuste. Dado que ese es el número que más nos preocupa, tenemos que ver una esperanza ( aunque sea duro de ver ) en el hecho de que si tienes veinte casos fatales nuevos cuando tienes 20'000 acumulados, vas mucho mejor que si tienes 10 casos fatales cuando tienes 1000 acumulados. 

 PD:


Por cierto, llamarle aplanarse la curva  a esto empieza a hacer parecer a Hugo Lopez Gatell como una rutina de Monty Python, y no es lo mejor para la situación del país. No somos una sociedad que confie en sus autoridades. Más les vale hacer su trabajo de forma más cuidadosa. Los que votamos por ellos también tenemos que mantenerlos bajo el ojo crítico.


sábado, 9 de maio de 2020

El nCovid19 y la Función Exponencial, parte 3.

En esta tercera parte de la función exponencial y la pandemia actual hablaré de un caso muy caótico y desordenado. Analizaremos lo que es, hasta el momento y segun las cifras oficiales, el país más golpeado por el coronavirus. Estamos hablando, por supuesto, de los Good Old USA. 
(Para repasar y ver ejemplos de la función exponencial, aquí esta la primera parte, y la segunda parte habla del caso de México hasta el 5 de mayo, donde hecho una pequeña pedradita al ídolo del momento, Lopez Gatell, por usar laxamente la expresión "aplanar la curva".)

Como siempre, empecemos por lo visual: una gráfica que muestre el avance de casos confirmados en EUA. Se ve así:



 Esto no es una función exponencial. Parece, a ojo de buen cubero, dos funciones lineales unidas por un codo de 135 grados. Muestro los eventos que se usan como marcadores estadísticos en otros análisis. Las fechas de cinco muertos y 100 casos confirmados son muy cercanas. Veamos los mismos datos en escala semilog:

Hay dos lugares donde se podría ajustar una recta: la parte absurdamente horizontal de febrero, y el intervalo que marqué entre dos lineas negras. La parte horizontal es una señal de que no podemos tomarnos muy en serio el primer mes de datos, el número de contagiados se mantiene en 12 por dos semanas, después de estar aumentando, y luego brinca a 14 por 6 días, y finalmente comienza a subir de forma más exponencial, que es lo esperado. 
Las lineas negras marcan el intervalo entre el 28 de febrero y el 27 de marzo. Es un mes donde podemos ajustar bien una recta en escala semilog, es decir, una curva exponencial. El ajuste resulta así:
 La linea azul es el resultado el ajuste. Parece estar un poco chueca, pero recordemos que una desviación de un 10 cuadritos abajo es como una desviación de un cuadrito un cuadro más arriba. El ajuste toma eso en cuenta para que el error se distribuya más o menos parejo. También podemos ajustar una recta más similar a lo que ajustaría nuestro ojo: esa haría que los errores fueran parejos en la escala logarítmica, y que por ejemplo un error de 1 contado cuando tenemos 10 contados cuente igual que 10 contados cuando haiga 100 contados (¿ me siguieron? ). Es decir,un ajuste a la recta más cercana a todos los puntos nos da un error relativo más parejo. La comparación entre ambos ajustes se ve de la siguiente manera en escala semilog:


Intuitivamente, la curva verde captura mejor la dinámica de crecimiento. Como podemos ver, EUA solo reporta un mes de crecimiento exponencial. Los datos anteriores son muy poco confiables. Los datos posteriores muestran un aplanamiento de la curva, en el sentido de que el ritmo de crecimiento ya parece ser menos que exponencial. Cada día está menos empinado... en el papel semilog. En el papel normal la gráfica mantiene una tendencia a crecer de forma lineal (véase la primera ilustración), es decir, con un número de nuevos casos más o menos parejito. Ahora bien, observemos las escalas. EUA tiene durante un mes un periodo de duplicación de entre 2.26 y 2.81 días. En los ajustes mostrados en el articulete anterior, México muestra un crecimiento exponencial durante un mes y medio con una tasa de duplicación de un poco más de una semana: es decir, unas seis duplicaciones. En EUA vemos 11 o 13 duplicación en un mes. Ambos empiezan este crecimiento con aproximadamente 100 enfermos. Cuando EUA sale de su "codito" exponencial y logra mantenerse en su fase lineal, ya tiene un ritmo de crecimiento de unos 30'000 casos diarios. Si bien es cierto que el virus ya no parece estar propagandose irrestrictamente, cabe la pena preguntarse, ¿porqué se dió ese mes de crecimiento exponencial con un ritmo tan acelerado, y porqué en México no parece ser ese el caso? Estados Unidos parece haber sido golpeado muy agresivamente por la enfermedad, y también parece que ha reaccionado terriblemente lento, pero México nunca ha sido ejemplo de eficiencia heróica en nada, excepto la civil en los temblores ( el gobierno suele tardarse dos días en reaccionar al menos ).

Recordemos que estamos viendo casos confirmados. Una seria crítica a los números que reporta México es que se hacen muy pocas pruebas, alrededor de 1000 por millón de habitantes, o una por cada 1000 habitantes. Esto efectivamente es escandalosamente bajo. Estados Unidos reporta unas 27'000 pruebas por millón, y no es de los más exhaustivos. Incluso Ruanda reporta 3000 pruebas por millón de habitantes. ¿Será que eso oculta un crecimiento mucho más acelerado? 

No exactamente. Si las pruebas fueran perfectamente confiables ( no lo son ) podríamos alegar que tenemos entonces 27 veces más infectados en el peor de los casos, pero no detectados. Se vale. Pero el RITMO de crecimiento seguiría siendo el mismo. Así que eso no cambia la forma de la curva ( sólo que tan arriba comienza) . Por supuesto que sería muy grave que resultará que tenemos 27 veces más infectados, y causaría un colapso brutal de la sociedad, mucho mayor que lo que estamos viendo. Los datos se verían mucho más ruidosos: las pruebas tendrían un alto índice de positivos, y sería difícil estimar el crecimiento real. La curva en México se comporta con curiosa regularidad. Un atenuante de esta explicación es que tal vez en México la gran parte de los casos son tan poco graves que no vemos su efecto real... o que están escondidos en su casa, muriendo.

Y ahí viene el tema de entrega del próximo articulete. el NYT dice que México está ocultando miles de defunciones por nCovid19. Es muy probable que sea fácil contar mal los casos, especialmente si son poco graves o asintomáticos ( la gente no se va a checar si no tiene nada ). Es mucho más grave y mucho más difícil ocultar muertes. Las casas funerarias estarían trabajando horas muy densas ( si hay un aumento en sus labores, pero muy lejos del escandaloso titular del NYT ). El gobierno tendría que hacer un esfuerzo estilo Gran Narco para ocultar sus muertos, y, pues, sabemos que no suele ser tan eficiente en esos casos y que tenemos una prensa relativamente libre que si le avienta sus buenas piedras. Recordemos que con todo el aparato del Estado Mexicano, no pudieron ocultar la muerte de los normalistas de Ayotzinapa, ocurrida en un paraje de la Sierra de Guerrero y con 43 víctimas. 

En el próximo artículo usaremos la cifras de muertos en nuestros análisis y veremos si tienen la regularidad esperada o nos están ocultando una mortandad apocalíptica... o algún punto en medio de eso.






terça-feira, 5 de maio de 2020

La Función exponencial y el nCovid19, parte 2

Bueno, estamos a 5 de mayo del 2020, y las declaraciones del día de Hugo Lopez Gatell están tan disparadas como las del Peje hace unos días... o tal vez cuentan con otros datos. La famosa curva de contagios no se ha aplanado. Sigue siendo una curva exponencial, y básicamente sigue siendo la misma de hace un mes. Esto no es tan grave, como veremos a continuación.
Déjenme mostrarles unas gráficas simples. Para seguir este artículete, recomiendo comenzar por la primera parte para aquellos que no estén familiarizados con la curva exponencial y la representación semilogarítmica. También vale la pena echarle un ojito para tener presente como se ve una curva exponencial.

Estoy usando los datos disponibles en la Wikipedia, actualizados diariamente y que parecen provenir directamente de la Secretaria de Salud. Recordemos que son los números de casos confirmados, no casos totales. Comencemos por hacer una gráfica simple de los casos confirmados totales por día, aprovechando para hacer algunas marcas interesantes temporales.

Bueno, las marcas no quedaron tan bonitas, porque estoy escribiendo contra reloj, pero eso no es lo que salta a la vista, ¿o si?. Vean la curva. A todas luces es una curva exponencial. Las marcas temporales están ahí para ver si podemos apreciar "a ojímetro" algún cambio en el comportamiento. Eventos detonantes, como la marcha del Día de la Mujer o el Vive Latino no parecen haber tenido particular trascendencia alguna. La marca de 100 casos y de 5 Muertos sirven para ayudar a la estadística: antes de eso se considera que los casos (¡confirmados!) son tan pocos, que pueden desviar la curva mucho, aunque en el caso de México esto no parece hacer mucha diferencia. Si vemos el día que se declaró la emergencia sanitaria (el 30 de marzo) tal vez haya un ligero reducimiento en el crecimiento de la curva, pero no es muy claro y podría ser puro ruido estadístico. 

Bien, hagamos el truco visual confirmador que expliqué anteriormente: grafiquemos esto mismo en papel "semilog", cambiando el eje y de forma que en lugar de pasos constantes, signifique que se multiplica por un factor en cada renglon hacia arriba. La gráfica presenta la siguiente apariencia.
 Muy bien, puede que no se vea muy recta, pero no tiene que ser recta por todos lados. Así nomas podemos ver mas o menos dos partes donde una recta ajusta "bastante bien". Del 11 de marzo hasta el cierre de la Universidad de Nuevo León (2020-03-17), hay una recta bastante empinada. Cara renglón remarcado implica multiplicar por diez. Podemos ver que paso de
11 casos a 118, efectivamente creció brutalmente en esos días (cada cuadrito es aproximadamente 1.8 veces más hacia arriba). Durante esos días el periodo de duplicación era menos de dos días.  El otro periodo donde hay una buena recta es a partir de la declaración de la Emergencia Sanitaria, el 30 de marzo, hasta la fecha. Pero es una recta mucho menos empinada. Así así nomas "adivinándole", podemos estimar que el periodo de duplicación es como una semana, le toma 7 puntitos tener el doble de casos a la gráfica. Por ejemplo, el 9 de abril teníamos 3441, el 16 de abril son 6297, aprox el doble, el 23 de abril son 11'633, el 1 de marzo 20'739. 

Muy bien, podemos hacer (¡ gracias a R !) un ajuste formal de una curva exponencial a los datos, y calcular de forma más precisa el periodo de duplicación promedio. Yo decidí hacer tres ajustes: uno tomando todos los datos, incluyendo los primeros casos confirmados, y también a partir de los 100 casos y de los 5 muertos, que es lo que recomienda la OMS para disminuir el ruido estadístico. A continuación muestro las gráfica con los ajustes en escala normal.


Y ahí andamos, pues. El ajuste exponencial no es perfecto, pero le pega bastante bien al comportamiento cualitativo. Los periodos de duplicación no parecen ser muy afectados por los primeros datos, y los tres ajustes nos dan periodos de aproximadamente nueve días. Pero es claramente más acelerado si usamoslos primeros datos, y más lento si los ignoramos. Si comparamos con la semana del cierre de la UNNL, donde era de aproximadamente cada dos días, la cosa no pinta tan terrible. ¿Será que de eso estaba hablando Lopéz Gatell? 

Mi problema con eso es que están tergiversando el sentido de "aplanar la curva". Es cierto que tenemos una tasa de contagios relativamente baja, y un periodo de duplicación largo, y puede que si tenga que ver con que se comenzaron a aplicar medidas de distanciamiento social muy a tiempo, o que sea sólo suerte o una combinación de ambas. Pero eso no es aplanar la curva. Aplanar la curva quiere decir que deje de ser exponencial. Mientras se mantenga creciendo exponencialmente, el número de contagiados nuevos diarios aumenta día con día. Eventualmente, por lento que sea, tendremos 20'000 contagiados nuevos en un día. Y como EUA demostró, eso no se puede sostener, aunque se vuelva lineal el crecimiento a partir de ese  momento. La meta es frenar la exponencial antes de llegar a números diarios insostenibles.

Decir que ya se aplanó la curva es esencialmente erróneo. No esta el cuero pa' correas. No se debe jugar con los términos técnicos en cuestiones de vida o muerte. Y no se deben de dar falsas esperanzas, como tampoco falsos pánicos. 


PD: Hablé de R en un paréntesis. R es un lenguaje de programación "de matemáticos estadísticos para matemáticos estadísticos". Es gratuito y libre (abierto). Contiene una inmensa gama de utilidades que facilitan estos análisis, y tiene una estética clásica en su sintaxis y resultados. Lo recomiendo ampliamente.

segunda-feira, 4 de maio de 2020

La Función Exponencial y el nCovid19, Parte 1.

Hace unos pocos dias, el Peje declaró que la curva de contagios del Coronavirus se estaba aplanando. Esto es patentemente falso como voy a exponer a continuación (jajaja... "exponer") y de paso explicaré algunos conceptos esenciales. 

¿A que nos referimos con aplanar la curva ? ¿de que curva estamos hablando ?
El término fue popularizado por la OMS y por Tomas Pueyo en sus artículos. Para entenderlo necesitamos entender un modelo ultra simplificado de expansión de pandemias. Aquí les va.
Supongamos que en dia dado, indicado por la letra t (de tiempo) tenemos c contagiados. Esto se denota c(t) y se puede leer como "c de t" o "c en el momento t" o "contagiados en el dia t". Supongamos que cada contagiado le pasa la enfermedad a n personas más en un día. Como tenemos c(t) contagiados, entonces al dia siguiente aparecen n por c(t) contagiados más, cada uno contagio a n personas nuevas.
Entonces al dia siguiente, que sería t+1, tendríamos n personas más contagiadas, esto se escribe en ecuación así:
c(t+1)=c(t)+ n·c(t).
Y se puede leer como "los contagiados en el día t+1 son los contagiados del dia anterior más n veces los contagiados del dia anterior".
El modelo está muy muy muy rebajado. No toma en cuenta que la gente se va curando, no toma en cuenta que solo durante un periodo uno puede contagiar, y además asume que todos contagian por igual. Está última en promedio es una aproximación aceptable, las otras comienzan a fallar cuando uno ve detalles.
La ecuación queda, factorizando términos (es decir, escribiendo como multiplicación lo que se puede poner como multiplicación), así:
c(t+1)=c(t)·(1+n)
Entonces uno puede ver que el número de contagiados va creciendo multiplicando el número anterior por un número constante. Al dia siguiente del siguiente (t+2) tenemos que
c(t+2)=c(t+1) · (1+n) = c(t) · (1+n) (1+n)
Es decir, el dia t+2 tiene c(t+1) por (1+n) contagiados, pero c(t+1) es igual a c(t) por (1+n). Entonces cada dia que pasa multiplicamos por un nuevo (1+n) lo que ya llevabamos.  Si  por ejemplo, resulta que el dia original, al que podemos llamar t=0, tenemos entonces los primeros contagiados, y dejamos que pasen T dias (esta vez  con mayúsculas, para indicar que son varios dias), tenemos que:
c(T)=c(0)·(1+n)·(1+n) ....  ·(1+n) , 
(donde (1+n) está multiplicado T veces).
Esto se escribe en notación simplificada como 
c(T)=c(0) · (1+n)^(T)
( o se pone la T como un tilde, arriba y chiquito) 
Y se lee como " uno mas n elevado a la T" donde T es el exponente. Eso es una ecuación de crecimiento exponencial y T es el exponente, que nos dice cuantas veces multiplicamos un número dado. Es una operación que crece muy rápido. Si por ejemplo, n=1 ( cada quien contagia a una persona en nuestro modelo), tenemos que (1+1)^T es 2^T, y por ejemplo si T=7 dias, tenemos que
2^7=2·2·2·2·2·2·2=128.
Entonces, si así fuera, después de una semana tendríamos 128 VECES los contagiados del día cero... es rápido, ¿no?
Como nota, aclaremos que por consistencia con otras reglas de multiplicar, cualquier número elevado a 0 es igual a 1, intuitivamente "no multiplicamos por nada nuevo", entonces multiplicamos por uno, por ejemplo 2^0 = 1, 7^0=1, etc.
En nuestro ejemplo, no paso ningún dia, es decir,
c(T=0)=c(0)=c(0)·(1+n)^0=c(0)·1 (daah).
Muy bien, este ejemplo es súper simple pero captura la esencia del crecimiento exponencial.  Otro ejemplo está en mi artículo de denuncia contra las Flores de la Abundancia, los fraudes piramidales tienen crecimiento exponencial porque siguen la reglas de "contagio" expuestas arriba: cada involucrado tiene que invitar a n nuevos participantes.
El crecimiento exponencial se da cuando no hay nada que ponga tope a la forma en que se transmiten los contagios, que es cuando las pandemias empiezan a propagarse. Una vez que ya haya demasiados contagiados, o vacunas, o medicamentos, los contagiados ya no pueden contagiar fácilmente a quien sea ( o todos están muertos, también eso puede pasar) y la ecuación exponencial ya no funciona. 
Le llamamos curva exponencial a la gráfica continua que pasa por los puntos de una gráfica de crecimiento exponencial. Se le llama función exponencial a la expresión en fórmula que produce esa curva. Hay una manera consistente de definir los exponentes para quebrados y otros números, de forma que la curva llena los espacios entre el dia t y el día t+1, y es consistente con la interpretación. La curva exponencial se ve como en la siguiente gráfica:
 

Una curva exponencial se ve siempre más o menos igual: empieza a subir despacio, luego acelera, y luego aparenta explotar hacia el cielo. Si agregamos mas puntos siguiendo el mismo factor de crecimiento, lo que antes aparentaba ser la aceleración máxima se vuelve pequeña en relación con la nueva, por ejemplo,
continuemos por cinco puntos más la grafica anterior:
La curva se ve intuitivamente igual, pero la escala es monstruosamente más grande en el eje "y" o vertical. Esto hace un poco más visual lo impresionante del crecimiento exponencial. Una curva exponencial cuenta con esa propiedad: si le hacemos zoom para arriba o para abajo, parece mantenerse igual. Se dice que es autosemejante. Es una consecuencia de que siempre crece al mismo ritmo.

Dado que como podemos ver, el número de un contagiado nuevo por día da un crecimiento irrealmente grande, en realidad tenemos factores mucho mas pequeños, como de 0.1 contagiados nuevos por contagiado por dia... ¿que demonios quiere decir que contagiamos a un décimo de persona? Pues que en promedio, cada contagiado contagia a una persona cada diez dias, no cada dia, o que 10 contagiados en promedio contagian a una nueva persona cada día, no cada uno de ellos, sino en promedio. Estos detalles conceptuales hay que afianzarlos bien para entender lo que sigue.

Hay otro truco conceptual matemático: lo que estamos "elevando a T" se le llama "la base". Podemos cambiar de base arbitrariamente cambiando la forma en que medimos el tiempo. Por ejemplo, nos interesa saber cada cuanto se duplican los contagiados, entonces vamos a medir el tiempo en periodos de duplicación de contagios, que puede ser, pongamos, una semana. Cada semana hay el doble de contagios. Entonces si medimos el tiempo en semanas, en lugar de dias, la ecuación se ve asi
c(semana s + una semana) = c( semana s) 2^1= c(s)·2
Y si a partir de la semana cero pasan S semanas la ecuación queda así:
c(S)=c(0)2^S.
La cuestión es que entonces S=7T, donde T eran días y 7 es el periodo de duplicación. Entonces la ecuación si la queremos volver a tener en días, tenemos que poner todo en días, que son 1/7 de semana:
c(T)=c(0) ·2^(T/7),
Cada siete días, T/7 crece por una unidad y entonces se duplica el número de contagios. En lugar de siete días pudo haber sido cualquier número de días, pongamos que son P días. Entonces se dice que P es el "periodo de duplicación de contagios".  Este número nos da una idea de que tan grave es el crecimiento exponencial. Si P son pocos días, quiere decir que se duplica rápidamente el número de contagios. Si P es muy grande quiere decir que le toma muchos días a los contagiados duplicarse ( o que tal vez no lo están haciendo, buena señal). 
Retomemos las gráficas. Resulta que hay un truco formal y muy útil para ver fácilmente si una curva o unos puntos se aproximan a una exponencial. Relacionado con lo anterior, que es el cambio de base, uno puede cambiar la escala vertical en una gráfica de forma que cada paso (cada cuadrito o cada marca) hacia arriba implica que el numero creció B veces más. Es decir, que creció exponencialmente. Normalmente se escoge para B que sea igual a 10. Entonces un gráfica exponencial va avanzando no "de diez en diez" en cada cuadrito, sino "por diez" cada cuadrito hacia arriba. A esto se le llama usar "escala logarítmica" ( el logarítmo es lo contrario de la exponencial, básicamente estamos "bajando el exponente"). La curva exponencial del último ejemplo se ve así:
Que decente. Una función exponencial en escala logarítmica en las yes se ve como una simple recta ( vean la escala vertical, eh). Resulta que no importa que base usemos, siempre se ve así, solo cambia lo empinado. Si tenemos una serie de puntos, y los graficamos usando escala logarítmica, se tiene que ver  mas o menos como una linea recta. Si no se ve así no es crecimiento exponencial.Este truco es formal y correcto y lo usan analistas profesionales, así que si queremos saber si algo se está comportando exponencialmente, lo graficamos en papel "semilog" (sólo tiene un eje "logarítmico") y si se ve mas o menos como recta, entonces si, si no, no es.

Bueno, resulta que esa es la curva de la que están hablando los políticos y demás. Quieren que el crecimiento sea por debajo de lo exponencial.  

Pues bien. Armados de lo anterior usemos un ejemplo concreto: México. Veamos si parece ser una curva exponencial y cual es su P si usamos base 2. Y luego comparemos con EUA  y vemos que pasa.