6 de octubre de 2026
El color de nuestro scorecard ya no se decide a mano
Segunda de la serie. En la primera revisión nos comprometimos a publicar cada cambio al método con su porqué, porque si las reglas cambian sin avisar, comparar una edición con otra deja de tener sentido. Esto es el primer cobro de ese compromiso.
La revisión de octubre terminó nombrando dos cosas que la auditoría había dejado sin resolver. Las dos están cerradas. Una se resolvió como esperábamos; la otra, al medirla, se resolvió al revés.
El primer pendiente: de decidir a mano a contar drivers
Lo que dijimos entonces: la clasificación del régimen, la convicción y las alertas se calculan con reglas, pero el color de cada activo no. Era el último veredicto que publicábamos sin que una regla lo produjera, y era justo donde habían ocurrido dos de los tres errores de la auditoría.
Ahora los ocho activos tienen tabla de drivers y el color sale de contar. Cada driver se evalúa por su dirección contra la edición anterior, con el mismo umbral que usamos para marcar banderas en los datos, y el color sale del saldo: favorables menos desfavorables. Si el autor quiere apartarse del cálculo puede, pero la razón queda escrita en el registro. Apartarse dejando rastro es distinto de decidir a mano, que era indistinguible del cálculo.
La prueba que le exigimos antes de activarlo fue recomputar las catorce ediciones publicadas. En Bitcoin coincide 11 de 12 veces, y la única divergencia es la edición del 21 de septiembre, que es exactamente el error que motivó todo esto: ahí publicamos verde con tres de cinco drivers favorables, y la regla nueva habría dicho amarillo. El diseño habría evitado el error que lo provocó, que era la condición mínima para merecer existir.
En el oro coincide 2 de 12, y esa divergencia no la arreglamos: la explicamos. El verde del oro venía de nuestra tesis de escasez, que es un argumento estructural de años, no de los drivers semanales que su celda dice medir. Decidimos calificar el oro por su tabla y dejar la tesis en el texto, donde se puede discutir. Meter un argumento de década en un instrumento semanal era confundir dos horizontes.
El segundo pendiente: la tabla base por estación se retiró
Lo que dijimos entonces: la metodología decía qué entorno favorece a cada activo en cada estación, y nosotros nos apartábamos de esa tabla en más de la mitad de las celdas. O la tabla estaba mal calibrada o el scorecard era juicio informado y no salida de un método.
Antes de decidir si conservarla la medimos contra lo publicado, y el resultado fue peor de lo que suponíamos. Coincidía 52 de 112 veces. En CETES, 1 de 14: la tabla decía amarillo y publicamos verde trece veces. En el S&P 500, ninguna de las catorce. Y las divergencias no son ruido, porque van siempre en la misma dirección en cada activo.
Pero el argumento que la retiró fue otro. De sus cuatro columnas, una sola se ha ejercido alguna vez: las catorce ediciones son todas primavera. Las otras tres eran afirmaciones sin una observación detrás. Una tabla que se equivoca la mitad de las veces en la única estación que conocemos, y que no ha sido probada en las otras tres, no es un punto de partida. Es decoración con forma de método.
Se conserva la explicación de por qué cada estación favorece a unos activos y castiga a otros, que es el material que de verdad enseña algo. Un párrafo que explica un mecanismo no se puede confundir con un veredicto. Una celda que dice verde, sí.
Dos reglas nuevas que la evidencia nos obligó a escribir
Sin al menos dos drivers con dato, el activo no se califica. Al recomputar las catorce ediciones encontramos que los activos mexicanos tenían en promedio un solo driver con dato, porque varias de sus series son nuevas. Con una sola opinión, el saldo nunca alcanza el umbral y la regla devolvía amarillo siempre. Y tres activos “coincidían” con lo que habíamos publicado por la razón equivocada: lo publicado también era amarillo. Dos amarillos que se encuentran por caminos distintos no validan nada.
El problema de fondo es que amarillo no es una ausencia, es una afirmación. Significa entorno mixto. Publicarlo cuando la regla no tuvo con qué opinar es decir algo sin haberlo medido. Ahora esas celdas dicen que no hay calificación.
La calificación se publica cuando se mueve, no cada semana por defecto. Un activo cuyas series traen todas el mismo valor que la semana pasada no se recalculó: su color es el de la edición anterior. Antes eso se veía igual que una revisión; ahora se distingue. El tablero completo aparece una vez al mes.
Esto explica algo que la primera revisión reportó sin poder explicar: que siete de ocho activos no se pudieran evaluar porque el scorecard casi no se movía. No es que los activos sean aburridos. Es que la variación del color seguía la cadencia de los datos que lo alimentan. El peso tiene drivers diarios y cambió seis veces. Bienes raíces los tiene mensuales y trimestrales, y no cambió nunca.
Lo que hizo posible medir todo lo anterior: el archivo
Nada de lo de arriba se puede afirmar sin un archivo. Decir que la regla nueva coincide 11 de 12 veces con lo que publicamos, o que la tabla base se apartaba 52 de 112, exige poder volver a cada edición y recalcularla con los datos que había entonces. Eso no se improvisa: o se guardó, o no se puede responder.
Así que la semana pasada el archivo creció de 38 a 49 campos por edición, casi un tercio más. Y las once adiciones son de dos clases distintas, porque resuelven dos problemas distintos.
Cuatro guardan lo que cada edición concluye, no solo lo que mide. Los ocho colores del scorecard, la convicción con los motivos que la sostienen, la hipótesis de la semana con su fecha de vencimiento y las señales de transición de régimen. Antes guardábamos los datos de entrada y los veredictos se quedaban en el texto, lo que significa que no se podía preguntar si un veredicto envejeció bien. Ahora cada conclusión queda con fecha y con su razón, y eso es lo que permite que dentro de un mes se pueda contestar si acertó.
Siete guardan datos nuevos, incluida la columna que registra el color calculado al lado del publicado. Si los dos difieren, la diferencia queda escrita en el momento, no sujeta a que alguien se acuerde. Es la misma idea que el override con razón obligatoria: lo que importa no es que el autor nunca se aparte del cálculo, es que apartarse deje rastro.
Vale decir la contra, porque es la misma de siempre. Una columna que nace hoy no tiene historia hoy. Las seis series que se incorporaron esta semana no existen en las catorce ediciones anteriores, y por eso cinco de las tablas nuevas no se pueden validar todavía. El archivo es una promesa que paga después, no ahora. La parte incómoda de fortalecerlo es que el beneficio llega cuando ya pasó el tiempo, y mientras tanto solo se puede decir que se está guardando bien.
Lo decimos porque es la pieza menos visible del sistema y la que sostiene todo lo demás. Sin archivo, la pregunta de si el scorecard acierta no es una pregunta difícil: es una pregunta sin respuesta posible, y cualquier cosa que contestáramos sería opinión.
Dos errores que encontramos al hacer esto
Los dos estaban en el código, los dos llevaban semanas ahí y ninguno había cambiado un color publicado. Los contamos porque el compromiso no decía “los errores que hayan afectado al lector”.
Los umbrales porcentuales se aplicaban como si fueran unidades. Algunos umbrales están en unidades del indicador y otros en porcentaje sobre el valor previo. El código que calcula los drivers los trataba todos como unidades. El efecto deformaba el umbral en las dos direcciones: el driver que mide si México gana terreno frente a otros emergentes tenía un umbral 95 veces más ancho de lo debido, así que no podía dispararse nunca, y el del tipo de cambio solo opinaba si el peso se movía un peso y medio en una semana. Lo encontró una prueba que escribimos para otra cosa.
Un indicador se leía con dos nombres distintos. El IGAE se llama de una forma en los datos que entran y de otra en el registro histórico. El código los comparaba con el mismo nombre, así que ese driver devolvía “sin dato” en silencio y la Bolsa mexicana se habría calificado con tres drivers en lugar de cuatro sin que nada avisara. Es la misma clase de falla que en agosto dejó pasar el mayor salto del IGAE sin una bandera.
Lo que esto cambia para quien lee, y lo que no sabemos todavía
Van a ver celdas que dicen que no hay calificación, y eso es información, no un hueco. Van a ver que el tablero no se republica entero cada semana. Y cuando un color se mueva, el movimiento viene de una cuenta que se puede rehacer.
Lo que no podemos decir todavía es si las cinco tablas de los activos mexicanos están bien calibradas. Cinco de las series que las alimentan se incorporaron esta semana, así que al recomputar las catorce ediciones no hay con qué compararlas. La validación de esas tablas llega con las próximas ediciones, y lo decimos ahora para que nadie lo lea como si ya estuviera probado. Las de los activos globales sí pasaron la prueba.
Hay tres límites más que preferimos escribir que esconder. Las remesas las medimos sobre el nivel mensual, que tiene estacionalidad fuerte, y el umbral filtra ruido pero no corrige la época del año. La tasa hipotecaria real es una aproximación con la tasa real de corto plazo, porque la tasa efectiva de las hipotecas no se publica como serie pública. Y la tabla de bienes raíces tiene tres drivers en vez de cuatro porque el empleo formal no existe como serie verificable en la fuente; buscándolo encontramos una serie que devolvía datos y habría pasado por empleo, hasta que su comportamiento la delató como el salario mínimo diario. Una serie se verifica por cómo se comporta, no por su nombre.
El compromiso sigue en pie
La próxima revisión completa toca en enero de 2027. La medición de aciertos se vuelve a correr cada mes. Y cada cambio al método se publica como este, salga como salga.
Esta nota existe porque nos comprometimos a escribirla antes de saber qué íbamos a tener que contar. Resultó que tocaba contar que retiramos una tabla por no tener evidencia y que encontramos dos errores propios buscando otra cosa.