Plataforma Genómica · SARS-CoV-2
Cinco métodos · septiembre 2026

Alcance de la plataforma · septiembre 2026

Cinco métodos, y dónde empieza a predecir

Qué responde cada uno, cuáles se pueden construir hoy, y qué hace falta exactamente para los dos que todavía no.

4 construibles hoy 2 requieren datos que no tenemos
Objeto de análisisNC_045512.2
ORF1ab
S
M
N
0
5.000
10.000
15.000
20.000
29.903 pb
3Donde empieza
el pronóstico
2Ya construidos
y funcionando
2-8Semanas de
anticipación

Vista general

Los cinco, en una tabla

MétodoQué respondePara qué sirveEstado
1 · Brotes¿Qué muestras podrían venir de una misma cadena de contagio?Decidir qué grupo investigar primeroConstruido
2 · Rasgos¿Qué señales biológicas trae esta muestra?Priorizar qué muestra revisar primeroConstruido
3 · Fitness viral¿Qué linaje está ganando terreno y qué fracción tendrá en unas semanas?Anticipar un reemplazo de variantePor construir
4 · Características¿Este genoma escapa a los anticuerpos? ¿resiste el antiviral?Evaluar una variante sin esperar a que crezcaFaltan datos
5 · Cadenas y genomas futuros¿Quién contagió a quién? ¿Qué mutación aparecerá?Reconstruir un contagio o anticipar la próxima varianteFaltan datos
01

Lo que ya existe

Métodos 1 y 2

Describen y priorizan. Todavía no predicen nada.

Construidos y funcionando

Dos preguntas distintas sobre el presente

1 · Brotes

¿Qué muestras se parecen entre sí?

Compara los genomas posición por posición, agrupa los que están lo bastante cerca en una misma ventana de tiempo, y ordena esos grupos por cuán sospechosos son: tamaño, concentración en un establecimiento, crecimiento reciente.

2 · Rasgos

¿Qué trae esta muestra en particular?

Busca en el genoma marcadores asociados en la literatura a veinte características —escape de anticuerpos, transmisibilidad, resistencia a antivirales— y ubica la muestra en una cola de revisión.

Lo que ninguno de los dos hace

Mirar hacia adelante. Ambos describen lo que ya pasó o lo que la muestra ya tiene. Son la base sobre la que se apoya el tercero, pero no pronostican.

02

El salto

Método 3: fitness viral

Acá la plataforma empieza a predecir.

Método 3 · fitness viral

El primero que mira hacia adelante

Qué es el fitness viral Qué variante le gana la carrera a las otras No es una cualidad de una muestra suelta: se ve mirando cómo cambian las proporciones de cada linaje semana a semana. Una que empieza en 5% y pasa a 12%, 28% y 46% tiene ventaja sobre las demás.
Qué entrega Una proyección con su margen Qué tan rápido crece cada linaje, con cuánta certeza, y qué fracción de los casos representaría en 2, 4 u 8 semanas.
Por qué importa que sea el número 3 y no el 1

Los dos anteriores contestan sobre el presente. Este es el primero que arriesga una afirmación sobre el futuro — y por eso es también el primero que puede equivocarse de forma verificable: se le puede pedir que prediga semanas que ya pasaron y comprobar si acertó.

03

La pregunta práctica

¿Cuáles se pueden construir hoy?

Construir y validar no son lo mismo.

La distinción que evita malentendidos

Los métodos 1 a 4 se pueden programar hoy

Se puede hacer ahora Construir la máquina El cálculo, la pantalla, las alertas, la trazabilidad, las pruebas de que mide lo que dice medir. Todo eso no depende de tener datos chilenos: depende de saber qué queremos medir.
No se puede todavía Afirmar que acierta Que el resultado describa la realidad chilena exige datos reales. Hasta entonces, cualquier cifra que muestre la pantalla es una demostración del mecanismo, no evidencia epidemiológica.
La analogía

Se puede fabricar y calibrar una balanza antes de tener qué pesar. Se la prueba con pesas de peso conocido. Lo que no se puede es decir cuánto pesa algo que todavía no llegó.

04

Los dos que faltan

Qué hace falta, exactamente

Con ejemplos concretos, no en general.

Método 4 · características de un genoma

Ejemplo: ¿la mutación S:F456L ayuda a escapar de los anticuerpos?

✓
Lo que ya tenemosSabemos que la muestra tiene esa mutación: la extraemos del genoma y la nombramos correctamente. Eso ya funciona.
Resuelto
→
Lo que falta y sí existeUna medición de laboratorio que diga cuánto baja la neutralización con esa mutación. Existe publicada: hay experimentos que miden el efecto de cada mutación posible, una por una. Hay que integrarla, y es trabajo acotado que no depende del ISP.
Integrable
✗
Lo que no existeEsa misma medición hecha sobre las variantes que circulan en Chile, y casos locales donde se haya comprobado el efecto. Sin eso podemos estimar, pero no verificar que acertamos acá.
Falta
Conclusión

Es alcanzable por partes. Empezar usando las mediciones publicadas para reforzar el método 2 es trabajo concreto y se puede hacer sin esperar nada.

Método 5 · cadenas de contagio

Ejemplo: ¿la muestra A contagió a la muestra B?

✓
Hasta dónde llegamos hoySi sus genomas son casi idénticos y las fechas son cercanas, podemos decir «son compatibles con una cadena común». Eso ya lo hace el método 1.
Resuelto
✗
Para decir quién contagió a quiénHaría falta saber que esas dos personas estuvieron en el mismo lugar al mismo tiempo. La plataforma no tiene datos de contacto ni de movilidad, y no están en el alcance del proyecto.
Falta
✗
Para predecir el próximo genomaHaría falta volumen mundial, no nacional. Los grupos que lo intentan trabajan sobre millones de secuencias de todos los países.
Falta
Y algo anterior a todo eso

La plataforma hoy no sabe si dos muestras son de dos personas distintas o de la misma persona secuenciada dos veces. Los identificadores se eliminaron a propósito por la ley de datos personales. Es un límite legal, no técnico, y revertirlo sería una decisión del ISP.

Una versión acotada sí está a mano

Alerta de mutaciones emergentes

No «cuál será el próximo genoma», sino: qué mutaciones están apareciendo cada vez más seguido, y si su frecuencia está subiendo.

Es el método 3 mirando mutaciones en lugar de linajes. Si el motor se construye con esa unidad configurable desde el principio, esta capacidad sale prácticamente sin costo adicional.

Lo defendible ante el ISP «Detectamos mutaciones emergentes y estimamos si están creciendo» Medible, verificable y honesto.
Lo que no hay que prometer

«El sistema predecirá el próximo genoma dominante» o «sabremos quién contagió a quién». Ningún grupo del mundo entrega eso con datos de un solo país.

T

Vía técnica

El detalle de cada método

Métodos, parámetros y las limitaciones que conviene conocer antes de discutirlos.

Método 1 · detección de brotes

Agrupamiento genómico con control de falsos positivos

Distancia y grafo d(A,B) = |A| + |B| − 2·|A∩B| Sobre posiciones comparables por par, no globales: una posición con N en cualquiera de los dos no cuenta para ninguno. Enmascarado de sitios problemáticos (De Maio et al., 265 posiciones) más extremos ±100 nt. Arista si d ≤ 2 SNP y |Δfecha| ≤ 28 días.
Clusters y score Componentes conexos con diámetro acotado Single-linkage cortado al umbral, con corte recursivo de la arista más larga si el diámetro supera 6. El score es una combinación lineal de cinco señales normalizadas min-max dentro de la corrida.
Prueba de significancia

Permutación con nulo no uniforme: se muestrea sin reemplazo del pool regional real de la misma ventana. p = (≥real + 1)/(B + 1) con B = 1.000, y control de tasa de falso descubrimiento por Benjamini-Hochberg a α = 0,05. La limitación conocida: no hay deduplicación por paciente —los identificadores se purgaron— así que una re-secuenciación se marca a mano.

Método 2 · rasgos

De variantes a un vector de largo fijo

01
Sustrato: analysis_variants, no las columnas mutation_*Esas descartan sinónimas y excluyen ORF1ab por completo. En una muestra real, 103 de 222 variantes PASS son de ORF1ab: casi la mitad de la evidencia.
Datos
02
ORF1ab se ubica en nsp1…nsp16 por coordenada nucleotídicaNo por número de aminoácido. ORF1ab:P323L es ambiguo: leído como posición de la poliproteína cae en nsp2 codón 143, otra mutación en otra proteína. iVar además anota ese nucleótido como P314L, su numeración en ORF1b.
Traducción
03
Filtro AF ≥ 0,5 y vector de 20 componentesMismo criterio con que ivar consensus fija una base: por debajo es diversidad intrahospedero. El puntaje de cada rasgo es la fracción de sus marcadores presente; el vector conserva largo fijo aunque haya ceros.
Features
Estado

Cobertura 62 de 64 marcadores; lo único fuera son deleciones, que el parser no conserva. El clasificador es regresión logística multinomial con partición temporal y comparación contra el mejor predictor constante. Las muestras del demo son sintéticas; el entrenamiento y la validación no.

Método 3 · el modelo

Crecimiento multinomial de frecuencias

La probabilidad de que una muestra del periodo t sea del linaje i sigue un softmax sobre α + β·t.

  • β es la ventaja de crecimiento, en log-odds por periodo y relativa a un linaje de referencia: el fitness es comparativo por definición.
  • Se ajusta como regresión logística multinomial con el tiempo como única covariable y los conteos como pesos.
  • Regularización mínima para aproximar máxima verosimilitud: con el valor por defecto el coeficiente se encoge hacia cero.
Verificado antes de escribir el plan Recupera el parámetro Sobre series con la ventaja fijada a mano.
β puesto / estimado0,280 → 0,280
β negativo−0,120 → −0,122
Cobertura del IC 95%93% – 97%

Método 3 · cuándo es confiable

Manda el número de periodos, no el total de muestras

RégimenTotal de muestrasDesviación del estimadorVeredicto
26 periodos × 601.5600,014Usable
26 periodos × 205200,026Usable
12 periodos × 202400,126Ruidoso
6 periodos × 8484,258Inutilizable
La consecuencia de diseño

26 × 20 tiene un tercio de las muestras de 26 × 60 y casi la misma precisión. El módulo debe negarse a estimar por debajo de un mínimo de periodos en vez de devolver un número sin sentido — mismo criterio que la bandera de bajo volumen del método 1.

Método 4 · qué datos exactamente

Fenotipo por mutación

Lo que existe y es integrable Mutagénesis masiva (DMS) Experimentos que miden, mutación por mutación, el efecto sobre la unión a ACE2 y sobre el escape a anticuerpos monoclonales. Son datos publicados y descargables. Entran como priors, que es el rol que ya les asignó el estado del arte del proyecto.
La capa opcional Modelos de lenguaje de proteínas Para señalar mutaciones potencialmente preocupantes antes de que muestren señal de crecimiento en la vigilancia. Requiere GPU; las capas de DMS corren en CPU.
La limitación que hay que declarar

Los DMS se miden sobre fondos genéticos específicos —típicamente Wuhan-Hu-1 o un Ómicron concreto—. Extrapolar el efecto de una mutación a otro fondo tiene límites reales por epistasis: la misma sustitución puede comportarse distinto según qué otras la acompañen. Y no hay mediciones locales contra las cuales verificar que acertamos en las variantes que circulan en Chile.

Método 5 · por qué no alcanza

Tres obstáculos, y solo uno es de método

01
Genomas idénticos no dan direccionalidadDos secuencias a distancia cero son compatibles con A→B, con B→A y con una fuente común no muestreada. Resolver la dirección exige vínculo epidemiológico —fecha de inicio de síntomas, contacto, exposición compartida— que la plataforma no tiene.
Método
02
No se puede resolver identidad entre muestrasLos identificadores se eliminaron por la ley de datos personales. La plataforma no sabe si dos muestras son de dos personas o de la misma secuenciada dos veces; por eso el método 1 usa marcado manual. Es un límite legal, y revertirlo es decisión del ISP.
Legal
03
Predecir genomas futuros requiere volumen globalLos grupos que lo intentan trabajan sobre repositorios mundiales de millones de secuencias. Con el volumen de un país no hay señal suficiente para anticipar qué mutación emergerá.
Volumen
Lo que sí es alcanzable

Aplicar el motor del método 3 con la mutación como unidad en vez del linaje: detectar mutaciones cuya frecuencia está subiendo. Si el modelo se construye con esa unidad configurable desde el principio, la capacidad sale sin costo adicional.

Higiene conceptual

Comparten infraestructura, no pregunta

Misma familia, problema distinto Los métodos 2 y 3 usan regresión logística multinomial Pero en el 2 la observación es una muestra y la respuesta es su categoría; en el 3 la observación es un periodo y la respuesta es la composición de linajes. Compartir familia matemática no los hace equivalentes.
Tres «scores» distintos Nombrarlos por lo que miden Prioridad de brote, confianza de rasgo y ventaja de crecimiento no son comparables entre sí. Llamarlos «riesgo» a los tres invita a sumarlos, que es el error más caro.
El sesgo que no se arregla con estadística Ascertainment El método 3 estima crecimiento entre las muestras secuenciadas. Un cambio en a quién se secuencia aparece como cambio de fitness sin que el virus haya cambiado. Se declara, y se corrige solo si se conoce la fracción secuenciada por región y periodo.

Cierre

Cuatro de los cinco se pueden construir ahora. El quinto no depende de programar mejor.

1 y 2 construidos 3 y 4 construibles hoy 5 requiere otros datos

Instituto de Salud Pública de Chile · septiembre 2026

1 / 1