Skip to main content
Skip to main content
← Volver a Noticias

El error que mejoraba nuestras cifras: cómo lo encontramos y lo eliminamos

09.09.20268 min de lectura ·accesibilidadmetodologíadatos abiertoshonestidad en la medicióninvestigación EE. UU.
CODE Eternal

En resumen

Medimos la accesibilidad de los sitios web: si una persona que no usa ratón puede recorrer una página con el teclado y obtener aquello a lo que vino. Durante la última semana rastreamos decenas de miles de sitios comerciales de EE. UU.

El 8 de septiembre encontramos dos errores en nuestro propio rastreo. Ambos hacían que nuestras cifras se vieran mejor de lo que eran. Los eliminamos. Contamos cómo se veían por dentro, porque este es justo el tipo de cosa que los informes ajenos no suelen mostrar.

El primer error: una página-obstáculo contada como sitio impecable

Las grandes cadenas se protegen de las peticiones automáticas. Nuestro rastreador llegaba a uno de esos sitios y recibía no el sitio, sino una página de verificación: «¿Robot o humano?».

Lo que ocurría después: el servidor respondía con código 200 — «todo bien». La página se renderizaba. El motor de accesibilidad la analizaba y encontraba cero incumplimientos. Y es cierto: en una página con una línea de texto y una casilla no hay nada que incumplir.

En el registro quedaba: medido, sin incumplimientos.

Es decir, un sitio que no nos dejó entrar se contaba como ejemplar. Hubo más de cuatro mil registros así, 3 227 de ellos con un cero redondo.

El segundo error: una cadena con el peso de mil empresas

Tomamos las direcciones de los sitios de un registro abierto de organizaciones. En las cadenas, cada local es un registro aparte, y todos llevan la misma dirección en el campo «sitio web».

La medición: 57 401 comprobaciones sobre 8 170 dominios únicos. Siete comprobaciones por dominio. Una conocida marca de café fue medida 5 739 veces, una por cafetería.

Si se calcula la proporción de «sitios con incumplimientos» por número de comprobaciones, una sola cadena adquiere el peso de cinco mil empresas independientes. Y las grandes cadenas suelen tener buenos sitios: en ellos trabajan departamentos enteros.

Qué cambió en la cifra principal

proporción de sitios con incumplimientos por comprobaciones (incorrecto) ......... 60,0 % por sitios únicos, sin captchas ......... 77,9 % desplazamiento .......................... 17,8 puntos porcentuales

Fíjense en la dirección. Estábamos subestimando nuestro propio resultado. Al corregir el error obtuvimos una cifra que nos favorece más.

Por eso mismo lo contamos. Una corrección que empeora tu resultado se hace por prudencia. Una que lo mejora es fácil de no advertir y de no buscar — y esa es la propiedad más peligrosa de ambos errores: no despiertan sospecha. Los datos parecen normales. Nada se cae. Nadie se queja.

Cómo lo encontramos

No buscábamos ninguno de los dos.

Comprobábamos otra cosa: que cada sitio medido tuviera su propia captura de pantalla y no una sustituida. Para ello contamos la proporción de sumas de verificación únicas. Resultó 74,4 %: una cuarta parte de las capturas se repetía.

Después abrimos las repeticiones y las miramos. En los tres primeros ejemplos ya aparecía el sitio de una gran cadena comercial con el título «Robot or human?» y cero incumplimientos.

De ahí una conclusión sencilla que incorporamos a nuestro método: la suma de verificación de una captura es una comprobación barata y muy potente. Detecta a la vez dos clases distintas de error: una medición sustituida y datos de entrada duplicados. A partir de ahora estará en todos nuestros rastreos.

Lo que NO hicimos

No detuvimos el rastreo en curso.

La comprobación mostró que hay que arreglar el recuento, no la recolección: cada registro conserva el título de la página, el dominio, el código de respuesta y la suma de verificación de la captura. Eso basta para separar las páginas-obstáculo y agrupar las cadenas después del rastreo. Los datos están intactos; no hay que recolectar nada de nuevo.

Es la segunda vez que nuestra cifra baja en contra de nuestro interés

El 1 de septiembre contamos 1 498 dominios muertos entre los sitios municipales. El 8 de septiembre recontamos: 1 441. Cincuenta y cinco dominios que dábamos por muertos respondieron al reintentar, y dos más al tercer intento.

La cifra mayor resultaba más impactante. Nos quedamos con la menor.

Una suma que se puede verificar en voz alta: 1 441 + 10 461 = 11 902 — todos los sitios municipales de nuestra muestra.

Lo que comprobamos aparte

Aplicamos el mismo procedimiento a nuestro rastreo municipal, cuyos datos ya están publicados abiertamente. Allí no hay sesgo: 95 524 comprobaciones sobre 11 902 sitios únicos, ocho páginas cada uno, cero páginas-obstáculo. Los sitios municipales no usan captchas.

Los datos publicados no requieren corrección. Solo la necesita el rastreo comercial, que sigue en marcha.

Por qué escribimos sobre esto

Porque una cifra sin denominador no es una medición, es una impresión. Cuando alguien dice «el 78 % de los sitios son inaccesibles», la única pregunta honesta es: ¿78 % de qué exactamente, y qué dejaron fuera del denominador?

Respondemos por adelantado: la proporción se calcula sobre sitios únicos, no sobre el número de comprobaciones, y las páginas-obstáculo no entran en el denominador. Sin esta corrección tendríamos un 60 %; con ella, un 78 %. Nos quedamos con la cifra que podemos defender.

Los datos, el código y las capturas están abiertos. Compruébennos.