Google ha querido arrojar luz sobre el funcionamiento interno de Googlebot, su rastreador se encarga de explorar la web para encontrar, procesar e indexar contenidos en la Búsqueda. Una información de lo más valiosa para los profesionales SEO, y para cualquier persona interesada en conocer cómo funcionan los engranajes de Google y cómo sacarles partido.
El encargado de desmitificar y acercarnos la realidad del rastreo, la obtención de datos y el procesamiento de los bytes, ha sido Gary Illyes, analista en el equipo de la Búsqueda de Google, a través de una publicación en el blog oficial de Google Search Central.
Una de las cosas que el gigante tecnológico ha querido aclarar es que Googlebot no es la totalidad de su infraestructura de rastreo. Tal y como explica Illyes: «A principios de la década de 2000, Google tenía un solo producto, por lo que teníamos un solo rastreador. El nombre “Googlebot” se popularizó. Pero hoy en día, Googlebot es simplemente un usuario de algo que se asemeja a una plataforma de rastreo centralizada».
Esto significa que, actualmente, Googlebot no es el único identificador que utiliza Google. Mientras que Googlebot es el nombre que usa la plataforma cuando trabaja para el equipo de Search (la Búsqueda), esa misma infraestructura utiliza otros nombres de rastreador para servicios como Google Shopping o AdSense. Puedes acceder a más información sobre los nombres de rastreadores más relevantes de Google aquí.
En la publicación, Gary Illyes ha explicado hasta qué punto Googlebot puede rastrear un sitio web, exponiendo los límites de bytes que este rastreador puede procesar según el tipo y el formato del archivo. Y es que, cada cliente (rastreador) de la infraestructura de rastreo de Google tiene un perfil de configuración diferente y, por ende, límites distintos.
«Cada cliente de la infraestructura de rastreo necesita configurar ciertos ajustes para sus solicitudes. Estos ajustes incluyen la cadena del agente de usuario, qué tokens de agente de usuario buscarán en robots.txt y cuántos bytes obtendrán de una sola URL».
Actualmente, los límites de Googlebot son los siguientes:
Cabe señalar que para aquellos rastreadores que no especifican un límite, este se establece en los 15 MB de forma predeterminada, independientemente del tipo de contenido. Por su parte, «los rastreadores de imágenes y videos suelen tener un amplio rango de valores umbral, que depende en gran medida del producto que estén buscando. Por ejemplo, la búsqueda de un favicon podría tener un límite muy bajo, a diferencia de la búsqueda de imágenes».
Una vez que Googlebot comienza a rastrear tu contenido de una URL individual, esto es lo que sucede:
Si bien Illyes explica que una carga útil de HTML de 2 MB es enorme, y lo más probable es que nunca alcanzases ese límite, también advierte de la importancia de no dejar que un código demasiado pesado desplace tu contenido útil: «Si tu página incluye imágenes base64 incrustadas demasiado pesadas, bloques masivos de CSS o JavaScript integrados en el código, o comienza con megabytes de menús, podrías desplazar accidentalmente tu contenido textual real o los datos estructurados críticos más allá de la marca de los 2 MB. Si esos bytes cruciales no se descargan, para Googlebot, simplemente no existen».
Por último, Illyes ha recopilado una serie de consejos que deberías aplicar para garantizar que Googlebot pueda recuperar y comprender tu contenido de manera eficiente. Estas son las siguientes:
«El rastreo no es magia; es un intercambio de bytes altamente orquestado y escalable. Al comprender cómo nuestra infraestructura central de obtención de datos recupera y limita esos bytes, puedes asegurarte de que el contenido más importante de tu sitio siempre se incluya», concluye Illyes.
Foto: generada con Nano Banana 2
No se han encontrado artículos relacionados.
Your email address will not be published. Required fields are marked *
Δ