El crawl budget es la cantidad de páginas que Google rastrea en tu sitio en un periodo dado. No es un problema para la mayoría de webs, pero en sitios grandes decide qué se indexa y qué no. Se optimiza eliminando el desperdicio (facetas, parámetros, redirecciones en cadena, soft 404) antes que intentando conseguir más rastreo.
Qué es el crawl budget
El crawl budget, o presupuesto de rastreo, es el número de URLs que Googlebot rastrea en tu sitio durante un periodo determinado. No es una cifra que Google publique ni un contador que puedas consultar: es el resultado de combinar dos variables que sí puedes influir.
Crawl rate limit y crawl demand
El crawl rate limit es el techo que Google se autoimpone para no tumbarte el servidor. Googlebot mide cómo responde tu web: si responde rápido, sube el ritmo; si empieza a tardar o a devolver errores 5xx, lo baja. Es una cortesía técnica, y es la parte que se arregla con infraestructura.
El crawl demand es cuánto quiere rastrearte Google. Depende de la popularidad de tus URLs, de la frecuencia real con la que cambian y de lo actualizado que esté su índice respecto a tu sitio. Es la parte que se gana con autoridad y con contenido que de verdad se mueve.
El crawl budget es la intersección: Google rastrea lo que quiere rastrear, hasta donde tu servidor aguanta. Subir uno sin el otro no sirve de nada. Un servidor rapidísimo con contenido que no le interesa a nadie no se rastrea más.
Qué NO es el crawl budget (los mitos que repite el sector)
Conviene quitar de en medio cuatro cosas que se repiten mucho y son falsas:
- No es una cuota fija que se agota. No hay un número de páginas al día que Google reparta y que se acabe a media tarde.
- No mejora por enviar el sitemap más veces. El sitemap ayuda al descubrimiento, no aumenta el presupuesto.
- Rastrear no es indexar. Una página puede rastrearse cien veces y no indexarse nunca, y al revés: puede estar indexada y rastrearse una vez al año.
- No se compra ni se fuerza. Las herramientas que prometen «aumentar tu crawl budget» están vendiendo humo o están vendiendo lo que aquí explicamos gratis.
A quién le importa de verdad
Esta es la sección que casi ningún artículo del sector se atreve a escribir, porque implica decirle a mucha gente que esto no va con ellos.
El umbral real: cuántas URLs hacen falta para preocuparse
La propia documentación de Google es clara: si tu sitio tiene menos de unos pocos miles de URLs, Google lo va a rastrear entero sin problema. El crawl budget no es tu cuello de botella.
Nuestra regla práctica, por si quieres un número:
- Menos de 1.000 URLs: olvídate. Si tienes problemas de indexación, la causa es otra (calidad, canonicalización, enlazado).
- Entre 1.000 y 10.000 URLs: merece una revisión puntual, sobre todo si hay filtros o parámetros.
- Más de 10.000 URLs: sí, es un frente de trabajo con impacto medible.
- Más de 100.000 URLs: es de las primeras cosas que hay que mirar, por delante del contenido.
Ecommerce, portales y webs con facetas
Los tipos de sitio donde el crawl budget se convierte en el problema principal comparten una característica: generan URLs solos.
Un ecommerce con filtros combinables, un portal inmobiliario con búsquedas por zona, precio y habitaciones, un agregador de eventos con calendario, un clasificado con ordenaciones. En todos ellos, el catálogo real puede tener 5.000 elementos y las URLs rastreables ser 400.000.
Cuándo es una pérdida de tiempo
Si tienes un blog corporativo de 80 artículos y tus páginas nuevas tardan en indexarse, el crawl budget no es la causa. Mira antes:
- Si la página tiene
noindexo está bloqueada sin que lo sepas. - Si está enlazada desde algún sitio o es huérfana.
- Si el contenido aporta algo que justifique que Google la guarde.
Trabajar el crawl budget en una web pequeña es optimizar el cuello de botella equivocado.
Cómo gastan tu presupuesto Googlebot y los bots de IA
Googlebot: qué prioriza y cómo se adapta
Googlebot no rastrea al azar. Prioriza por popularidad de la URL, por frecuencia de cambio observada y por profundidad de clic desde la home.
Y se adapta rápido: si publicas a diario, aumenta la frecuencia; si tu web lleva dos años igual, la reduce. Esa adaptación es también la razón por la que un sitio abandonado tarda tanto en recuperar rastreo cuando vuelve a moverse.
GPTBot, ClaudeBot, PerplexityBot y CCBot
Aquí está lo que no cubre ninguno de los resultados que hoy están por delante en la SERP, y es un cambio real de los últimos dos años: Googlebot ya no es el único que te consume recursos.
Los principales, con su función:
- GPTBot (OpenAI): recopila contenido para entrenamiento.
- OAI-SearchBot (OpenAI): rastrea para la funcionalidad de búsqueda, que es lo que devuelve resultados con enlace.
- ClaudeBot (Anthropic): rastreo para modelos de Anthropic.
- PerplexityBot (Perplexity): rastreo para su buscador con respuestas.
- CCBot (Common Crawl): rastreo abierto cuyo corpus usan muchos modelos.
- Google-Extended: no es un bot, es un control. Permite decirle a Google que no use tu contenido para entrenar Gemini sin afectar a tu posicionamiento en Búsqueda. Son dos decisiones separadas y conviene no confundirlas.
Cuánto rastrean de verdad y cómo medirlo en el log
No hay que creerse ninguna cifra publicada: esto se mide en tu propio servidor.
Filtra tus logs por user-agent y saca, por bot, el número de peticiones, las URLs distintas visitadas, los códigos de respuesta y el ancho de banda consumido. Con un mes de datos ya tienes la foto.
Lo que solemos encontrar: en sitios de contenido, la suma de los bots de IA representa una fracción nada despreciable del rastreo total, y en algunos casos supera a buscadores secundarios. En sitios pequeños es irrelevante.
Bloquearlos o no: la decisión y sus consecuencias
No hay una respuesta única, y quien te la dé sin preguntarte nada no la tiene.
Argumentos para dejarlos pasar: si te rastrean, pueden citarte. Aparecer como fuente en una respuesta de ChatGPT o Perplexity trae visibilidad y, cada vez más, tráfico cualificado. Bloquearlos garantiza que no te citen.
Argumentos para bloquear: si tu negocio es vender el contenido, o si el consumo de recursos es real y no obtienes nada a cambio.
La postura que aplicamos: en la mayoría de proyectos, dejarlos pasar. La IA es un canal dentro del SEO, no un enemigo, y la partida se juega en aparecer. Bloquear por precaución es renunciar a la visibilidad sin obtener nada.
Matiz importante: una cosa es el entrenamiento y otra la búsqueda con citación. Puedes bloquear GPTBot (entrenamiento) y dejar OAI-SearchBot (búsqueda), o usar Google-Extended para el entrenamiento de Gemini sin tocar tu Búsqueda. La decisión granular está disponible y casi nadie la usa.
La configuración concreta la tienes en la guía de robots.txt para buscadores y bots de IA.
Qué se está comiendo tu presupuesto ahora mismo
Esta es la parte accionable. En casi todas las auditorías que hacemos, el problema no es que Google rastree poco: es que rastrea mucha basura.
Facetas, filtros y parámetros
El primer sospechoso, y con diferencia el mayor. Cinco filtros de cuatro valores combinables generan más de mil URLs por categoría.
Señal de alarma: si en Search Console ves muchas más páginas rastreadas que URLs reales tienes, ya sabes dónde mirar.
Paginaciones infinitas y calendarios
Los calendarios de eventos son el caso extremo: un widget que permite navegar mes a mes puede generar URLs hasta el año 2085. Googlebot las sigue.
La paginación profunda tiene el mismo efecto en menor escala. A partir de cierta página nadie llega y el contenido no aporta.
Redirecciones en cadena y bucles
Cada salto de una cadena es una petición. Una cadena de cuatro redirecciones gasta cuatro veces lo que una directa, y Google deja de seguirlas después de unos cuantos saltos.
Las cadenas se acumulan solas con los años, sobre todo tras migraciones sucesivas donde nadie limpió las reglas antiguas. Es de lo más rentable de arreglar porque es puramente mecánico: se resuelven aplanando cada regla al destino final.
Soft 404 y páginas de adjunto
Soft 404 es una página que devuelve 200 pero está vacía o dice «no hay resultados». Google la rastrea una y otra vez porque el código le dice que está bien.
Las páginas de adjunto son un clásico de WordPress: por cada imagen que subes, se genera una URL con la imagen sola. Una web con 3.000 imágenes tiene 3.000 páginas de contenido pobre indexables. Se desactivan desde el plugin de SEO, y es de las primeras cosas que revisamos.
Contenido duplicado y canonicals ignorados
Cada versión duplicada es una URL que se rastrea. Y si tu canonical apunta a una página cuyo contenido difiere mucho, Google la ignora y rastrea las dos.
El detalle está en la guía de contenido duplicado.
Cómo optimizar el crawl budget paso a paso
Inventario real: sitemap frente a crawl frente a logs
Antes de tocar nada, tres listas y sus diferencias:
- Lo que dices que tienes: las URLs del sitemap.
- Lo que un bot encuentra: un crawl completo siguiendo enlaces.
- Lo que Google rastrea de verdad: tus logs.
Las diferencias son el diagnóstico. URLs en el crawl que no están en el sitemap: descubrimiento no controlado. URLs en logs que no están en el crawl: te llegan por enlaces externos o son restos antiguos. URLs en el sitemap que Google no rastrea: no le interesan.
Priorizar: qué URL merece ser rastreada
Con el inventario delante, clasifica todo en tres cajas: estratégicas (dinero y tráfico), de soporte (necesarias pero no objetivo) y prescindibles.
El objetivo es que el rastreo se concentre en las primeras. Nadie tiene un sitio sin páginas prescindibles: lo que distingue a un sitio bien optimizado es que esas páginas no se rastrean.
robots.txt, noindex y canonical (y cuál usar en cada caso)
El error más caro de todo el tema. Cada herramienta hace algo distinto:
| Quiero… | Uso | Ojo con |
|---|---|---|
| Que no lo rastree | robots.txt | Puede seguir indexado si le llegan enlaces |
| Que no lo indexe | noindex | Requiere que SÍ pueda rastrearlo para verlo |
| Consolidar duplicados | canonical | Es una señal, no una orden |
| Que desaparezca | 410 | Definitivo |
El error clásico: bloquear en robots.txt una página que tiene noindex. Si Google no puede rastrearla, no puede ver el noindex, así que puede quedarse indexada indefinidamente. Si quieres desindexar, primero deja rastrear.
Enlazado interno y profundidad de clic
Googlebot llega antes y más a menudo a lo que está cerca de la home. Cada nivel de profundidad reduce la frecuencia de rastreo.
Mide la profundidad de clic de tus URLs estratégicas. Si están a cinco o seis saltos, no es un problema de crawl budget: es un problema de arquitectura que se manifiesta como uno de crawl budget.
Velocidad de respuesta del servidor
Esta sí sube el techo. Googlebot ajusta su ritmo a tu tiempo de respuesta: si bajas el TTFB, aumenta las peticiones por segundo.
Ojo con la distinción: hablamos del tiempo de respuesta del servidor, no de las Core Web Vitals, que miden la experiencia del usuario. Para el rastreo importa lo rápido que tu servidor entrega el HTML, no lo rápido que pinta después. Las CWV importan, pero por otro motivo, y las tienes en su propia guía.
Sitemaps segmentados y lastmod honesto
Segmenta por tipo de contenido: uno de productos, uno de categorías, uno de artículos. Así el informe de cobertura te dice qué bloque tiene problemas en lugar de darte un total inútil.
Y el lastmod tiene que ser real. Si tu CMS pone la fecha de hoy en las 40.000 URLs cada noche, Google deja de hacerle caso. Un lastmod que miente es peor que no ponerlo.
Cómo medir y monitorizar el rastreo
Estadísticas de rastreo de Search Console
En Configuración, el informe de estadísticas de rastreo. Lo que mirar:
- Total de solicitudes: la tendencia importa más que el número.
- Tiempo medio de respuesta: si sube, tu rastreo baja.
- Por respuesta: el porcentaje de 200 frente al de 3xx, 4xx y 5xx. Mucho 3xx significa cadenas de redirección; mucho 4xx, enlaces rotos.
- Por finalidad: descubrimiento frente a actualización. Si casi todo es actualización, Google no está encontrando contenido nuevo.
Análisis de logs: qué mirar y con qué
Los logs son la única fuente que dice la verdad completa. Con un mes basta.
Las cuatro preguntas que respondes con ellos: qué URLs se lleva el grueso del rastreo, qué porcentaje va a páginas estratégicas, qué URLs rastrea Google que tú ni sabías que existían, y cada cuánto vuelve a tus páginas importantes.
La cuarta suele ser la reveladora. Descubrir que tu categoría principal se rastrea una vez cada tres semanas mientras un filtro de ordenación se rastrea a diario explica muchas cosas.
Señales de que la optimización está funcionando
- Baja el total de URLs rastreadas y sube el porcentaje que son estratégicas. El total bajando es buena señal si sube la calidad.
- Se acorta el tiempo entre publicar y ver la página indexada.
- Baja el porcentaje de respuestas 3xx y 4xx.
- En el informe de páginas, bajan las categorías de descartadas por duplicado o rastreada sin indexar.
Lo que no es señal: que suba el total de rastreo sin más. Rastrear más basura no es mejorar.
¿Tu sitio es lo bastante grande como para que esto importe?
Si tienes decenas de miles de URLs y sospechas que Google se está gastando el presupuesto en sitios que no tocan, es exactamente lo que miramos en una consultoría SEO: inventario, logs y plan de recorte priorizado.
Preguntas frecuentes
¿Qué es el crawl budget en SEO?
Es el número de URLs que Googlebot rastrea en tu sitio en un periodo dado. Resulta de combinar el límite que impone tu servidor (crawl rate limit) con el interés que tiene Google en tu contenido (crawl demand).
¿Cómo sé si tengo un problema de crawl budget?
Tres señales juntas: tienes más de 10.000 URLs, tus páginas nuevas tardan semanas en indexarse, y en Search Console ves muchas más páginas rastreadas que URLs reales. Con una sola no basta.
¿Cómo optimizo el crawl budget?
Por este orden: elimina el desperdicio (facetas, parámetros, cadenas de redirección, soft 404, páginas de adjunto), mejora el tiempo de respuesta del servidor, acorta la profundidad de clic de lo importante y segmenta los sitemaps con un lastmod honesto.
¿El crawl budget afecta al posicionamiento?
No de forma directa: no es un factor de ranking. Afecta de forma indirecta y a veces brutal, porque una página que no se rastrea no se indexa, y una que no está indexada no posiciona.
¿Bloqueo los bots de IA para ahorrar crawl budget?
En la mayoría de casos, no. Si te rastrean, pueden citarte, y esa visibilidad suele valer más que los recursos. Si decides limitarlos, hazlo con criterio: puedes separar entrenamiento de búsqueda con citación, que son cosas distintas.
¿Cuánto tarda en notarse una optimización de crawl budget?
Las primeras señales en el informe de rastreo, entre dos y cuatro semanas. El efecto en indexación de contenido nuevo, entre uno y tres meses según el tamaño del sitio.
¿El sitemap aumenta mi crawl budget?
No. Ayuda al descubrimiento, que es otra cosa. Un sitemap bien hecho hace que Google encuentre antes tus URLs, pero no hace que rastree más.


