Above the fold: qué es y por qué importa
Above the fold es la zona visible de tu web sin hacer scroll. Aprende qué elementos incluir, qué dice el eye-tracking y cómo optimizarla para convertir...

La indexación web es el proceso mediante el cual los motores de búsqueda —Google, Bing, otros— descubren, analizan y almacenan el contenido de las páginas de un sitio web en su base de datos (el índice). Solo las páginas indexadas pueden aparecer en los resultados de búsqueda.
El proceso completo tiene tres fases:
Que Google rastree tu página no garantiza que la indexe. El proceso de selección de qué páginas entran al índice depende de factores de calidad, señales técnicas y la relevancia percibida del contenido.
Para un negocio online, la indexación es el prerequisito de cualquier estrategia SEO. No puedes posicionar una página que Google no ha indexado. Por eso, entender y controlar qué se indexa es una base imprescindible.
El crawler principal de Google se llama Googlebot. Opera de forma continua, visitando páginas ya conocidas para detectar cambios y descubriendo nuevas páginas a través de los enlaces que encuentra en las páginas que ya conoce.
Google descubre nuevas páginas principalmente de tres formas:
Google asigna a cada sitio un presupuesto de rastreo (crawl budget): el número de URLs que Googlebot visitará en un período determinado. Para sitios grandes, esto es relevante: si tienes 50.000 páginas pero el crawl budget es de 5.000 páginas/día, hay páginas que Googlebot no visitará con frecuencia.
El crawl budget se optimiza eliminando páginas de baja calidad, evitando URLs duplicadas y estructurando bien la arquitectura de enlaces internos.
El índice de Google no es una copia exacta de la web. Es una base de datos estructurada que almacena señales sobre cada página: contenido, palabras clave, estructura, autoridad, velocidad, experiencia de usuario, señales de enlazado. Cuando alguien hace una búsqueda, Google no rastrea la web en tiempo real: consulta su índice y ordena los resultados por relevancia.
Es el problema más frecuente: páginas que deberían estar en el índice pero no están. Las causas más comunes son:
<meta name="robots" content="noindex"> en el HTML o en la cabecera HTTP impide la indexación. A veces se aplica por error en producción tras una migración o un despliegue.El contenido duplicado es una de las causas más comunes de problemas de indexación. Google intenta no indexar la misma información dos veces, por lo que cuando detecta contenido duplicado o muy similar entre varias URLs, selecciona una como canónica y puede dejar de indexar las demás.
Las fuentes habituales de duplicados son:
/pagina vs /pagina/)www?sort=price, ?color=rojo)La solución es implementar etiquetas canonical (<link rel="canonical" href="URL-preferida">) que indican a Google cuál es la versión que debe indexar.
Es más frecuente de lo que parece. Un entorno de staging con noindex global puede desplegarse en producción por error. Una migración puede transferir etiquetas noindex de la versión anterior. Un plugin de SEO mal configurado puede aplicar noindex a categorías enteras.
La verificación periódica de que las páginas importantes están indexadas es una práctica de mantenimiento técnico básica.
Si la etiqueta canonical apunta a sí misma correctamente, no hay problema. Pero si apunta a una URL errónea, si hay cadenas de canonicals que se contradicen, o si el canonical y el sitemap apuntan a URLs diferentes, Google puede confundirse y tomar decisiones de indexación impredecibles.
Si tu servidor responde lentamente a las peticiones de Googlebot, el crawl budget se consume más rápido y menos páginas se rastrean. Un servidor lento puede ser la causa de que páginas nuevas tarden semanas en indexarse.
Google Search Console (GSC) es la herramienta gratuita de Google para monitorizar y gestionar la presencia de tu sitio en los resultados de búsqueda. Es la fuente de datos más directa para verificar el estado de indexación.
En GSC > Indexación > Páginas, encontrarás un resumen de:
Las razones más comunes que aparecen en el informe de no indexadas:
| Razón en GSC | Significado |
|---|---|
| Excluida por etiqueta "noindex" | La página tiene meta noindex activo |
| Página alternativa con etiqueta canónica correcta | Google eligió la versión canónica de esta URL |
| No se ha rastreado (descubierto pero no rastreado aún) | Está en cola, aún no visitada |
| Rastreado pero no indexado actualmente | Google la vio pero decidió no indexarla por calidad |
| Redirigida | La URL redirige a otra |
| Error 404 (no encontrada) | La URL no existe |
La herramienta de Inspección de URL en GSC permite verificar el estado exacto de cualquier URL específica: si está indexada, cuándo fue rastreada por última vez, qué versión renderizó Google, y si hay algún problema técnico.
También permite solicitar el rastreo inmediato de una URL, útil cuando publicas contenido nuevo y quieres que Google lo indexe rápido.
Un sitemap XML es un archivo que lista las URLs de tu sitio que quieres que Google conozca y rastree. Enviarlo en GSC es una buena práctica, especialmente para sitios con muchas páginas o arquitectura compleja.
El sitemap debe incluir solo las URLs que quieres indexar: excluye páginas de error, con noindex, duplicados o páginas de baja calidad. Un sitemap que incluye URLs problemáticas no daña directamente la indexación, pero envía señales confusas.
El archivo robots.txt vive en la raíz del dominio (tudominio.com/robots.txt) y contiene instrucciones para los crawlers sobre qué rutas no deben rastrear.
Lo que robots.txt puede hacer:
Lo que robots.txt NO puede hacer:
Un error habitual es bloquear en robots.txt rutas que contienen recursos (CSS, JS) que Google necesita para renderizar las páginas correctamente. Bloquear el acceso a recursos de diseño puede hacer que Google vea una versión rota de la página.
Una revisión mensual del informe de páginas no indexadas permite detectar problemas nuevos antes de que se acumulen. Presta especial atención a caídas súbitas en el número de páginas indexadas, que pueden indicar un error técnico.
El sitemap debe generarse automáticamente y actualizarse cuando publicas o eliminas contenido. Herramientas como Next.js, Yoast (WordPress) o Screaming Frog pueden generarlo. Después de cualquier cambio estructural importante, verifica que el sitemap está actualizado y sin URLs erróneas.
Toda página que quieras indexar debe ser accesible a través de al menos un enlace interno desde una página ya indexada. Las páginas huérfanas (sin enlaces internos) son difíciles de descubrir y menos prioritarias para Googlebot.
Las páginas con poco contenido, contenido duplicado o contenido de baja calidad diluyen la calidad percibida del dominio y consumen crawl budget. Mejor tener menos páginas de alta calidad que muchas páginas que Google decide no indexar.
Cada página debería tener una canonical que apunte a sí misma o a su versión preferida. Verifica que los canonicals no crean bucles y que son consistentes con el sitemap.
La indexación correcta es el prerequisito técnico de cualquier estrategia de visibilidad online. Sin páginas indexadas, no hay tráfico orgánico. Y sin tráfico orgánico, no hay usuarios que optimizar.
Para conectar la salud técnica de tu sitio con la optimización de la experiencia de los usuarios que sí llegan, conoce nuestro servicio de agencia CRO.
Si quieres un diagnóstico rápido de los problemas técnicos que pueden estar afectando tu visibilidad o conversión, prueba Scan&Boost.
Adrià Vidal, CRO specialist en Boost.
Above the fold es la zona visible de tu web sin hacer scroll. Aprende qué elementos incluir, qué dice el eye-tracking y cómo optimizarla para convertir...
Una auditoría web identifica qué está frenando tu conversión, tu velocidad y tu visibilidad. Aprende qué áreas analizar, qué herramientas usar y cómo...
El diseño centrado en el usuario pone las necesidades reales del cliente en el centro de cada decisión de diseño. Aprende sus principios, proceso y...