Diseño Web

El sitemap XML con fecha falsa pierde la confianza de Google

El sitemap XML de tu despacho puede llevar fechas de actualización falsas. Así es como Google deja de fiarse de esas marcas y rastrea menos tu blog.

El sitemap XML con fecha falsa pierde la confianza de Google

El sitemap XML es el archivo que le dice a Google qué páginas de tu web existen y cuándo cambiaste cada una por última vez. Para un despacho de abogados con decenas de páginas de área de práctica, de sede y de blog, ese archivo decide cuánto rastreo recibe cada sección y con qué prioridad. Un sitemap mal generado —con páginas que no deberían estar, fechas que no se corresponden con la realidad o enlaces rotos— no bloquea la web, pero la deja peor valorada ante el rastreador. Esto es lo que falla con más frecuencia y cómo comprobarlo en la tuya.

El sitemap XML es el archivo que lista las páginas que quieres que Google rastree, con la fecha de su última actualización. Google solo confía en esa fecha si es verificable: si dice que una página cambió ayer y lleva años igual, deja de hacerle caso y rastrea la web con menos frecuencia.

Qué URLs debe listar el sitemap XML

Un sitemap que incluya páginas que no deberían estar ahí hace tanto daño como uno incompleto. La regla es sencilla: solo deben aparecer las URLs canónicas e indexables que el despacho quiere posicionar —páginas de área de práctica, páginas institucionales y entradas de blog—, nunca páginas con etiqueta noindex, duplicados de contenido, resultados de filtros o páginas de paginación interna. Yoast SEO y RankMath ya excluyen automáticamente cualquier página marcada como noindex, así que si una sigue apareciendo en el sitemap el problema suele estar en la propia etiqueta, no en el plugin. Vale la pena revisarlo después de cualquier cambio de estructura, porque una categoría que se marcó noindex ayer puede llevar semanas publicada en el sitemap de hoy.

Por qué las páginas de sede no deben entrar

Si tu despacho tiene varias sedes y cada una repite la misma descripción de servicios cambiando solo la ciudad, esas páginas compiten entre sí por las mismas búsquedas y Google puede no saber cuál mostrar. La salida habitual es marcarlas como no indexables y dejar que una sola página central concentre la autoridad. Si haces eso, el sitemap XML tiene que reflejarlo: una página noindex que sigue apareciendo en el sitemap manda una señal contradictoria. Lo mismo pasa con las páginas de área de práctica cuando se generan en masa sin contenido propio: Google puede marcarlas como spam si detecta el patrón, y meterlas en el sitemap no arregla el problema de fondo.

El límite de 50.000 URLs por archivo

Google documenta un límite claro para cada archivo de sitemap: 50.000 URLs y 50 MB sin comprimir por archivo. Un despacho de abogados rara vez se acerca a esa cifra con sus propias páginas, pero sí puede llegar si el sitemap mezcla entradas de blog, páginas, categorías, etiquetas y archivos de autor en un único listado sin criterio. Cuando eso pasa, lo correcto no es recortar contenido a mano: es dejar que el propio sistema reparta las URLs en varios archivos y los agrupe bajo un índice, tal como describe Google para sitios con sitemaps grandes. Yoast y RankMath hacen esto solos desde hace años: generan un sitemap_index.xml que apunta a sitemaps separados por tipo de contenido, así que si tu despacho usa uno de los dos no tienes que vigilar el límite manualmente. El riesgo real aparece en plugins de maquetación o temas que generan su propio sitemap básico sin esa lógica.

La fecha de lastmod que Google deja de creer

La fecha de actualización no es cosmética. Google la usa para decidir qué URLs necesitan un rastreo más frecuente, pero solo si confía en ella: tiene que coincidir, de forma razonable, con la última vez que el contenido cambió de verdad —texto, enlaces o datos estructurados, no la fecha de copyright del pie de página—. Un sitemap que marca como actualizadas todas sus URLs cada noche, aunque nadie haya tocado el contenido, no engaña a Google: deja de ser una señal útil y Google empieza a ignorar esa fecha en todo el archivo. El problema típico en WordPress no es que alguien mienta a propósito: es un plugin de caché o un sitemap estático que se generó una vez y no se regenera cuando editas un artículo desde el panel. La fecha se queda congelada o, peor, el plugin de caché la sustituye por la fecha de la última limpieza de caché, que no tiene nada que ver con el contenido.

Qué plugin de WordPress actualiza la fecha solo

Yoast SEO y RankMath regeneran la fecha de cada URL en el momento en que se guarda el artículo, sin intervención manual, y lo documenta el propio fabricante en su ficha de ayuda sobre sitemaps XML. Si tu despacho edita contenido desde el panel de Autopress y el cambio llega a WordPress, esa fecha debería moverse sola el mismo día. Si usas un generador de sitemaps distinto —muchos temas incluyen uno propio, más básico— conviene comprobar que de verdad actualiza la fecha al editar, no solo al crear la entrada. Un sitemap que solo mira la fecha de publicación original es tan inútil para Google como uno con fechas inventadas: en ambos casos deja de reflejar cuándo cambió el contenido.

Cómo enlaza el robots.txt con tu sitemap

El robots.txt y el sitemap XML no son el mismo archivo, pero se apoyan: la convención es que el robots.txt incluya una línea Sitemap: con la URL completa del sitemap, así cualquier rastreador que visite la web por primera vez lo encuentra sin que nadie lo haya enviado a mano. El fallo habitual en WordPress no es que falte esa línea —los plugins de SEO la añaden solos— sino que una regla Disallow mal puesta en el mismo robots.txt bloquee justo la carpeta donde vive el sitemap, o bloquee las páginas que el sitemap intenta anunciar, lo que manda dos señales contradictorias a la vez.

Cómo comprobar que Google ya lee tu sitemap

Search Console tiene un informe propio para esto, dentro del apartado Sitemaps: muestra cuándo se leyó el archivo por última vez, cuántas URLs encontró y si hubo errores al procesarlo. Un estado de «no se pudo obtener» casi siempre señala un bloqueo en robots.txt o una URL del sitemap que devuelve un error del servidor, no un problema del propio archivo. Conviene cruzarlo con el informe de indexación de páginas, que distingue cuántas de las URLs que mandaste en el sitemap están realmente indexadas: un sitemap que Google lee bien pero que apenas se traduce en páginas indexadas apunta a un problema de calidad de contenido, no de sitemap.

Errores que vacían la indexación de tu blog

Los errores que de verdad vacían una indexación no suelen ser dramáticos uno por uno: son pequeños y se acumulan hasta que Search Console marca cientos de URLs como «detectada, actualmente sin indexar». Los más frecuentes en un blog jurídico:

  • URLs que devuelven un error 404 o 500 porque el artículo se borró o movió sin actualizar el sitemap.
  • Páginas con etiqueta noindex que siguen apareciendo en el listado, normalmente duplicados de sede o de categoría.
  • Redirecciones 301 encadenadas: el sitemap sigue apuntando a la URL vieja, que redirige a otra que redirige a la definitiva.
  • Páginas de área de práctica huérfanas, sin ningún enlace interno que lleve hasta ellas salvo el propio sitemap.

Esto último es el más fácil de pasar por alto: una página que solo existe para Google porque la arquitectura de la web la esconde del menú y de los enlaces internos no transmite la misma autoridad que una integrada de verdad en la navegación, aunque el sitemap la anuncie correctamente.

Preguntas frecuentes sobre el sitemap XML

¿Dónde está el sitemap XML de mi web?

La mayoría de instalaciones de WordPress con Yoast o RankMath lo publican en /sitemap_index.xml, justo en la raíz del dominio. Si tu web no usa ninguno de los dos, prueba también con /sitemap.xml: es la ruta que más plugins y temas respetan por convención, aunque no hay un estándar que la obligue.

¿Hay que enviar el sitemap a Search Console?

Conviene hacerlo una vez, aunque Google también lo encuentra solo si está declarado en el robots.txt. Enviarlo desde el informe Sitemaps de Search Console da acceso a los avisos y a las cifras de lectura que de otro modo tendrías que deducir del rastreo normal.

¿Cuántos sitemaps necesita un despacho de abogados?

Uno solo, con su índice automático, es suficiente salvo que el blog supere varios miles de entradas. Yoast y RankMath ya dividen el listado por tipo de contenido —páginas, entradas, categorías— sin que haga falta configurar nada adicional.

Fuente: Google Search Central — Crea y envía un sitemap

De la idea a la acción

¿Tu despacho necesita decisiones más claras?

Cuéntanos dónde quieres llegar. Pondremos estrategia, tecnología y medición al servicio de ese objetivo.

Hablemos