Cómo Reducimos + 2 Millones de URLs Inútiles en un eCommerce Multilingüe

Millones de Páginas que Nadie Debería Ver
Uno de los mayores errores que puede cometer un eCommerce es permitir que Google rastree e intente indexar páginas que no tienen ningún valor SEO. Este fue exactamente el caso en esta tienda online de mobiliario internacional: más de 2.000.000 de URLs estaban siendo rastreadas sin posibilidad real de aparecer en Google.
¿Qué significa que una página sea «rastreadada pero no indexada»?
Cuando Google «rastrea» una página, simplemente la visita. Lo hace porque piensa que podría ser útil o nueva. Pero si ve que esa página es duplicada, vacía, redundante o está mal configurada, decide no indexarla, es decir, no mostrarla en los resultados de búsqueda.
Hasta aquí parece inofensivo. Pero no lo es.
El problema es que Google tiene un presupuesto limitado para rastrear cada web, lo que se llama crawl budget. Si ese presupuesto se gasta en basura técnica, Google ignora las páginas valiosas: tus productos reales, tus categorías principales, tus fichas bien trabajadas.
¿Qué Detectamos? 7 Grandes Fugas de SEO Técnico
Durante la auditoría inicial, usando Google Search Console y archivos de cobertura, detectamos:
✅ Más de 2 millones de URLs rastreadas y no indexadas
✅ URLs duplicadas por filtros, búsquedas, monedas o paginación
✅ Páginas multilingües mal tratadas como contenido duplicado
✅ Un sitemap lleno de basura técnica
✅ Productos obsoletos o sin descripción indexables
✅ Redirecciones en cadena y errores 3xx ocultos
✅ Canonicals mal puestos que confundían a Google
Ejemplos Reales del Desastre
Estos son ejemplos reales extraídos del informe:
https://oculto-por-confidencialidad.store/fr/47-paravents?q=Largeur-180cm&resultsPerPage=24https://oculto-por-confidencialidad.store/es/17-mesas-de-oficina-operativas-y-direccion?p=2&orderby=pricehttps://oculto-por-confidencialidad.store/ca/taules-escriptori?id_currency=2&q=Profunditat-75cm
Ninguna de esas URLs debería existir para Google. Son combinaciones de filtros, parámetros de búsqueda, moneda y ordenación que generan miles de versiones para cada categoría.
Bloqueo Inteligente y Cirugía Técnica
1. robots.txt: el muro de contención
Modificamos el archivo robots.txt para bloquear el acceso de Google a todas las URLs inútiles, conservando así el crawl budget para las páginas que realmente importan.
# Parámetros de búsqueda y filtrado
Disallow: /*?q=
Disallow: /*&q=
Disallow: /*?resultsPerPage=
Disallow: /*&resultsPerPage=
Disallow: /*?orderby=
Disallow: /*&orderby=
Disallow: /*?id_currency=
Disallow: /*&id_currency=
# Paginaciones duplicadas
Disallow: /*?p=
Disallow: /*&p=
Con esto, más de 2 millones de URLs dejaron de ser rastreadas en menos de un mes. Google empezó a centrarse en las páginas canónicas reales.
2. Canonicalización perfecta
Corrimos una auditoría línea por línea para asegurarnos de que:
Todas las páginas importantes (productos y categorías principales) usan
rel="canonical"apuntando a sí mismas.Todas las versiones con parámetros apuntan a la URL limpia.
Cada idioma canonicaliza solo su propia versión.
Ejemplo arreglado:/fr/47-paravents?q=Largeur-180cm → canonical apunta a /fr/47-paravents
3. Redirecciones auditadas una por una
Detectamos redirecciones en cadena, algunas con 3–4 saltos.
Eliminamos pasos intermedios y dejamos solo 301 directos.
Las páginas eliminadas sin sustituto ahora devuelven 404 o 410, como recomienda Google.
4. hreflang para dominar los idiomas
El sitio tiene versiones en 6 idiomas: español, inglés, francés, italiano, portugués y catalán. Pero Google no sabía cuál era cuál.
Implementamos etiquetas hreflang como esta en cada cabecera:
Esto eliminó los conflictos de duplicado entre idiomas y mejoró el posicionamiento internacional.
5. Revisión del sitemap completo
Se eliminó del sitemap cualquier URL que contuviera:
Parámetros (
?q=,&orderby=, etc.)Idiomas duplicados sin canonical
Productos sin contenido útil
Se generó un nuevo sitemap limpio, solo con productos y categorías reales, sin rastro de URLs sucias.
6. Paginación: control quirúrgico
Las URLs como ?p=2 ahora:
Solo se indexan si contienen productos útiles.
Llevan
rel="canonical"apuntando a sí mismas.Se enlazan internamente si forman parte de una categoría activa.
7. Depuración de productos basura
Más de 800 productos estaban indexables pero vacíos, sin descripción, sin stock o sin sentido.
Soluciones:
Los productos antiguos fueron eliminados o marcados 404.
Se revisó el sistema para evitar que PrestaShop genere páginas de producto si no hay stock ni contenido.
Impacto SEO en 30 Días
📉 -88% de URLs rastreadas innecesarias
📈 +41% de cobertura efectiva en GSC
🌍 +37% de visibilidad en versiones internacionales
💡 Google rastrea ahora solo el contenido útil del sitio
¿Tú también estás dejando que Google gaste tu presupuesto en páginas inútiles?
📩 Contáctanos y te hacemos una auditoría sin compromiso.







