Saltar al contenido principal
SEO técnico

Cómo configurar robots.txt

9 min de lectura

Tu archivo robots.txt controla qué partes de tu sitio pueden acceder los rastreadores de los motores de búsqueda. Un robots.txt mal configurado puede bloquear páginas importantes para que no sean indexadas o desperdiciar el presupuesto de rastreo en URLs de poco valor. Esta guía te enseña cómo configurarlo correctamente, probarlo y evitar los obstáculos comunes que dañan el SEO.

Guía paso a paso

1

Comprende los conceptos básicos de robots.txt

Robots.txt es un archivo de texto plano en la raíz de tu sitio (example.com/robots.txt) que utiliza directivas para guiar a los rastreadores. Las dos directivas principales son User-agent (a qué rastreador se aplica la regla) y Disallow (qué rutas bloquear). Un robots.txt vacío o ausente significa que todos los rastreadores pueden acceder a todo.

2

Identifica qué bloquear

Bloquea las URLs que desperdician el presupuesto de rastreo sin proporcionar valor SEO: páginas de administración, resultados de búsqueda interna, áreas de inicio de sesión, páginas de carrito y pago, versiones de impresión y URLs de filtro con muchos parámetros. Nunca bloquees archivos CSS, JavaScript o de imagen que los motores de búsqueda necesitan para renderizar tus páginas correctamente.

3

Escribe tus reglas de robots.txt

Comienza con User-agent: * para aplicar reglas a todos los rastreadores. Usa Disallow para las rutas que deseas bloquear y Allow para crear excepciones dentro de los directorios bloqueados. Recuerda que las reglas distinguen entre mayúsculas y minúsculas y utilizan la coincidencia de rutas con comodines (*) y marcadores de fin de URL ($).

4

Añada la referencia a su sitemap

Incluya una directiva Sitemap que apunte a su XML sitemap: Sitemap: https://example.com/sitemap.xml. Esto ayuda a los motores de búsqueda a descubrir su sitemap incluso si no lo han encontrado por otros medios. Puede listar múltiples sitemaps si su sitio utiliza archivos de índice de sitemap.

5

Pruebe antes de implementar

Utilice el probador de robots.txt de Google Search Console para verificar sus reglas antes de publicarlas. Pruebe URLs específicas para confirmar que las páginas importantes son accesibles y que las páginas bloqueadas devuelven el resultado esperado. Una sola regla mal ubicada puede bloquear accidentalmente todo su sitio.

6

Monitoree la actividad de rastreo

Después de la implementación, monitoree el informe de estadísticas de rastreo en Google Search Console para verificar que los patrones de rastreo coincidan con sus intenciones. Compruebe que las URLs bloqueadas no aparezcan en los resultados de búsqueda y que las páginas importantes se rastreen con la frecuencia adecuada.

Consejos pro

  • El robots.txt bloquea el rastreo, pero no la indexación. Si una página bloqueada tiene backlinks externos, Google aún puede indexar la URL (sin contenido). Utilice etiquetas meta noindex para evitar la indexación.
  • Utilice el carácter de final de cadena $ para bloquear tipos de archivo específicos: Disallow: /*.pdf$ bloquea todos los archivos PDF sin afectar a otras URLs que contengan '.pdf' en la ruta.
  • Mantenga su robots.txt simple. Las reglas complejas con muchas excepciones son difíciles de mantener y fáciles de romper. Si descubre que su robots.txt supera las 20-30 líneas, considere utilizar etiquetas noindex en su lugar.

Errores comunes a evitar

Bloquear archivos CSS y JavaScript

Google necesita renderizar sus páginas para evaluarlas correctamente. Bloquear archivos CSS o JS impide el renderizado, lo que significa que Google ve una página rota. Nunca bloquee los recursos necesarios para el renderizado de la página.

Utilizar robots.txt para ocultar contenido sensible

El robots.txt es de acceso público: cualquiera puede leerlo. Usarlo para ocultar paneles de administración o directorios privados en realidad anuncia su existencia. Utilice autenticación y noindex para contenido verdaderamente privado.

Bloquear accidentalmente todo el sitio

Un solo 'Disallow: /' bajo 'User-agent: *' bloquea a todos los rastreadores de todo su sitio. Esto puede ocurrir durante el desarrollo o la migración. Siempre verifique dos veces que no haya reglas generales activas accidentalmente en producción.

Cómo Keyword Kick facilita el proceso

  • Generador interactivo de robots.txt con plantillas preestablecidas para plataformas CMS comunes
  • Verificaciones de auditoría del sitio que marcan problemas en robots.txt, incluyendo recursos importantes bloqueados
  • Análisis de capacidad de rastreo que muestra qué páginas están bloqueadas y si eso es intencional

Preguntas frecuentes

¿Es necesario el robots.txt para SEO?

No, no es necesario. Sin un archivo robots.txt, los motores de búsqueda rastrearán todo lo que puedan encontrar. Solo necesita uno si desea bloquear secciones específicas para los rastreadores o si su sitio es lo suficientemente grande como para gestionar el presupuesto de rastreo.

¿El robots.txt evita que las páginas aparezcan en los resultados de búsqueda?

No de forma fiable. El robots.txt evita el rastreo, pero Google aún puede indexar la URL si encuentra enlaces que apunten a ella. El resultado indexado mostrará la URL y el título, pero no la descripción. Utilice una etiqueta meta noindex para evitar completamente la aparición en la búsqueda.

¿Con qué frecuencia verifican los motores de búsqueda el robots.txt?

Google generalmente almacena su robots.txt en caché hasta por 24 horas. Es posible que los cambios no surtan efecto de inmediato. Si necesita que Google lo vuelva a buscar con urgencia, puede utilizar el probador de robots.txt en Search Console para solicitar una actualización.

Guías relacionadas

Listo para poner estas estrategias en acción? Keyword Kick te da las herramientas para implementar todo lo aprendido.

Empieza gratis