← Volver al artículo

Transparencia

Google aclara que robots.txt no impide que una página aparezca en sus resultados

Afirmaciones verificadas

  • Aunque Google no rastrea ni indexa el contenido bloqueado por robots.txt, puede encontrar e indexar las URLs bloqueadas si existen enlaces hacia ellas en la Web.

    Estado: Verificada (fuente primaria)

  • El archivo robots.txt está en la raíz del protocolo y del dominio.

    Estado: Verificada (fuente primaria)

  • El archivo robots.txt no se hereda entre subdominios ni entre dominios padre e hijo; cada página queda afectada por un único archivo robots.txt.

    Estado: Verificada (fuente primaria)

  • Google ignora las líneas no válidas del archivo robots.txt, incluido el BOM Unicode al inicio del archivo.

    Estado: Verificada (fuente primaria)

  • Google recomienda usar noindex o proteger la página con contraseña como alternativas para evitar que una página aparezca en los resultados de búsqueda, en lugar de robots.txt.

    Estado: Verificada (fuente primaria)

  • Google suele almacenar en caché el contenido del robots.txt durante hasta 24 horas, periodo que puede ampliarse si hay fallos de actualización como timeouts o errores 5xx.

    Estado: Verificada (fuente primaria)

  • Google también describe robots.txt, en su ayuda de Search Console, como un archivo para evitar que los motores de búsqueda rastreen una URL o sitio.

    Estado: Verificada (fuente primaria)

  • Las reglas del archivo robots.txt se aplican solo al host, protocolo y puerto donde está alojado el archivo.

    Estado: Verificada (fuente primaria)

  • Robots.txt indica a los rastreadores qué URLs pueden acceder y se usa sobre todo para evitar sobrecargar el sitio con solicitudes; no sirve para impedir que una página aparezca en Google.

    Estado: Verificada (fuente primaria)

  • Si Google no puede obtener una nueva versión del robots.txt, durante las primeras 12 horas deja de rastrear el sitio pero sigue intentando recuperar el archivo.

    Estado: Verificada (fuente primaria)

  • Si Google sigue sin poder obtener una nueva versión del robots.txt tras las primeras 12 horas, durante los 30 días siguientes usa la última versión válida almacenada mientras continúa intentando descargar una nueva.

    Estado: Verificada (fuente primaria)

  • Si un sitio no tiene archivo robots.txt, Google puede rastrear todas las URLs del sitio.

    Estado: Verificada (fuente primaria)

Transparencia — Google aclara que robots.txt no impide que una página aparezca en sus resultados · El Forum