Google aclara que robots.txt no impide que una página aparezca en sus resultados
La guía oficial de Google Search Central precisa que este archivo solo controla el rastreo, no la indexación: una URL bloqueada puede seguir apareciendo en el buscador si hay enlaces externos hacia ella.
Logotipo metálico de Google instalado sobre una pared de mármol en una sede corporativa — imagen de archivo de El Forum, ajena al asunto de esta pieza; pendiente de sustituciónEl Forum · Fototeca de El Forum · OWN_WORK
Qué hace y qué no hace robots.txt según Google
La guía oficial 'Robots.txt Introduction and Guide', de Google Search Central, precisa que este archivo indica a los rastreadores qué URLs pueden acceder y sirve sobre todo para evitar sobrecargar el sitio con solicitudes de rastreo. No es, aclara Google, un mecanismo para impedir que una página aparezca en los resultados de búsqueda.
La razón: aunque Google no rastree ni indexe el contenido bloqueado por robots.txt, puede encontrar e indexar esa URL si existen enlaces hacia ella en otras partes de la web. La página puede así aparecer en el buscador aunque Google nunca haya accedido a su contenido. Para excluir realmente una página de los resultados, Google recomienda usar la etiqueta noindex o proteger el contenido con contraseña.
Si un sitio carece de archivo robots.txt, Google puede rastrear todas sus URLs. El archivo, además, no se hereda entre subdominios ni entre dominio padre e hijo: cada página queda sujeta a un único robots.txt, y sus reglas aplican solo al host, protocolo y puerto donde está alojado.
Cómo gestiona Google los fallos y el caché del archivo
Google suele mantener en caché el contenido de robots.txt hasta 24 horas, un plazo que se amplía si surgen fallos al actualizarlo, como tiempos de espera agotados o errores de servidor 5xx. También ignora las líneas no válidas del archivo, incluido el BOM Unicode -un carácter invisible que a veces se cuela al inicio del fichero- si aparece al comienzo.
Cuando Google no consigue obtener una nueva versión del archivo, detiene el rastreo del sitio durante las primeras 12 horas mientras sigue intentando descargarlo. Si el problema persiste, usa durante los 30 días siguientes la última versión válida que tenga almacenada, sin dejar de intentar la actualización.