¿Cómo configurar Robots.txt para permitir o impedir el rastreo de tu sitio web?
La aplicación Robots.txt de Waclis te permite controlar qué direcciones y secciones de tu Página web pueden ser rastreadas por Google y otros motores de búsqueda.
Puedes utilizar una configuración sencilla mediante las opciones “SI” y “NO”, o acceder al modo de edición mediante el ícono de lápiz para personalizar manualmente las instrucciones de tu archivo robots.txt.
Esta herramienta puede ayudarte, por ejemplo, a:
- Permitir que Google rastree tu Página web.
- Evitar el rastreo del subdominio gratuito mimarca.nextiendas.com.
- Utilizar únicamente tu dominio propio para el posicionamiento.
- Bloquear el rastreo de determinadas rutas o secciones.
- Permitir una página concreta dentro de una sección que se encuentra bloqueada.
- Definir reglas diferentes para determinados robots.
- Evitar que Google rastree contenido que no necesitas posicionar.
- Comprender y personalizar las instrucciones Allow y Disallow.
¿Qué es el archivo robots.txt?
robots.txt es un archivo de texto que contiene instrucciones destinadas a los robots o crawlers de los motores de búsqueda.
Normalmente puede consultarse agregando /robots.txt después del dominio de una Página web. Por ejemplo:
https://www.mimarca.com/robots.txt
Antes de rastrear las diferentes secciones de una Página web, los buscadores que respetan este protocolo pueden consultar este archivo para determinar qué rutas tienen permitido visitar.
Google utiliza principalmente robots.txt para determinar qué URLs puede o no puede rastrear.
Rastreo e indexación no son lo mismo
Antes de modificar robots.txt, es importante diferenciar estos dos conceptos.
Rastreo
Ocurre cuando Google u otro buscador visita una URL y analiza su contenido.
Indexación
Ocurre cuando el buscador incorpora información de esa URL a su índice y eventualmente puede mostrarla en los resultados de búsqueda.
El archivo robots.txt controla principalmente el rastreo.
Por este motivo, bloquear una URL mediante Disallow no garantiza que una dirección que ya era conocida por Google desaparezca inmediatamente de sus resultados. Google puede seguir conociendo esa URL a través de enlaces existentes, aunque no rastree su contenido.
IMPORTANTE: robots.txt no debe utilizarse como herramienta de seguridad o privacidad. Una página bloqueada para los robots puede continuar siendo visitada normalmente por cualquier persona que conozca su dirección. Para impedir realmente el acceso a determinada información se necesitan otros mecanismos de seguridad.
¿Qué direcciones puedes configurar en Waclis?
Las opciones disponibles dependerán de si utilizas únicamente el subdominio gratuito de Waclis o también tienes conectado un dominio propio.
Subdominio gratuito de Waclis
Todas las Páginas web cuentan con una dirección gratuita similar a:
https://mimarca.nextiendas.com
Desde la aplicación Robots.txt puedes decidir si deseas permitir o impedir que los motores de búsqueda rastreen esta dirección.
Dominio propio
Si conectaste un dominio propio, por ejemplo:
https://www.mimarca.com
la aplicación mostrará también una configuración independiente para ese dominio.
De esta manera puedes, por ejemplo:
- Impedir el rastreo de mimarca.nextiendas.com.
- Permitir el rastreo de www.mimarca.com.
Esta es normalmente la configuración recomendada cuando ya utilizas un dominio propio.
¿Cómo configurar Robots.txt?
1. Ingresa a la aplicación
Ingresa al Panel de Autogestión de tu Página web y abre la aplicación Robots.txt.
La pantalla mostrará las direcciones que actualmente puedes configurar.
2. Configura el subdominio gratuito
En la sección Subdominio, encontrarás una pregunta similar a:
¿Deseas que los motores de búsqueda accedan a “https://mimarca.nextiendas.com”?
Puedes seleccionar:
“SI”
Permite el rastreo del subdominio gratuito.
Esta opción es recomendable si todavía no tienes un dominio propio conectado y quieres permitir que Google y otros buscadores encuentren y rastreen tu Página web.
Ten en cuenta que permitir el rastreo no garantiza que la Página web aparezca inmediatamente en Google. Los motores de búsqueda determinan cuándo rastrear e indexar cada URL.
“NO”
Indica a los motores de búsqueda que no deben rastrear el subdominio gratuito.
Esta opción es recomendable cuando:
- Ya tienes conectado un dominio propio.
- Quieres utilizar únicamente tu dominio propio para posicionarte.
- No quieres que los buscadores rastreen el subdominio de Nextiendas.
- Quieres evitar que dos direcciones diferentes con contenido equivalente sean utilizadas por los buscadores.
Seleccionar “NO” no elimina ni desactiva el subdominio. La dirección continuará funcionando normalmente para las personas que ingresen directamente.
3. Configura tu dominio propio
Si tienes un dominio conectado, aparecerá una segunda sección denominada Dominio.
Por ejemplo:
¿Deseas que los motores de búsqueda accedan a “https://www.mimarca.com”?
Puedes seleccionar:
“SI”
Permite que los motores de búsqueda rastreen el dominio propio.
Esta es la configuración normalmente recomendada para una Página web publicada que deseas posicionar en Google.
“NO”
Indica a los motores de búsqueda que no deben rastrear el dominio.
Esta opción puede utilizarse cuando deliberadamente no deseas permitir el rastreo.
IMPORTANTE: seleccionar “NO” no convierte tu Página web en privada y tampoco impide que una persona ingrese directamente utilizando su dirección.
4. ¿Para qué sirve el botón de edición con el ícono de lápiz?
Además de las opciones simples “SI” y “NO”, Waclis permite acceder a la edición del archivo robots.txt.
Para hacerlo, haz clic en el botón con el ícono de lápiz correspondiente a la dirección que quieres configurar.
Al ingresar a la edición podrás visualizar y modificar manualmente el contenido del archivo robots.txt.
Esta opción está pensada para usuarios que necesitan una configuración más específica que simplemente permitir o impedir el rastreo de todo el sitio.
Por ejemplo, puedes utilizarla si quieres:
- Permitir el rastreo general del sitio.
- Bloquear únicamente una carpeta o ruta.
- Bloquear varias rutas diferentes.
- Permitir una URL dentro de una carpeta bloqueada.
- Aplicar reglas únicamente a determinados robots.
- Incorporar instrucciones más específicas mediante Allow y Disallow.
RECOMENDACIÓN: si no necesitas una configuración particular, utiliza las opciones “SI” y “NO” proporcionadas por Waclis. La edición manual es una herramienta avanzada y una configuración incorrecta podría impedir que los buscadores rastreen páginas importantes de tu sitio.
¿Cómo se estructura un archivo robots.txt?
Una configuración básica puede verse de esta manera:
User-agent: *
Allow: /
Cada línea tiene una función determinada.
¿Qué significa User-agent?
User-agent define a qué robot o grupo de robots se aplicarán las instrucciones que aparecen debajo.
Por ejemplo:
User-agent: *
El asterisco * significa:
Aplicar estas reglas a todos los robots que reconozcan esta configuración.
Es una de las configuraciones más utilizadas.
También es posible crear reglas para un robot específico.
Por ejemplo:
User-agent: Googlebot
En este caso, las reglas de ese grupo están dirigidas específicamente a Googlebot.
Google define User-agent como la instrucción que identifica a qué crawler se aplican las reglas.
¿Qué significa Allow?
La instrucción:
Allow:
indica una ruta que el robot tiene permitido rastrear.
Por ejemplo:
User-agent: *
Allow: /
La / representa la raíz del sitio.
Este ejemplo permite el acceso general al sitio para los robots a los que se aplica la regla.
Ejemplo
User-agent: *
Allow: /
Puede interpretarse como:
Todos los robots pueden rastrear las rutas de la Página web.
¿Qué significa Disallow?
Disallow indica las rutas que un robot no debe rastrear.
Por ejemplo:
User-agent: *
Disallow: /privado/
Esto significa:
Todos los robots pueden rastrear la Página web excepto las URLs cuya ruta coincida con /privado/.
Por ejemplo, podría afectar direcciones similares a:
https://www.mimarca.com/privado/
https://www.mimarca.com/privado/documento
https://www.mimarca.com/privado/archivo
Ejemplo 1: permitir el rastreo de todo el sitio
User-agent: *
Allow: /
¿Qué hace?
Permite que todos los robots alcanzados por esta configuración puedan rastrear el sitio.
¿Cuándo utilizarlo?
Cuando tienes una Página web pública y quieres permitir su rastreo general.
Ejemplo 2: impedir el rastreo de todo el sitio
User-agent: *
Disallow: /
¿Qué hace?
La / representa toda la estructura situada debajo de la raíz del sitio.
Por lo tanto:
Disallow: /
solicita que no se rastree ninguna URL del sitio.
¿Cuándo utilizarlo?
Solo cuando realmente deseas impedir el rastreo general de esa dirección.
ATENCIÓN: no utilices esta configuración en tu dominio principal si quieres que Google pueda rastrear tu Página web.
Ejemplo 3: impedir el rastreo de una carpeta
Supongamos que existe una ruta:
https://www.mimarca.com/pruebas/
Puedes utilizar:
User-agent: *
Disallow: /pruebas/
De esta manera, las URLs situadas bajo esa ruta quedan bloqueadas para los robots a los que se aplica la regla.
Por ejemplo:
/pruebas/
/pruebas/pagina-1
/pruebas/catalogo
Las demás rutas continúan disponibles para el rastreo.
Ejemplo 4: impedir el rastreo de varias rutas
Puedes incluir varias instrucciones Disallow.
Por ejemplo:
User-agent: *
Disallow: /pruebas/
Disallow: /interno/
Disallow: /temporal/
En este ejemplo se solicita a los robots que no rastreen ninguna de esas tres rutas.
No es necesario crear un nuevo User-agent para cada una si todas se aplican al mismo grupo de robots.
Ejemplo 5: bloquear una sección pero permitir una excepción
Aquí es donde Allow y Disallow pueden utilizarse juntos.
Supongamos que quieres bloquear:
/documentos/
pero dentro de esa carpeta existe un archivo público que quieres permitir:
/documentos/catalogo-publico.pdf
Podrías configurar:
User-agent: *
Disallow: /documentos/
Allow: /documentos/catalogo-publico.pdf
El objetivo de esta configuración es:
- Bloquear el rastreo general de /documentos/.
- Permitir específicamente /documentos/catalogo-publico.pdf.
Google evalúa las reglas según la ruta más específica que coincide con la URL y, ante determinados conflictos de igual especificidad, utiliza la opción menos restrictiva.
Ejemplo 6: aplicar una regla solamente a Googlebot
También puedes especificar un robot concreto:
User-agent: Googlebot
Disallow: /pruebas/
En este caso, ese grupo de instrucciones está dirigido a Googlebot.
Los demás robots no utilizan automáticamente esa regla específica.
Esta clase de configuración es más avanzada y solo debería utilizarse cuando tengas una necesidad concreta.
Ejemplo 7: bloquear determinadas imágenes para Google Imágenes
Google dispone de un crawler específico denominado Googlebot-Image.
Por ejemplo:
User-agent: Googlebot-Image
Disallow: /imagenes-privadas/
Esta configuración puede utilizarse para impedir que Googlebot-Image rastree las imágenes ubicadas dentro de esa ruta. Google documenta específicamente el uso de robots.txt para controlar el rastreo de archivos de imagen.
¿Qué significa el asterisco * dentro de una ruta?
El carácter:
*
puede utilizarse como comodín para representar cero o más caracteres.
Google y otros motores de búsqueda importantes admiten este tipo de coincidencia en las rutas de Allow y Disallow.
Por ejemplo:
Disallow: /*?orden=
podría utilizarse cuando se necesita definir una regla para URLs que coinciden con determinado patrón.
Estas configuraciones requieren mayor conocimiento de la estructura real de las URLs de tu Página web.
RECOMENDACIÓN: no copies reglas con comodines de otros sitios sin comprender qué URLs de tu Página web coincidirán con ellas.
¿Qué significa el símbolo $?
El carácter:
$
puede utilizarse para indicar el final de una URL o patrón.
Por ejemplo, Google documenta patrones similares a:
Disallow: /*.pdf$
En una configuración de este tipo, $ indica que la coincidencia debe terminar allí.
Es una herramienta avanzada que resulta útil cuando se necesita controlar determinados tipos de URLs.
Las mayúsculas y minúsculas son importantes
Las rutas utilizadas en Allow y Disallow distinguen entre mayúsculas y minúsculas.
Por ejemplo:
Disallow: /Productos/
y:
Disallow: /productos/
pueden representar rutas diferentes.
Por este motivo, debes copiar exactamente la estructura de la URL que quieras configurar.
¿Puedo agregar comentarios dentro del robots.txt?
Sí.
Puedes utilizar el símbolo # para incorporar comentarios.
Por ejemplo:
# Bloquear sección utilizada para pruebas
User-agent: *
Disallow: /pruebas/
El contenido situado después de # se interpreta como comentario y no como una regla de rastreo.
Esto puede resultar útil para recordar por qué agregaste determinada configuración.
¿Qué es la instrucción Sitemap?
El archivo robots.txt también puede indicar dónde se encuentra el sitemap del sitio.
Por ejemplo:
Sitemap: https://www.mimarca.com/sitemap.xml
A diferencia de Allow y Disallow, en Sitemap debe indicarse una dirección completa. Google, Bing y otros motores de búsqueda importantes admiten esta instrucción.
IMPORTANTE: este ejemplo es ilustrativo. No agregues una dirección de sitemap inventada. Debes utilizar la dirección real correspondiente a tu Página web.
Ejemplo de un robots.txt más completo
Una configuración personalizada podría verse así:
# Reglas generales
User-agent: *
# Permitir el sitio
Allow: /
# No rastrear áreas específicas
Disallow: /pruebas/
Disallow: /interno/
# Permitir una excepción
Allow: /interno/catalogo-publico.pdf
Esto significa:
- Las reglas se aplican a todos los robots alcanzados por User-agent: *.
- El sitio está permitido en términos generales.
- /pruebas/ no debe rastrearse.
- /interno/ no debe rastrearse.
- Se establece una excepción específica para /interno/catalogo-publico.pdf.
Configuración automática cuando conectas un dominio propio
Cuando conectas un dominio propio por primera vez, Waclis configura automáticamente:
| Dirección | Configuración |
|---|---|
| mimarca.nextiendas.com | NO |
| Dominio propio | SI |
De esta manera, se permite el rastreo del dominio propio y se impide el rastreo del subdominio gratuito.
Esto ayuda a concentrar el rastreo de los buscadores en la dirección que deseas utilizar públicamente.
¿Qué configuración recomendamos en cada caso?
Utilizo solamente el subdominio gratuito de Waclis
Configura:
- Subdominio: “SI”.
- No aparecerá una configuración de dominio propio.
De esta manera permites el rastreo de tu Página web utilizando la dirección gratuita de Waclis.
Tengo un dominio propio conectado
Configura:
- Subdominio: “NO”.
- Dominio propio: “SI”.
Esta es normalmente la configuración recomendada.
Por ejemplo:
mimarca.nextiendas.com → NO
www.mimarca.com → SI
No quiero que ninguna dirección sea rastreada
Configura:
- Subdominio: “NO”.
- Dominio propio: “NO”.
Recuerda que esto solamente modifica las instrucciones destinadas a los robots.
Tu Página web continúa siendo públicamente accesible si una persona conoce su dirección.
Quiero bloquear solamente algunas rutas
En este caso no necesitas bloquear todo el dominio.
Puedes utilizar el botón con el ícono de lápiz para acceder a la edición del robots.txt y utilizar instrucciones Disallow específicas.
Por ejemplo:
User-agent: *
Disallow: /pruebas/
Disallow: /temporal/
De esta manera, el resto del sitio puede continuar siendo rastreado.
Antes de modificar manualmente robots.txt
Ten en cuenta estas recomendaciones:
- No bloquees rutas si no sabes qué contenido contienen.
- No utilices Disallow: / en un dominio que quieres posicionar.
- Revisa cuidadosamente mayúsculas y minúsculas.
- Comprueba que las rutas comiencen con /.
- No copies configuraciones de otras Páginas web sin revisarlas.
- No bloquees archivos necesarios para que los buscadores interpreten correctamente tu Página web.
- Si realizas una configuración avanzada, vuelve a revisar el archivo completo antes de guardar los cambios.
Google advierte que bloquear recursos importantes puede dificultar la correcta interpretación de una página por parte de sus crawlers.
¿Cómo consultar el robots.txt publicado?
Puedes comprobar el archivo agregando:
/robots.txt
al final de tu dominio.
Por ejemplo:
https://www.mimarca.com/robots.txt
Si utilizas el subdominio gratuito:
https://mimarca.nextiendas.com/robots.txt
Recuerda que cada archivo robots.txt se aplica al host y protocolo en el que se encuentra publicado. Por ejemplo, el archivo correspondiente a www.mimarca.com no se aplica automáticamente a otro subdominio diferente.
¿Los cambios se reflejan inmediatamente en Google?
No necesariamente.
Después de modificar el archivo, los motores de búsqueda deben volver a consultarlo y posteriormente volver a rastrear las URLs correspondientes.
Google indica que normalmente almacena temporalmente en caché el contenido de robots.txt, generalmente durante un período de hasta aproximadamente 24 horas, aunque en determinadas situaciones puede conservarlo durante más tiempo.
Por este motivo, un cambio no necesariamente produce un efecto inmediato.
¿Cómo quitar el subdominio de Nextiendas de Google?
Si Google todavía muestra una dirección similar a:
https://mimarca.nextiendas.com
y ya utilizas un dominio propio, sigue estos pasos.
1. Impide el rastreo del subdominio
Ingresa a Robots.txt y configura:
- Subdominio: “NO”.
- Dominio propio: “SI”.
Aplica la configuración.
2. Ten en cuenta que robots.txt no elimina inmediatamente una URL
Si Google ya conocía o había indexado la dirección, modificar robots.txt no garantiza su eliminación inmediata.
Una URL bloqueada para el rastreo todavía puede ser conocida por Google a través de otros enlaces y, en determinados casos, continuar apareciendo en los resultados.
3. Si continúa apareciendo, contacta con Waclis
Si el resultado continúa apareciendo, puedes comunicarte con soporte e informar:
- Dirección completa del subdominio.
- Dominio propio actualmente conectado.
- Captura del resultado que aparece en Google.
- Palabras utilizadas para realizar la búsqueda.
Por ejemplo:
Subdominio:
https://mimarca.nextiendas.com
Dominio propio:
https://www.mimarca.com
El equipo podrá revisar el caso y determinar si corresponde realizar acciones adicionales.
Robots.txt no reemplaza a noindex
Esta diferencia es especialmente importante.
Si tu objetivo es:
“No quiero que el robot rastree esta URL”
puede utilizarse robots.txt.
Si tu objetivo es:
“No quiero que esta página aparezca en los resultados de Google”
robots.txt por sí solo no es la herramienta adecuada.
Google recomienda utilizar mecanismos de control de indexación como noindex cuando el objetivo es impedir que una página aparezca en los resultados. Además, Google no admite colocar una instrucción noindex directamente dentro de robots.txt.
Por ejemplo, no debes agregar esperando que funcione:
Noindex: /pagina/
Esta no es una directiva de robots.txt admitida por Google.
Preguntas frecuentes
¿Seleccionar “SI” hace que mi Página web aparezca inmediatamente en Google?
No.
Permite el rastreo, pero Google determina cuándo visitar, procesar e indexar las diferentes URLs.
¿Seleccionar “NO” elimina inmediatamente mi Página web de Google?
No.
La configuración controla el rastreo. Una URL que Google ya conoce puede continuar apareciendo durante un tiempo.
¿Mi Página web deja de funcionar si selecciono “NO”?
No.
El sitio continúa funcionando y las personas pueden ingresar directamente mediante su dirección.
¿Puedo editar manualmente robots.txt?
Sí.
Utiliza el botón con el ícono de lápiz correspondiente a la dirección que quieres configurar.
Desde allí puedes visualizar y modificar manualmente el contenido del archivo para crear reglas más específicas.
¿Para qué sirve Allow?
Allow indica una ruta que el robot puede rastrear.
Es especialmente útil cuando necesitas crear una excepción dentro de una sección que tiene una regla Disallow.
¿Para qué sirve Disallow?
Disallow indica una ruta que determinado robot no debe rastrear.
Por ejemplo:
Disallow: /pruebas/
solicita que no se rastreen las URLs correspondientes a esa ruta.
¿Qué significa Disallow: /?
User-agent: *
Disallow: /
solicita impedir el rastreo de todo el sitio para los robots incluidos en ese grupo.
Utilízalo con mucha precaución.
¿Qué significa User-agent: *?
El asterisco representa a todos los robots que coinciden con ese grupo general de reglas.
Por ejemplo:
User-agent: *
Disallow: /pruebas/
aplica la restricción /pruebas/ al grupo general de robots.
¿Tengo que escribir el dominio completo en Disallow?
No.
Las reglas Allow y Disallow utilizan rutas relativas al dominio donde está publicado el archivo.
Correcto:
Disallow: /pruebas/
No es necesario escribir:
Disallow: https://www.mimarca.com/pruebas/
¿Puedo bloquear solamente una página?
Sí.
Por ejemplo, si la URL fuera:
https://www.mimarca.com/pagina-temporal
podrías utilizar:
User-agent: *
Disallow: /pagina-temporal
Antes de hacerlo, recuerda evaluar si realmente necesitas impedir el rastreo o si tu objetivo es impedir la indexación, ya que son acciones diferentes.
¿Debo configurar el dominio propio y el subdominio en “SI”?
Normalmente no.
Si ambos muestran el mismo contenido y tienes un dominio propio, la configuración recomendada es:
- Dominio propio: “SI”.
- Subdominio gratuito: “NO”.
¿Qué sucede si todavía no tengo dominio propio?
Solamente verás la configuración correspondiente al subdominio gratuito de Waclis.
Si deseas que los motores de búsqueda puedan rastrear tu Página web, mantenlo en “SI”.
¿Puedo volver a permitir el rastreo más adelante?
Sí.
Puedes regresar a la aplicación Robots.txt, modificar nuevamente la configuración y aplicar los cambios.
Los motores de búsqueda deberán volver a consultar las instrucciones y rastrear las URLs antes de que todos los cambios puedan verse reflejados.
Resumen rápido
Si quieres que Google pueda rastrear toda tu Página web:
User-agent: *
Allow: /
Si quieres impedir el rastreo de todo el sitio:
User-agent: *
Disallow: /
Si quieres impedir solamente una carpeta:
User-agent: *
Disallow: /pruebas/
Si quieres bloquear una carpeta pero permitir una URL específica:
User-agent: *
Disallow: /documentos/
Allow: /documentos/catalogo-publico.pdf
Si utilizas un dominio propio en Waclis, normalmente recomendamos:
Dominio propio → SI
Subdominio Nextiendas → NO
Y si necesitas una configuración más específica, utiliza el ícono de lápiz para editar manualmente el archivo robots.txt.
¿Necesitas más ayuda?
Si este artículo no resolvió tu consulta, nuestro equipo puede ayudarte personalmente.
Soporte por WhatsApp