Generador de robots.txt Online: Crear Reglas para WordPress y Shopify, Bloquear Bots de IA (GPTBot, Claude-Web), Analizar robots.txt Existentes y Simular si un Bot Puede Rastrear una URL
Genera un robots.txt profesional en segundos con plantillas para WordPress, blog, tienda online y corporativo. Controla bot a bot: permite Googlebot y Bingbot, bloquea GPTBot (OpenAI), Claude-Web (Anthropic), Google-Extended y otros bots de IA. Analiza un robots.txt existente y detecta errores críticos. Simula si cualquier bot puede acceder a una URL específica.
Pega el contenido de tu robots.txt actual para detectar errores, analizar las reglas y verificar que Googlebot no esté bloqueado accidentalmente.
Prueba si un bot específico puede rastrear una URL según las reglas del robots.txt generado o del analizador.
Configura tu robots.txt y presiona Generar para ver el resultado
El archivo robots.txt en América Latina: qué es el Protocolo de Exclusión de Robots, por qué el 23% de los sitios WordPress en México tienen errores en su robots.txt según auditorías de agencias SEO de la región, y cómo evitar los errores más costosos
El robots.txt es un archivo de texto que reside en la raíz de cada dominio web (https://tudominio.com/robots.txt) y actua como una lista de instrucciones para los robots rastreadores (crawlers) que visitan el sitio. Sigue el Robots Exclusion Protocol (REP), un estándar de la industria que fue propuesto en 1994 y ha sido adoptado por todos los principales motores de búsqueda. Su importancia para el SEO es doble: primero, permite guiar a Googlebot y otros crawlers hacia el contenido que debe indexarse, y alejarlo del contenido privado, duplicado o de bajo valor (como páginas de paginación, cart de compras, URLs de autenticación). Segundo, un error en el robots.txt — como bloquear accidentalmente a Googlebot con Disallow: / — puede causar que todo el sitio desaparezca del índice de Google en semanas, con consecuencias devastadoras para el tráfico orgánico. Herramientas como Google Search Console (gratuita) permiten monitorear si hay problemas con el robots.txt, y el Analizador de esta herramienta detecta automáticamente el error más crítico: tener a Googlebot bloqueado.
La oleada de bots de IA y el debate sobre el consentimiento del contenido: por qué miles de editores de contenido en México, Colombia y Argentina están bloqueando GPTBot, Claude-Web y Google-Extended en su robots.txt para proteger su contenido editorial del entrenamiento de modelos de lenguaje
Desde 2023, los principales laboratorios de IA (OpenAI, Anthropic, Google DeepMind) han publicado los nombres de sus crawlers de recopilación de datos para entrenamiento, comprometindose a respetar el robots.txt. GPTBot es el bot de OpenAI para recopilar datos de entrenamiento de ChatGPT y GPT-4. Claude-Web es el bot equivalente de Anthropic. Google-Extended controla si el contenido puede usarse para entrenar los modelos Gemini. En respuesta, miles de editores web de todo el mundo — incluidos medios de comunicación, bloggers y agencias de contenido de México, Colombia y Argentina — han empezado a bloquear estos bots. La decisión es personal: algunos editores bloquean los bots de IA porque consideran que sus artículos son usados para entrenar sistemas que luego compiten con ellos respondiendo preguntas sin citar la fuente original. Otros los permiten esperando que sus sitios sean citados como fuente por los modelos de IA. Esta herramienta incluye la plantilla “Bloquear IA” que configura el bloqueo con un solo clic, y también permite seleccionar individualmente qué bots de IA bloquear.
robots.txt vs. noindex vs. canonical: la trinidad de control de indexación que todo SEO de México, Colombia y Argentina debe dominar para evitar contenido duplicado, páginas de paginación indexadas y débito de crawl innecesario
Existen tres mecanismos principales para controlar cómo Google indexa el contenido, y cada uno tiene una función específica. robots.txt con Disallow: evita que el bot descargue o rastree la URL. Si el bot no rastrea la página, no puede leer el meta noindex que esté en ella, lo que puede causar indexación inadvertida si hay enlaces externos apuntando a esa URL. Meta noindex: permite que el bot rastree la página, pero le indica que no la incluya en el índice. Ideal para páginas de paginación (/pagina/2/, /pagina/3/), etiquetas de WordPress, resultados de búsqueda interna y páginas de filtros de e-commerce. Canonical: le dice al bot que la versión “oficial” de la URL es otra URL, consolidando las señales de ranking. Ideal para contenido duplicado por parámetros de URL (?color=rojo, ?sort=precio). Para sitios WordPress en México con Yoast SEO o Rank Math: la combinación correcta es robots.txt para /wp-admin/ y áreas privadas, noindex para etiquetas y paginaciones, canonical para productos con variantes en WooCommerce.
¿Cómo funciona este generador de robots.txt?
La herramienta tiene tres módulos que trabajan juntos para el flujo completo de gestión del robots.txt.
Modo 1: Generador
Elige una plantilla (WordPress, Blog, Tienda Online, Corporativo o Bloquear IA). Configura bot a bot cuáles pueden rastrear (Allow), cuáles están completamente bloqueados (Block), o cuáles siguen las reglas del comodín * (Default). Agrega rutas adicionales a bloquear (Disallow) con el botón “Agregar ruta”. Ingresa la URL de tu sitemap y el Crawl-delay opcional. El resultado es un robots.txt listo para subir, que puedes copiar o descargar directamente.
Modo 2: Analizador
Pega el contenido de tu robots.txt actual. La herramienta lo parsea y detecta: si Googlebot está bloqueado (error crítico), si falta la directiva Sitemap (advertencia), si wp-admin/admin-ajax.php está permitido correctamente (WordPress). Muestra las reglas en formato visual por grupos de User-agent con colores para Allow (verde) y Disallow (rojo). El gráfico compara el número de reglas Allow vs. Disallow por bot.
Modo 3: Simulador
Ingresa la ruta a probar (ej: /wp-admin/configuracion/) y el bot a simular (Googlebot, GPTBot, etc.). La herramienta aplica el algoritmo de matching de robots.txt: compara la ruta contra todas las reglas del grupo aplicable, encontrando la regla más específica (la más larga que hace match), y muestra si el bot puede o no rastrear esa URL con la razón exacta.
3 Ejemplos Reales de Configuración de robots.txt en México, Colombia y Argentina
Cómo agencias SEO, bloggers y desarrolladores web en América Latina configuran el robots.txt según el tipo de sitio, los objetivos de indexación y el contexto competitivo de cada nicho
Redacción digital en Ciudad de México detecta con el Analizador que su robots.txt bloquea a Googlebot accidentalmente después de instalar un plugin de mantenimiento: cómo identificar y corregir el error que estaba hundiendo su tráfico orgánico
Un medio digital de noticias en CDMX notó una caída del 40% en el tráfico orgánico en 2 semanas. Usan el Analizador: pegan su robots.txt actual y la herramienta detecta inmediatamente: “⚠ Googlebot está bloqueado con Disallow: /”. El error fue causado por el plugin de modo mantenimiento “WP Maintenance Mode” que, al activarse, sobreescribió el robots.txt con: User-agent: *, Disallow: /. El error había pasado desapercibido durante 11 días. Usan el Generador con plantilla Blog para crear un robots.txt correcto: User-agent: *, Disallow: /wp-admin/, Allow: /wp-admin/admin-ajax.php. Suben el archivo. En Google Search Console verifican que el rastreo se normaliza en 3-5 días. Aprenden la lección: monitorear el robots.txt después de cualquier instalación de plugin.
Error crítico detectado: Googlebot bloqueado 11 días | Plugins de mantenimiento pueden sobreescribir robots.txt | Corregido en 3-5 díasTienda de electrodomésticos en Bogotá que usa WooCommerce: cómo configurar el robots.txt para bloquear las páginas de cart y checkout, bloquear los bots de IA y mantener indexadas las páginas de producto y categoría
Felipe administra una tienda WooCommerce de electrodomésticos en Bogotá. Objetivo: bloquear el rastreo de /cart/, /checkout/, /my-account/ y el área de administración. También quiere bloquear los bots de IA porque tiene descripiciones de producto exclusivas que no quiere que OpenAI o Google usen para entrenar sus modelos. Configuración con el Generador: Plantilla “Tienda Online” (ya incluye /cart/, /checkout/, /my-account/, /wp-admin/). Adicionalmente activa Block para: GPTBot, Claude-Web, Google-Extended, Bytespider. Agrega ruta personalizada: /wc-api/ (API de WooCommerce). Sitemap: https://electrodomesticos-bogota.co/sitemap_index.xml. Resultado: las páginas de productos y categorías siguen siendo indexadas por Google, el proceso de compra no se rastrea, y sus contenidos editoriales están protegidos de los crawlers de IA más comunes.
WooCommerce: /cart/ /checkout/ /my-account/ bloqueados | GPTBot + Claude-Web + Google-Extended: Block | Productos y categorías: indexadosAgencia SEO de Buenos Aires que audita el robots.txt de un cliente de bienes raíces: cómo identificar que las páginas de filtros (?precio=bajo&zona=palermo) están siendo rastreadas y generando contenido duplicado que daña el posicionamiento
La agencia de Valeria audita un portal inmobiliario de Buenos Aires. El Analizador muestra que no hay ningún Disallow para URLs con parámetros. Google Search Console muestra que Googlebot está rastreando miles de URLs del tipo /propiedades/?precio=bajo&zona=palermo&tipo=departamento, generando contenido prácticamente idéntico con diferentes combinaciones de parámetros. Solución en el Generador: agregan Disallow: /propiedades/*?* (bloquea todas las URLs de /propiedades/ con parámetros). Usan el Simulador para verificar: /propiedades/?precio=bajo → Bloqueada (correcto). /propiedades/departamento-palermo-venta/ → Permitida (correcto, son las URLs canónicas). El crawl budget mejora significativamente: Googlebot ahora rastrea las páginas de listado canónicas en lugar de gastar el presupuesto de rastreo en miles de URLs parametrizadas.
Portal inmobiliario: miles de URLs parametrizadas rastreadas | Disallow: /propiedades/*?* | Crawl budget mejoradoSitio web de una universidad privada en Santiago con intranet estudiantil y portal de matrícula: cómo bloquear las secciones privadas sin afectar la indexación de carreras, programas académicos y noticias públicas
El equipo web de una universidad en Santiago configura el robots.txt con la plantilla Corporativo del Generador. Bloquean: /intranet/ (portal de estudiantes), /registro/ (proceso de matrícula), /admin/, /api/, /privado/. Mantienen accesibles: /carreras/, /noticias/, /investigacion/, /contacto/, /admision/. Usan el Simulador para verificar: /intranet/mis-notas/ → Bloqueada. /carreras/ingenieria-civil/ → Permitida. /admision/proceso-postulacion/ → Permitida. También agregan el Sitemap del sitio institucional: https://universidad.cl/sitemap.xml. Desciden mantener AhrefsBot y SemrushBot en Default (sin bloquear) porque el equipo de marketing usa Ahrefs para monitorear la visibilidad de sus programas frente a la competencia.
Universidad: /intranet/ /registro/ /admin/ bloqueados | /carreras/ /noticias/ indexadas | AhrefsBot permitido para monitoreo SEOBlog de recetas peruanas con 15,000 artículos: cómo usar comodines en robots.txt para bloquear las miles de URLs de búsqueda interna, etiquetas por ingrediente y paginaciones que generan contenido duplicado para Googlebot
Carmen tiene un blog de recetas peruanas con más de 15,000 recetas. Google Search Console muestra que el 60% del crawl budget se desperdicia en: /buscar/?q=cebolla, /tag/aji-amarillo/page/2/, /recetas/page/15/. Configuración en el Generador: rutas adicionales personalizadas con comodines: /buscar/ (bloquea toda la búsqueda interna), /tag/*/page/ (bloquea paginaciones de etiquetas), /recetas/page/ (bloquea paginaciones del archivo principal), /author/ (bloquea páginas de autor). Verifica en el Simulador: /tag/lomo-saltado/page/3/ → ✅ Bloqueada. /recetas/lomo-saltado-tradicional/ → Permitida. Resultado en 3 semanas: el crawl de Googlebot en Search Console muestra 70% menos URLs rastreadas, pero las páginas de recetas individuales se rastrean con más frecuencia.
Blog 15k recetas: /buscar/ /tag/*/page/ /recetas/page/ bloqueados | Crawl budget: -70% páginas duplicadas | Recetas individuales más frecuentesSaaS B2B en Monterrey que quiere que Googlebot indexe su landing y blog de contenido, pero bloquear completamente el acceso a la aplicación web de usuarios registrados que está en el mismo dominio bajo /app/
La startup de Monterrey tiene en el mismo dominio: / (landing pública), /blog/ (contenido SEO), /app/ (la aplicación SaaS detrás del login). El objetivo es indexar / y /blog/, y bloquear completamente /app/ y cualquier ruta de la API. Generador, Plantilla Corporativo: Disallow: /app/, Disallow: /api/, Disallow: /auth/, Disallow: /dashboard/, Allow: / (explícito, opcional para mayor claridad). Simulador verifica: /app/reportes/ → Bloqueada. /blog/guia-gestion-inventarios/ → Permitida. /auth/login/ → Bloqueada. Resultado: Googlebot indexa todo el contenido de marketing y blog (que es el objetivo de SEO), pero nunca intenta rastrear las miles de rutas de la aplicación que requerirían autenticación y generarían errores 401 en Search Console.
SaaS: / y /blog/ indexados | /app/ /api/ /auth/ /dashboard/ bloqueados | Cero errores 401 en Search Console3 Consejos de Expertos en SEO Técnico para el robots.txt de Sitios en América Latina
Lo que los consultores SEO senior y los equipos técnicos de agencias digitales líderes de México, Colombia y Argentina aplican en sus auditorías de robots.txt para maximizar el crawl budget y proteger el contenido estratégico
Revisa tu robots.txt después de CADA actualización de plugin o tema de WordPress: los plugins de mantenimiento, caché y migración son las causas más comunes de robots.txt que bloquean Googlebot accidentalmente en sitios latinoamericanos
El error de robots.txt que más traías orgánicas destruye en sitios WordPress de México, Colombia y Argentina es enteramente prevenible con un simple hábito: revisar la URL https://tudominio.com/robots.txt en el navegador después de cualquier cambio de plugin o tema. Las situaciones donde el robots.txt puede romperse silenciosamente: activar un plugin de “modo mantenimiento” o “coming soon” (muchos generan un robots.txt que bloquea todo). Migrar el sitio con un plugin de duplicación (Duplicator, All-in-One WP Migration) que puede importar el robots.txt del sitio staging que tenía User-agent: *, Disallow: /. Activar la opción de WordPress en Ajustes > Lectura > Visibilidad en los motores de búsqueda (literalmente genera Disallow: /). Cambiando entre plugins SEO (Yoast a Rank Math) donde ambos intentan gestionar el robots.txt. El Analizador de esta herramienta detecta este error crítico automáticamente en segundos.
Usa el crawl budget inteligentemente: no bloquees todo lo que no quieres indexar, porque algunas páginas de WordPress necesitan ser rastreadas (aunque no indexadas) para que Google respete el meta noindex; el robot del 50% del crawl budget en LatAm se desperdicia en URLs de filtros y paginaciones sin comodines
El crawl budget es la cantidad de URLs que Googlebot rastrea en tu sitio en un período de tiempo. Para sitios grandes (más de 5,000 URLs) en México, Colombia y Argentina, el crawl budget es un recurso limitado y valioso. El error más común: bloquear con noindex las paginaciones de WordPress (/category/noticias/page/2/) pero no bloquearlas con Disallow en robots.txt. Resultado: Googlebot sigue rastreando miles de páginas de paginación (gastando crawl budget) y aunque no las indexa, no tiene tiempo para rastrear con suficiente frecuencia las páginas de producto o contenido nuevo. La solución: bloquear en robots.txt las URL patterns que nunca deben indexarse NI rastrearse: paginaciones (/page/*, /pagina/*), resultados de búsqueda interna (/buscar/?*), parámetros de filtros de e-commerce (?color=*, ?sort=*). Usar el Simulador para verificar que los comodines bloquean correctamente sin afectar las URLs canónicas.
Declara siempre el sitemap en el robots.txt: es la señal más rápida para que Google y Bing descubran todas tus URLs, y en sitios de LatAm donde el enlazado interno muchas veces no es perfecto, el sitemap en robots.txt puede ser la diferencia entre que se indexen el 60% o el 95% de tus páginas
La directiva Sitemap: https://tudominio.com/sitemap.xml en robots.txt es una de las configuraciones más simples y más frecuentemente omitidas por webmasters en América Latina. Aunque Google y Bing descubren los sitemaps también a través de Search Console y Bing Webmaster Tools, declararlo en robots.txt tiene ventajas adicionales: cualquier bot que respete el robots.txt (no solo Google) lo descubre y puede indexar más páginas. Es especialmente importante para sitios con estructuras de enlazado interno deficientes (comunes en tiendas WooCommerce grandes y portales de contenido en LatAm). Para WordPress: Yoast SEO genera el sitemap en /sitemap_index.xml, Rank Math en /sitemap_index.xml, All in One SEO en /sitemap.xml. Para verificar qué URL usa tu sitemap: intenta acceder a https://tudominio.com/sitemap_index.xml y https://tudominio.com/sitemap.xml y ve cuál responde con contenido XML. Esa es la URL que debes declarar en el robots.txt.
16 Preguntas Frecuentes sobre robots.txt
Generación, configuración, errores comunes, bots de IA y SEO técnico para sitios WordPress, Shopify y estáticos en México, Colombia, Argentina, Chile y toda América Latina
¿Qué es el archivo robots.txt?
Archivo de texto en la raíz del dominio (https://tudominio.com/robots.txt) que indica a los robots rastreadores qué URLs pueden o no pueden visitar. Sigue el Robots Exclusion Protocol, estándar adoptado por todos los buscadores desde 1994.
¿Cómo bloquear los bots de IA (GPTBot, Claude-Web)?
Agrega un bloque por cada bot: User-agent: GPTBot, Disallow: /. User-agent: Claude-Web, Disallow: /. User-agent: Google-Extended, Disallow: /. La plantilla “Bloquear IA” de esta herramienta configura los más comunes automáticamente.
¿Cuál es el robots.txt correcto para WordPress?
User-agent: *, Disallow: /wp-admin/, Allow: /wp-admin/admin-ajax.php, Sitemap: https://tudominio.com/sitemap_index.xml. NO bloquear /wp-content/ (contiene imágenes indexables).
¿Dónde sube el archivo robots.txt?
En la raíz de tu hosting: /public_html/ para Apache. Sube via FTP, cPanel File Manager o el gestor de archivos de tu hosting (Hostinger, HostGator, GoDaddy, etc.). Para WordPress con Yoast/Rank Math: usa el editor integrado del plugin.
¿Qué pasa si bloqueo Googlebot accidentalmente?
Google deja de rastrear el sitio y las páginas desaparecen del índice en semanas. Es el error SEO más grave. El Analizador de esta herramienta detecta este error automáticamente. Verifica siempre después de instalar plugins de mantenimiento.
¿Qué diferencia hay entre Disallow y noindex?
Disallow: el bot no rastrea la URL (no la descarga). noindex: el bot rastrea la página pero no la indexa. Si usas Disallow, Google no puede leer el noindex de esa página. Usa robots.txt para áreas privadas, noindex para páginas de bajo valor que deben ser rastreables.
¿Qué es el crawl budget?
La cantidad de URLs que Googlebot rastrea en tu sitio en un período de tiempo. Para sitios grandes, es un recurso limitado. Bloquear paginaciones, filtros y búsqueda interna en robots.txt libera crawl budget para las páginas importantes.
¿Cómo funciona el comodín * en robots.txt?
El asterisco (*) representa cualquier secuencia de caracteres. Disallow: /pagina-* bloquea cualquier URL que empiece con /pagina-. Disallow: /*?* bloquea cualquier URL con parámetros. El $ al final indica fin de URL: Disallow: /*.pdf$ bloquea todas las URLs que terminan en .pdf.
¿Debo bloquear AhrefsBot y SemrushBot?
Opcional. NO afecta el SEO en Google. Si usas estas herramientas para análisis: no los bloquees. Si no las usas y quieres que competidores no vean tu estructura de URLs fácilmente: blóquealos. Decisión estratégica, no técnica.
¿Para qué sirve la directiva Sitemap en robots.txt?
Informa a los bots la ubicación del sitemap XML: Sitemap: https://tudominio.com/sitemap.xml. Cualquier bot que respete el robots.txt descubrirá el sitemap. Es adicional a declararlo en Search Console y Bing Webmaster Tools.
¿Qué es el Crawl-delay y funciona con Google?
Indica segundos de espera entre peticiones del bot. Google lo ignora (usa su propia configuración en Search Console). Bing y otros bots sí lo respetan. Solo úsalo si tu servidor se ralentiza con el rastreo de bots específicos.
¿Qué genera Yoast SEO como robots.txt en WordPress?
User-agent: *, Disallow: /wp-admin/, Allow: /wp-admin/admin-ajax.php, Sitemap: https://tudominio.com/sitemap_index.xml. Si tienes Yoast, su robots.txt virtual sobreescribe el archivo físico. Edítalo en SEO Yoast > Herramientas > Editor de archivos.
¿robots.txt es lo mismo que .htaccess para bloquear bots?
No. robots.txt: protocolo de cortesía, bots legítimos lo respetan, bots maliciosos pueden ignorarlo. .htaccess: bloqueo real a nivel de servidor (HTTP 403). Para bots de buscadores: usa robots.txt. Para scrapers maliciosos: usa .htaccess o firewall.
¿robots.txt puede bloquear una sección de un subdominio?
Cada subdominio necesita su propio robots.txt. El robots.txt de tudominio.com NO se aplica a blog.tudominio.com. Para el subdominio, debes colocar https://blog.tudominio.com/robots.txt con las reglas correspondientes.
¿Cómo verificar que mi robots.txt funciona?
1. Visita directamente https://tudominio.com/robots.txt en el navegador. 2. Google Search Console > Configuración > robots.txt. 3. El Analizador de esta herramienta. 4. El Simulador para probar URLs específicas. Verifica siempre después de cualquier cambio de plugin o tema.
¿Es seguro bloquear bots de IA con robots.txt?
Sí, para tu SEO en Google y Bing. Bloquear GPTBot, Claude-Web y Google-Extended NO afecta el posicionamiento de tu sitio en los buscadores. Solo afecta si tu contenido se usa para entrenar modelos de IA. OpenAI, Anthropic y Google respetan el robots.txt para sus crawlers de entrenamiento.
Herramientas Relacionadas de SEO Técnico y Desarrollo Web
Aviso Legal y Transparencia Editorial
Esta herramienta genera robots.txt basado en las mejores prácticas del Robots Exclusion Protocol (REP). Los nombres de bots listados (GPTBot, Claude-Web, Google-Extended, etc.) son los nombres de User-Agent publicados oficialmente por sus respectivas empresas. El bloqueo mediante robots.txt es un protocolo de honor: los bots bien portados (Google, Bing, OpenAI, Anthropic) lo respetan, pero bots maliciosos o scrapers pueden ignorarlo. Para contenido verdaderamente sensible, usa autenticación real. El Simulador de rastreo implementa el algoritmo de matching de robots.txt según la especificación de Google (regla más específica gana), pero pueden existir diferencias en cómo diferentes bots implementan el estándar. Verifica siempre con Google Search Console para Googlebot. Para información oficial sobre el Robots Exclusion Protocol, consulta Google Search Central. Última actualización: julio 2026.