¿Tu WooCommerce deja entrar a GPTBot? Compruébalo en dos minutos
Casi todo el mundo mira el robots.txt, y casi nunca es ahí donde está el problema. Aquí van los comandos exactos para comprobar si ChatGPT puede leer tu tienda, y las cuatro cosas que lo bloquean de verdad.
Es la conversación de este año, y siempre empieza igual: «mi tienda no aparece en ChatGPT, algo tendrá el robots.txt».
Fui a comprobarlo. Cogí las tiendas WooCommerce que pude verificar de verdad —confirmando primero con la Store API que lo eran, no fiándome del aspecto de la web— y les miré el robots.txt una a una.
Ninguna bloqueaba a GPTBot. Ni a ClaudeBot, ni a PerplexityBot. Casi todas servían el robots.txt de serie de WordPress, que no menciona a ningún rastreador de IA por su nombre.
Es una muestra pequeña y lo digo por delante: no es un estudio, es una comprobación. Pero apunta a algo que encaja con todo lo demás que veo: el robots.txt casi nunca es el culpable, y mientras miras ahí no estás mirando donde duele.
Lo que WordPress escribe de serie
Si no has tocado nada, WooCommerce no genera un robots.txt propio: lo genera WordPress, virtual, y dice más o menos esto:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://tutienda.com/wp-sitemap.xml
Eso es todo. User-agent: * incluye a GPTBot, y Disallow: /wp-admin/ no le impide leer tus productos. Ese archivo permite el paso.
Así que si tu tienda no sale en ChatGPT, el motivo está en otro sitio. Y son cuatro.
1. Cloudflare, que bloquea sin decírtelo
Este es, con diferencia, el más común y el más invisible.
Desde julio de 2025 Cloudflare bloquea los rastreadores de IA por defecto en los dominios nuevos que se dan de alta, y ofrece un botón de un clic para bloquearlos en los que ya existían. Mucha gente lo pulsó en su momento, o lo tenía puesto sin saberlo porque venía activado.
Lo importante es dónde bloquea: en el borde, antes de llegar a tu WordPress. Tu robots.txt sigue diciendo que sí. Tu servidor responde 403. Y como tú navegas con un navegador normal, no ves nada raro nunca.
Se arregla en el panel de Cloudflare, en Security → Bots → AI Scrapers and Crawlers. Si lo que quieres es que la IA te encuentre, ahí tiene que estar desactivado el bloqueo.
2. La casilla que se quedó puesta desde las obras
En Ajustes → Lectura de WordPress hay una casilla que dice «Disuade a los motores de búsqueda de indexar este sitio».
Si está marcada, WordPress reescribe tu robots.txt entero y lo deja así:
User-agent: *
Disallow: /
Eso es un portazo a todo el mundo: Google, Bing, GPTBot, ClaudeBot, todos. Y es sorprendentemente frecuente, porque se marca mientras se construye la tienda y luego nadie se acuerda de quitarla.
Compruébalo ahora mismo: abre tutienda.com/robots.txt en el navegador. Si ves Disallow: / a secas, lo has encontrado.
3. El WAF del hosting o un plugin de seguridad
Muchos firewalls miran el user-agent y cortan lo que no reconocen, o aplican límites de peticiones tan estrechos que el rastreador se lleva un 429 y no vuelve. Los plugins de seguridad con la opción de «bloquear bots falsos» hacen lo mismo con los buenos.
Este no se ve en ningún archivo. Solo se ve probando.
4. Que la ficha se pinte con JavaScript
Este no es un bloqueo, pero el resultado es idéntico.
GPTBot no ejecuta JavaScript. Si el precio, el stock o la descripción de tu producto los pinta el navegador después de cargar, el rastreador ve el hueco. La página se carga con un 200 perfecto y por dentro no hay nada que citar.
Cómo comprobarlo tú, en dos minutos
Esto es lo único que hace falta. Pide tu tienda haciéndote pasar por GPTBot y compáralo con lo que recibe un navegador.
curl -s -o /dev/null -w "GPTBot: %{http_code}\n" -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" https://tutienda.com/
curl -s -o /dev/null -w "Navegador: %{http_code}\n" -A "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/124.0 Safari/537.36" https://tutienda.com/
Cómo leer el resultado:
- Los dos 200 — te dejan entrar. Sigue leyendo, porque queda la parte importante.
- Navegador 200, GPTBot 403 / 429 / 503 — ahí está. Alguien lo bloquea en el borde: Cloudflare, el WAF o el hosting. Ese es tu problema.
- Los dos 403 — no es cosa de la IA; tu servidor rechaza cualquier cosa que no parezca un navegador completo.
Repítelo con una ficha de producto, no solo con la portada: es lo que de verdad quieres que la IA pueda leer, y a veces la portada pasa y las fichas no.
Y para saber si hay contenido de verdad o solo el esqueleto:
curl -s -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" https://tutienda.com/producto/lo-que-sea/ | grep -c "€"
Si eso devuelve 0, el precio lo está pintando JavaScript y el rastreador no lo ve.
Cómo dejarles pasar, y decirlo claro
Aunque User-agent: * ya los incluye, merece la pena nombrarlos uno a uno. Es explícito, sobrevive a que alguien añada reglas más adelante, y deja constancia de tu intención:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://tutienda.com/wp-sitemap.xml
Merece la pena distinguirlos, porque no hacen lo mismo:
- OAI-SearchBot es el que construye el índice con el que ChatGPT responde cuando busca en la web. Si solo vas a dejar entrar a uno, que sea este.
- ChatGPT-User es el que entra en el momento en que un usuario pega tu enlace o pide «mira esta tienda».
- GPTBot es el de entrenamiento. Es el que más se bloquea por principio, y es una decisión legítima: no afecta a que te citen hoy.
Ojo: si usas un plugin de SEO que gestiona el robots.txt, edítalo desde ahí y no subiendo un archivo, o el plugin lo pisará.
La parte que se le escapa a casi todo el mundo
Que te dejen entrar no es lo mismo que te puedan citar.
Un rastreador que llega a tu tienda se encuentra un catálogo repartido en cientos de páginas, con la navegación, el menú, el aviso de cookies y el pie por delante. Para responder «¿dónde compro una figura de Goku por menos de 50 €?» necesita saber qué vendes, a cuánto y si te queda stock. Sacar eso navegando ficha a ficha es caro, y normalmente no lo hace.
Por eso existe el llms.txt: un solo archivo, en la raíz de tu dominio, que dice qué eres y qué vendes en un formato que un modelo lee de un tirón. Es la diferencia entre que te mencionen de pasada y que respondan «cuesta 24,90 € y está disponible aquí».
Lo contamos entero, con el código para generarlo desde tu catálogo, en cómo poner un llms.txt en WooCommerce.
Orden para hacerlo hoy, de mayor a menor impacto:
- Abre
tutienda.com/robots.txt. Si poneDisallow: /, ve a Ajustes → Lectura y quita la casilla. Es un minuto y lo arregla todo. - Lanza los dos
curlde arriba, con la portada y con una ficha de producto. - Si GPTBot recibe 403, mira Cloudflare antes que nada.
- Cuando ya te dejen entrar, dales algo que leer.
¿Tu tienda pierde ventas por búsquedas que no encuentran nada?
WildRock añade a tu WooCommerce un buscador que entiende lo que tus clientes quieren decir, y te dice en euros cuánto te está generando. Plugin gratuito, sin tocar código.
Seguir leyendo
Sinónimos en el buscador de WooCommerce: 495 búsquedas en cero por escribirlo distinto
«blue lock» encuentra 22 productos; «bluelock», cero. Medido hoy en una tienda real: seis palabras que el cliente escribe de otra forma que el catálogo sumaron 495 búsquedas en 68 días, y la tienda tenía cero sinónimos configurados. Cómo encontrar los tuyos y arreglarlos hoy.
Por qué Google Analytics no te dice lo que pasa en tu tienda
Medido hoy en una tienda WooCommerce real: 47.956 búsquedas en un mes, y ninguna cambió la URL, que es lo único que mira Google Analytics para detectar una búsqueda. Tampoco sabría cuáles devolvieron cero resultados: su evento no lleva ese dato. Aquí está qué se le escapa a GA en una tienda y cómo registrarlo tú hoy, con un mu-plugin de 30 líneas.
