llms.txt y los bots de IA: qué dejar entrar.

Si bloqueas el crawler, no existes en el modelo. Y mucha gente lo bloquea sin saberlo. Guía técnica de los user-agents que importan, el nuevo estándar llms.txt y una plantilla lista para copiar.

Antes de optimizar nada, una pregunta incómoda: ¿estás seguro de que los modelos pueden leer tu web? Muchas empresas heredan un robots.txt restrictivo o un plugin de seguridad que bloquea bots — y sin querer se borran del mapa de la IA.

Por qué tu robots.txt decide si te citan

Los modelos con acceso a búsqueda (Gemini, ChatGPT con browsing) rastrean tu web en tiempo real con bots identificables. Si tu servidor les responde un 403 o tu robots.txt los excluye, no pueden citarte aunque tu contenido sea perfecto.

Los user-agents que importan

Estos son los crawlers que debes conocer y decidir conscientemente:

# Rastreo para CITAR en respuestas (déjalos entrar si quieres aparecer)
User-agent: OAI-SearchBot   # ChatGPT search
Allow: /

User-agent: Googlebot       # alimenta también a Gemini
Allow: /

# Rastreo para ENTRENAR modelos (decisión aparte)
User-agent: GPTBot          # OpenAI training
User-agent: ClaudeBot       # Anthropic training
User-agent: Google-Extended # Gemini training
Allow: /
!
Distinción clave: bloquear el entrenamiento (GPTBot, Google-Extended) NO es lo mismo que bloquear la citación (OAI-SearchBot, Googlebot). Puedes negarte a alimentar el modelo y seguir apareciendo en sus respuestas en vivo. Confundirlos es el error nº1.

Qué es llms.txt

llms.txt es un estándar emergente: un archivo en la raíz de tu dominio (/llms.txt) escrito en Markdown que le da al modelo un mapa limpio de tu sitio — qué páginas importan, qué eres y dónde está la información buena, sin el ruido del HTML.

# Tu Empresa
> Una frase clara de qué hacéis y para quién.

## Documentación
- [Qué es el GEO](https://tudominio.com/geo): definición y alcance
- [Planes y precios](https://tudominio.com/planes): comparativa de servicios

## Recursos
- [Blog](https://tudominio.com/blog): notas sobre GEO y modelos

Aún no todos los modelos lo consumen, pero el coste de publicarlo es media hora y la dirección del estándar es clara. Es la versión "GEO" del sitemap.

Plantilla lista para copiar

  1. Revisa tu robots.txt actual: busca bloqueos accidentales a los bots de la tabla.
  2. Decide explícitamente: ¿quiero aparecer (sí a search bots) y quiero entrenar (sí/no a training bots)?
  3. Publica un /llms.txt con tus 5–10 páginas clave.
  4. Verifica con los logs del servidor que los bots reciben 200, no 403.

El mejor contenido GEO del mundo no sirve de nada si el portero no deja pasar al modelo. Empieza por aquí: es la palanca más barata y la que más gente se salta.

Volver al blog