La pila técnica detrás del SEO, AEO y GEO, Parte 2: robots.txt, schema y llms.txt

Parte 2 de 3 — empieza por la Parte 1

En la Parte 1 cubrimos el sitemap, JavaScript y CSS — la base que determina si una página puede ser alcanzada y renderizada correctamente. Esa capa lleva a un sistema hasta tu contenido. No le dice qué significa nada de eso, ni si siquiera tiene permitido usarlo. Ese es el trabajo de las tres piezas de esta parte: robots.txt, el marcado de schema y llms.txt.

robots.txt: control de tráfico para humanos, rastreadores y ahora, modelos de IA

robots.txt solía ser un archivo simple, en su mayoría ignorado: bloquear un par de carpetas de administración, apuntar al sitemap, listo. Eso ya no es cierto. robots.txt ahora hace un trabajo estratégico real frente a tres públicos distintos a la vez:

  • Rastreadores de búsqueda tradicionales (Googlebot, Bingbot) — comportamiento de indexación estándar, en gran parte sin cambios.
  • Bots de herramientas SEO y scrapers (Ahrefs, Semrush, MJ12 y similares) — muchos dueños de sitios ahora los bloquean explícitamente para preservar el presupuesto de rastreo y el ancho de banda para los bots que realmente alimentan el descubrimiento orientado al cliente, en lugar de herramientas externas de seguimiento de rankings.
  • Rastreadores de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, Amazonbot, y una lista de otros que crece rápido) — esta es la categoría más nueva y con más consecuencias. Un archivo robots.txt que bloquea a todos los bots en bloque, escrito antes de que existieran los rastreadores de IA, puede excluir accidentalmente a un negocio de ChatGPT, Perplexity, Gemini, y de cualquier otro canal de descubrimiento impulsado por IA sin que nadie se dé cuenta de que pasó.

Para el GEO en particular, robots.txt es ahora una palanca de visibilidad directa: si quieres que tu negocio sea recomendado dentro de respuestas generadas por IA, los rastreadores que construyen esas respuestas necesitan permiso explícito para leer tu sitio. Revisar robots.txt pensando específicamente en los rastreadores de IA — en lugar de tratarlo como un archivo de "configurar una vez y olvidar" — es uno de los cambios de mayor impacto y menor esfuerzo disponibles hoy para la visibilidad GEO.

El marcado de schema: la piedra de Rosetta para los sistemas de IA

Si el JavaScript y el CSS determinan si el contenido puede ser visto, el marcado de schema determina si puede ser entendido correctamente. El schema son datos estructurados — una capa legible por máquina añadida a una página que etiqueta explícitamente qué es cada cosa: esto es un negocio, esta es su dirección, esto es una reseña, esta es una pregunta frecuente, esta es su respuesta.

Sin schema, un rastreador queda deduciendo el significado a partir de texto sin estructurar y del diseño de la página — un proceso propenso a errores. Con schema, no hay ambigüedad. Esta es la inversión técnica de mayor impacto para AEO y GEO en particular, porque ambas disciplinas dependen de que un sistema extraiga un dato preciso y lo presente con confianza:

  • El schema FAQPage mapea el contenido de preguntas y respuestas casi directamente a cómo los sistemas de IA recuperan y muestran respuestas.
  • El schema LocalBusiness / Organization le da a los sistemas de IA una versión verificada y estructurada de tu nombre, dirección, horarios y servicios — exactamente los datos que a los asistentes les preguntan constantemente ("¿está abierto este lugar ahora?", "¿a qué se dedica este negocio?").
  • El schema Review / AggregateRating alimenta señales de confianza en las que se apoyan tanto los fragmentos de búsqueda tradicionales como los sistemas de recomendación de IA al comparar varios candidatos para una consulta.
  • El schema BreadcrumbList y Article/BlogPosting ayuda a los sistemas a entender la estructura del sitio y la jerarquía del contenido, lo cual afecta tanto a los resultados enriquecidos tradicionales como a la confianza con la que un sistema de IA atribuye una información a una página específica y creíble.

El schema no cambia lo que ve un humano en la página. Cambia con cuánta confianza y precisión una máquina — motor de búsqueda o modelo de IA — puede describirle a alguien más lo que hay en esa página. Esa distinción es todo el juego en AEO y GEO.

llms.txt: la nueva puerta de entrada para los motores generativos

llms.txt es la incorporación más reciente a esta pila, y existe específicamente para el GEO. Donde robots.txt le dice a los rastreadores qué tienen permitido acceder, llms.txt va un paso más allá: es un resumen conciso y curado de un sitio — escrito específicamente para grandes modelos de lenguaje — que apunta a las páginas más importantes, explica a qué se dedica el negocio, y le da a un sistema de IA una orientación rápida y confiable en lugar de obligarlo a reconstruir esa comprensión a partir de páginas rastreadas dispersas.

Piénsalo como la diferencia entre entregarle a alguien una pila de documentos sueltos y entregarle un resumen ejecutivo de una página con una tabla de contenidos. Ambos técnicamente contienen la misma información, pero uno se procesa más rápido, con más precisión, y con mucho menos riesgo de que un sistema de IA pase por alto o tergiverse algo importante.

La adopción de llms.txt todavía está en sus primeras etapas, y por eso mismo importa justo ahora — los sitios presentes en los pipelines de entrenamiento y recuperación de IA con archivos llms.txt limpios y actualizados tienen una ventaja real para convertirse en las fuentes por defecto de esos sistemas, de la misma forma en que los primeros en adoptar datos estructurados tuvieron una ventaja en los resultados de búsqueda enriquecidos años antes de que se volviera una práctica estándar.

El patrón a través de estos seis elementos — sitemap, JS, CSS, robots.txt, schema y llms.txt — es el mismo. Ninguno de ellos cambia lo que experimenta un visitante humano. Cada uno de ellos cambia lo que una máquina puede extraer, confiar y usar de forma confiable. Por eso mismo se pasan por alto: no hay una comparación visual de antes y después que mostrar, solo una diferencia en si tu negocio aparece o no en los lugares donde la gente cada vez más empieza su búsqueda.

Esto se ha convertido en trabajo central de infraestructura técnica para nosotros en cada industria a la que servimos — reconstruyendo sitemaps para que se auto-actualicen, auditando contenido dependiente de JavaScript, agregando schema capa por capa, y escribiendo archivos llms.txt desde cero para clientes que nunca han oído el término pero cuya competencia ya les lleva ventaja tranquilamente en esto.

Lo que viene en la Parte 3

El sitemap, JavaScript, CSS, robots.txt, schema y llms.txt cubren los seis pilares que la mayoría de la gente imagina cuando piensa en "SEO técnico". La Parte 3 analiza una séptima pieza fácil de pasar por alto — las cookies y el consentimiento — y luego une las siete en una sola lista de verificación de visibilidad técnica.

¿No estás seguro si tu robots.txt, schema o llms.txt están ayudando o perjudicando tu visibilidad en IA?

Revisaremos qué permiten realmente tus reglas para bots, auditaremos tu cobertura de schema, y construiremos o arreglaremos tu archivo llms.txt — para que nada esté excluyendo silenciosamente a los sistemas de IA.

Empezar

Empecemos con tu proyecto

Tu proyecto merece lo mejor. Cuéntanos qué necesitas y nosotros nos encargamos del resto. Completa los datos a continuación y nuestro equipo te responderá en las próximas 24 horas.