Un motor de búsqueda con IA elige sus fuentes en tres etapas. Un índice de búsqueda convencional devuelve páginas candidatas para las consultas que escribió el modelo. Una etapa de clasificación divide esas páginas en pasajes y puntúa cada pasaje frente a la pregunta. Después, el modelo de lenguaje redacta la respuesta a partir de los mejores pasajes y añade citas a los que utilizó. Una página puede quedar fuera en cualquiera de las tres etapas, y la mayoría queda fuera en la primera.
Ningún proveedor publica la puntuación exacta, y esta varía entre ChatGPT search, Perplexity, Google AI Overviews y los demás. Lo que comparten es el proceso, y es el proceso lo que hace que algunas páginas se citen de forma fiable y otras se ignoren de forma fiable.
Etapa uno: el índice de búsqueda
El modelo no busca en toda la web. Envía consultas a un índice: el índice de Bing en el caso de ChatGPT search y Copilot, el propio de Google para AI Overviews y AI Mode, y una combinación de índices propios y con licencia para Perplexity. Solo se pueden recuperar las páginas que están en ese índice.
Las consultas las escribe el propio modelo. Una pregunta como "qué zapatillas de running son buenas para pies planos" puede convertirse en varias consultas sobre zapatillas de estabilidad, soporte del arco y marcas concretas, un comportamiento conocido como query fan-out. Cada consulta devuelve sus propias candidatas, así que se puede llegar a una página a través de una subpregunta que el usuario nunca escribió.
En esta etapa se aplican las señales de búsqueda habituales: relevancia para la consulta, autoridad del sitio, actualidad y si la página está indexada o no. Una página que aparece en la tercera página de resultados para una consulta rara vez se convierte en candidata. Una página bloqueada al rastreador del proveedor nunca es candidata.
Etapa dos: selección de pasajes
Las páginas candidatas se descargan y se cortan en pasajes. Un pasaje es un párrafo, una lista, una tabla o una sección corta. El sistema puntúa cada pasaje frente a la pregunta combinando la coincidencia de palabras clave y la similitud semántica, y a menudo aplica un reranker sobre las mejores candidatas.
La puntuación favorece los pasajes que responden a la pregunta por sí solos. En la práctica, eso significa:
- Una respuesta directa en la primera frase. El contexto puede venir después.
- Una idea por pasaje. Un párrafo que trata cuatro puntos coincide débilmente con cuatro preguntas en lugar de coincidir con fuerza con una.
- Detalles concretos: un número, una fecha, un nombre, un paso. Los pasajes vagos puntúan bajo porque se parecen a cualquier otro pasaje vago.
- Estructura sencilla. Las listas y las tablas son fáciles de extraer; el texto dentro de widgets interactivos o cargado solo mediante JavaScript puede no verse nunca.
Un pasaje también compite con pasajes de otras páginas que dicen lo mismo. Si diez páginas dan la misma respuesta, suelen ganar las de sitios en los que el sistema ya confía, y el resto resulta redundante.
Etapa tres: redacción y citas
El modelo recibe los pasajes seleccionados y la pregunta, y redacta la respuesta. Las citas se añaden mientras escribe: cuando una frase procede de un pasaje, se enlaza a ella la URL de ese pasaje. Un pasaje que llegó al modelo pero no se usó no recibe ninguna cita, así que ser recuperado no es lo mismo que ser citado.
Qué pasajes se usan depende de cómo compone el modelo la respuesta. Los pasajes que contienen el tipo de afirmación que la respuesta necesita, como una definición para una pregunta "qué es" o una lista de opciones para una pregunta "mejor", son los que acaban citados. Una página que trata el tema pero está redactada como una historia o una opinión a menudo se lee y luego se descarta.
Esta etapa también decide qué marcas se nombran. Ante una pregunta del tipo "mejores herramientas para X", el modelo enumera los nombres que aparecen en los pasajes que leyó. Una marca ausente de las páginas comparativas, los sitios de reseñas y los foros que devolvió el sistema de recuperación no aparece en la respuesta, diga lo que diga su propio sitio web.
¿Por qué las citas se concentran en unos pocos dominios?
En muchas preguntas, un pequeño grupo de dominios recibe la mayoría de las citas. Wikipedia, Reddit, YouTube, los grandes medios de noticias, los grandes comercios y los sitios de reseñas conocidos se repiten en casi todos los estudios sobre respuestas de IA, incluidas las estadísticas de búsqueda con IA que recopiló Searcherries.
El proceso explica el patrón. Esos sitios están en todos los índices, se posicionan bien para muchas consultas, tienen páginas estructuradas como respuestas directas y gozan de suficiente confianza como para que la etapa de clasificación los prefiera cuando varias páginas dicen lo mismo. Cada etapa filtra a su favor, y el efecto se acumula.
La consecuencia práctica es que la presencia en esos dominios cuenta tanto como la presencia en tu propio sitio. Un producto del que se habla en un hilo de Reddit, que aparece en un sitio de reseñas y que se describe en un artículo comparativo tiene tres vías más para entrar en la respuesta que uno que solo se describe en su propia página de inicio.
¿Qué puede hacer una página para ser seleccionada más a menudo?
Cada etapa sugiere un cambio.
Para el índice, asegúrate de que la página sea rastreable por los bots pertinentes, esté indexada en Google y Bing y se posicione para las subpreguntas que probablemente escribirá el modelo, no solo para el término principal.
Para la selección de pasajes, empieza cada sección con la respuesta, limita cada sección a un tema, usa encabezados que se lean como preguntas y pon los datos en listas y tablas en lugar de en prosa.
Para la cita, escribe el tipo de afirmación que pide la pregunta. Una página de definición debe definir en el primer párrafo. Una página comparativa debe nombrar las opciones y los criterios. Una página de precios debe indicar el precio.
Saber si algo de esto funciona es una cuestión de medición. El seguimiento de la visibilidad en IA ejecuta las mismas preguntas repetidamente en distintas plataformas y registra qué páginas y marcas se citan, lo que muestra directamente el resultado del proceso.