La búsqueda tradicional devuelve una lista ordenada de páginas web para las palabras que una persona escribió, y esa persona abre las páginas y las lee. La búsqueda con IA hace la lectura en nombre de la persona: un modelo de lenguaje envía consultas a un índice de búsqueda, extrae pasajes de las páginas que obtiene y redacta una respuesta que cita algunas de ellas. Ambas dependen del rastreo y la indexación de la web, y se diferencian en qué ordenan, qué muestran y qué tan estable es el resultado.
¿Cómo funciona la búsqueda tradicional?
Un buscador tradicional tiene tres etapas. Un rastreador, que es un programa que obtiene páginas siguiendo enlaces, descarga páginas de la web. Un indexador guarda el texto de cada página en un índice de búsqueda, una base de datos organizada para que las páginas se puedan encontrar por las palabras que contienen. Cuando alguien escribe una consulta, un sistema de clasificación puntúa las páginas que coinciden y las devuelve en orden.
La clasificación usa señales como el grado en que el texto de la página coincide con la consulta, los enlaces desde otros sitios, la calidad de la página y su actualidad. El resultado es una lista de enlaces, cada uno con un título y un fragmento breve. A partir de ahí, la persona elige qué enlaces abrir, lee las páginas y arma la respuesta en su propia cabeza.
¿Cómo produce una respuesta la búsqueda con IA?
La búsqueda con IA conserva el índice y coloca un modelo de lenguaje encima. Un modelo de lenguaje grande es una red neuronal entrenada con grandes cantidades de texto para predecir la siguiente palabra, lo que también le permite leer una pregunta y escribir una respuesta. El modelo lee la pregunta, la reescribe como una o más consultas de búsqueda y las envía a un índice.
Después de que el índice devuelve las páginas candidatas, el sistema sigue una secuencia fija:
- Obtener las páginas y quitar la navegación, los anuncios y otros elementos repetitivos.
- Dividir el texto restante en pasajes de unas pocas frases cada uno.
- Puntuar cada pasaje frente a la pregunta y quedarse con los que obtienen mayor puntuación.
- Entregar esos pasajes al modelo como contexto.
- Generar la respuesta y añadir citas a las frases que provienen de una fuente.
Este patrón de obtener primero los documentos y escribir a partir de ellos después se llama generación aumentada por recuperación. Así es como un modelo puede responder preguntas sobre acontecimientos recientes, precios o productos concretos que no estaban en sus datos de entrenamiento.
¿Cuáles son las principales diferencias?
Los dos sistemas comparten un índice, y casi todo lo que ocurre después del índice funciona de forma distinta.
| Búsqueda tradicional | Búsqueda con IA | |
|---|---|---|
| Entrada | Una consulta corta de palabras clave | Una pregunta completa, a menudo con conversación previa |
| Consultas enviadas al índice | La que escribió el usuario | Una o más escritas por el modelo |
| Qué se clasifica | Páginas completas | Páginas y, después, pasajes dentro de ellas |
| Quién lee las páginas | El usuario | El modelo |
| Resultado | Una lista de enlaces con fragmentos | Una respuesta redactada con unas pocas citas |
| Repetibilidad | La misma consulta da una lista similar | La misma pregunta puede dar una respuesta distinta |
La fila de entrada influye en cómo pregunta la gente. En un chat, una pregunta de seguimiento como "¿cuál es más barato?" depende del turno anterior, así que el modelo tiene que trasladar el contexto a las consultas que escribe. Un buscador de palabras clave trata cada búsqueda como nueva.
Clasificar pasajes en lugar de páginas completas cambia qué compite. Una página puede posicionarse bien en su conjunto y aun así no aportar nada a una respuesta de IA si ninguno de sus párrafos responde directamente a la pregunta. Cómo elige la búsqueda con IA qué fuentes citar describe con más detalle el paso de puntuación de pasajes.
¿Por qué los resultados de la búsqueda con IA son menos estables?
Una página de resultados tradicional cambia despacio. Las posiciones se mueven cuando se actualizan las páginas, aparecen páginas nuevas o cambia el sistema de clasificación, así que dos personas que escriben la misma consulta el mismo día suelen ver casi la misma lista.
Las respuestas de IA varían por varias razones que se suman entre sí:
- El modelo elige sus palabras con cierto grado de aleatoriedad, así que la redacción y el orden de los elementos cambian entre ejecuciones.
- Las consultas que escribe el modelo pueden variar de una ejecución a otra, lo que trae un conjunto distinto de páginas.
- Los mensajes anteriores de la conversación cambian cómo se interpreta la pregunta.
- Algunos asistentes deciden en cada pregunta si buscan en la web o no, y cuando no lo hacen responden a partir de sus datos de entrenamiento.
Por eso no hay una posición fija que seguir como sí la hay en una lista ordenada. Una marca puede aparecer nombrada en una respuesta y faltar en la siguiente ante la misma pregunta. La medida útil es con qué frecuencia aparece una página o una marca a lo largo de muchas ejecuciones repetidas, y por eso una sola comprobación dice poco.
¿Qué se mantiene igual?
La búsqueda con IA sigue dependiendo de que la web se rastree e indexe. Cada producto de IA usa un índice de búsqueda, ya sea uno que construye por su cuenta o uno que licencia de un buscador. Si una página no está en ese índice, el modelo nunca la ve.
Las empresas de IA también tienen sus propios rastreadores. Los rastreadores de IA tienen user agents distintos para el entrenamiento, para la búsqueda en vivo y para obtener una página por la que preguntó un usuario, y el archivo robots.txt de un sitio puede permitir o bloquear cada uno. Una página bloqueada para el rastreador de búsqueda de un producto concreto no puede ser citada por ese producto, por muy bien escrita que esté.
¿Qué significa la diferencia para un sitio web?
El primer cambio está en cómo llega el tráfico. En la búsqueda tradicional, una visita se produce cuando alguien hace clic en un resultado. En la búsqueda con IA, la respuesta ya está en la pantalla, así que muchas preguntas terminan sin un clic, y las visitas que sí llegan desde los enlaces de las citas se cuentan como tráfico de referencia de IA.
El modelo también lee el contenido de otra manera. Como elige pasajes, un párrafo que responde a una pregunta en su primera frase es más fácil de seleccionar que uno que solo tiene sentido después de los tres párrafos anteriores. Las definiciones, las listas cortas y las tablas con valores reales son fáciles de trasladar a una respuesta.
La medición también cambia. El seguimiento de posiciones registra la posición de una página para una palabra clave. La visibilidad en IA registra con qué frecuencia las respuestas de IA mencionan o citan una marca en un conjunto fijo de preguntas y plataformas, ejecutadas de forma repetida a lo largo del tiempo, y también cuenta las menciones en páginas de terceros, como reseñas y comparativas, que el modelo leyó mientras escribía.