Búsqueda semántica frente a búsqueda por palabras clave

La búsqueda por palabras clave compara letras: encuentra lo que contiene los términos de la consulta. La búsqueda semántica compara significados: encuentra lo que quiere decir lo mismo, aunque use otras palabras. Ninguna gana siempre, y por eso los buscadores actuales combinan las dos en lo que se llama búsqueda híbrida.

Por Joan Martorell

¿En qué se diferencian?

Palabras claveSemántica
Qué comparaLos términos de la consulta con los del texto.El significado de la consulta con el de cada texto.
Cómo lo haceUn índice de palabras y una fórmula de relevancia.Vectores de significado (embeddings) y distancia entre ellos.
Acierta conCódigos, referencias, nombres propios, frases exactas.Sinónimos, descripciones de una necesidad, lenguaje natural.
Falla conSinónimos e intención. Sin tolerancia añadida, también erratas.Códigos y cadenas sin significado. Puede devolver algo «parecido» que no es lo pedido.
Qué necesitaSolo los textos.Un modelo de embeddings y calcular un vector por elemento y por consulta.
Por qué devuelve algoFácil de explicar: contiene la palabra.Menos evidente: está cerca en significado.

¿Cuándo gana la búsqueda por palabras clave?

  • Cuando el usuario conoce el identificador exacto: una referencia, un código de producto, un número de pedido.
  • Con nombres propios y marcas poco comunes, que un modelo de lenguaje puede no conocer.
  • Cuando necesitas una coincidencia literal garantizada, por ejemplo en textos legales.

¿Cuándo gana la búsqueda semántica?

  • Con sinónimos: «maceta» y «tiesto», «portátil» y «ordenador».
  • Cuando la consulta describe una intención y no un objeto: «algo para colgar un cuadro».
  • Con preguntas en lenguaje natural, como las de un centro de ayuda.
  • Cuando el catálogo usa un vocabulario técnico y los usuarios, uno coloquial.

¿Qué es la búsqueda híbrida?

Es ejecutar las dos a la vez y combinar sus resultados. Así una errata la resuelve la coincidencia de texto, un sinónimo lo resuelve la coincidencia semántica y el usuario no tiene que saber cuál de las dos ha actuado.

XEYE funciona así en cada consulta. Calcula una puntuación de texto con coincidencia difusa, que tolera erratas y palabras parciales, y una puntuación semántica, y devuelve una puntuación combinada por resultado. Si lo pides con include_score_breakdown, la respuesta incluye las dos por separado.

¿Qué dicen los datos?

Medimos XEYE con consultas etiquetadas por tipo sobre tres catálogos en español. Esta es la fracción de consultas en las que el elemento esperado salió en primera posición:

Tipo de consulta10 productos250 actividades4.727 códigos
Sinónimo0,890,930,43
Intención1,000,770,50
Errata1,000,750,67
Atributo0,890,780,50
Top-1 con el modelo por defecto. Metodología y límites en la página de resultados.

Dos lecturas. En el catálogo de productos, las consultas por sinónimo e intención, que un buscador por palabras clave no puede resolver, aciertan en el 89 % y el 100 % de los casos, y en el de actividades el sinónimo es la categoría más fuerte. Y en el catálogo grande y denso, la categoría más fuerte es la errata, la única que la coincidencia de texto puede resolver sola. Las dos señales se complementan. Los datos completos están en resultados medidos.

¿Cuál elijo?

  • Solo palabras clave si tus usuarios buscan casi siempre por código o nombre exacto.
  • Híbrida en casi todos los demás casos: catálogos de productos, centros de ayuda, directorios.
  • Solo semántica rara vez compensa: pierdes la tolerancia a erratas y la precisión con códigos.

Si quieres probar la búsqueda híbrida sin montar nada, una API de búsqueda semántica te la da hecha.

Preguntas frecuentes

¿La búsqueda semántica entiende las erratas?

No de forma fiable. Una errata puede cambiar mucho el vector de una palabra corta. Por eso la búsqueda híbrida añade coincidencia difusa de texto, que sí está pensada para erratas.

¿La búsqueda semántica es más lenta?

Añade un paso: convertir la consulta en un vector. En nuestras mediciones, la búsqueda híbrida completa tarda de media entre 28 y 55 milisegundos en el servidor con el modelo por defecto.

¿Necesito muchos datos para que funcione?

No. Los modelos ya vienen entrenados con texto general. Funciona con un catálogo de diez elementos.

¿Qué es la coincidencia difusa?

Una comparación de texto que mide cuánto se parecen dos cadenas en lugar de exigir que sean iguales. Por eso «zapatilas runing» encuentra «zapatillas de running».

Pruébalo con tus propios datos

Crea una cuenta, sube una lista y haz tu primera búsqueda en unos cinco minutos. Empiezas con 5 € de crédito, sin tarjeta.

Sigue leyendo