Embeddings de texto y búsqueda semántica
Convertir frases en vectores y buscar los más cercanos por significado
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ SIGNIFICA ESTA CAPACIDAD
Encodes a piece of text into a fixed-length vector so that semantically similar texts sit close together, then retrieves related items by nearest-neighbour lookup. Output is a ranked result list (item ids and scores), not prose. Unlike question answering it only finds possibly relevant material; it does not compose the answer.
Cómo se consigue técnicamente
The mainstream design is a two-tower model: queries and documents are compressed by encoders, and training pushes true pairs above random negatives, typically with contrastive learning and large batches. At query time all document vectors are pre-computed into an index and an approximate nearest-neighbour search returns the top-k in milliseconds. Sparse and dense representations are often mixed to combine keyword hits with semantic recall.
Productos representativos
6Pinecone
2019Base de datos vectorial gestionada para búsqueda por similitud
Hugging Face Hub
2016El punto de encuentro de modelos y datos abiertos
Transformers
2018Una API para cargar y entrenar modelos preentrenados
Together API
2022Una API de inferencia para modelos abiertos
Replicate
2019Ejecuta modelos de la comunidad mediante una API
Perplexity
2022Responde mientras busca, con fuentes en cada respuesta
Organizaciones relacionadas
Usos típicos
- Search over enterprise documents and code
- The recall stage of RAG pipelines
- Deduplication, clustering and topic discovery
- Recommendation and similar-content entry points
Cómo se evalúa
- Recall@k
- Whether the top-k contain all relevant documents
- nDCG
- Discounted cumulative gain that accounts for rank position
- MRR
- Mean reciprocal rank of the first relevant result
Límites y dificultades
- Semantic similarity is not relevance: near neighbours may merely share wording
- Cross-domain or cross-lingual use degrades noticeably without adaptation
- Chunking long documents severs context, and answers at chunk boundaries are easily missed
Conceptos detrás
Embeddings de palabras
Convertir palabras en coordenadas: los sinónimos se agrupan solos y el significado pasa a ser algo que se puede sumar y restar
Vectores y espacios vectoriales
La IA convierte todo —palabras, imágenes, sonidos, usuarios— en una lista de números
Generación aumentada por recuperación
En lugar de meter el conocimiento en los parámetros, dejarlo fuera y consultarlo cuando haga falta: como un examen a libro abierto