Episode Details

Back to Episodes
ATA 817 Creando tu cerebro digital, busqueda con IA local

ATA 817 Creando tu cerebro digital, busqueda con IA local

Season 8 Episode 817 Published 2 weeks, 4 days ago
Description

¿Sabías que puedes convertir cualquier texto en coordenadas de 1024 dimensiones y hacer búsquedas inteligentes, clasificación automática o detección de duplicados sin depender de servicios en la nube? En este episodio te enseño a utilizar los embeddings con Ollama para potenciar tus documentos, correos y apuntes desde tu propio equipo Linux.

Los embeddings son una de las tecnologías más fascinantes de la inteligencia artificial actual. Básicamente, convierten palabras, frases o párrafos enteros en vectores numéricos que capturan su significado. Esto permite que un ordenador entienda que "gato" está más cerca de "felino" que de "nevera", y mucho más: desde búsqueda semántica hasta clasificación sin entrenamiento, pasando por deduplicación de documentos y sistemas de recomendación.

Lo mejor de todo es que no necesitas una GPU potente ni una cuenta en ningún servicio externo. Con Ollama ejecutándose en local y el modelo BGE-M3 (multilenguaje, con soporte para español), puedes generar embeddings desde la terminal con una simple llamada curl o con unas pocas líneas de Python. Y si necesitas escalar, ChromaDB te ofrece una base de datos vectorial completa con persistencia en disco y filtros por metadatos.

Capítulos del episodio:
0:00 - Introducción y concepto de embeddings
2:42 - ¿Qué son los embeddings exactamente?
5:13 - Modelos de embeddings: BGE-M3, all-MiniLM-L6-v2
7:25 - Cómo generar embeddings con Ollama y curl
8:01 - Búsqueda semántica: más allá de grep
11:57 - Búsqueda semántica con Python y NumPy
14:29 - Bases de datos vectoriales para escalar
14:53 - Clasificación sin entrenar el modelo
18:20 - Clasificación de sentimientos y categorías
20:02 - Deduplicación de documentos con embeddings
24:50 - Sistema de recomendaciones con similitud semántica
27:15 - ChromaDB: base de datos vectorial persistente
29:02 - Casos de uso y próximos episodios sobre RAG

Más información y enlaces en las notas del episodio

Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us