Topologías del pensamiento: Obsidian en el espacio de embeddings
15.800 notas. 49.746 fragmentos. Cada fragmento, un vector de 256 dimensiones.7 Corrí UMAP sobre el conjunto completo, lo proyecté a tres dimensiones y dejé que el resultado girara despacio en pantalla. Mi segundo cerebro tenía una forma, y esa forma revelaba algo que las notas nunca me habían dicho: mi trabajo intelectual se agrupa alrededor de tres núcleos densos (Claude Code, sistemas de diseño, investigación en IA) unidos por puentes delgados de notas de intersección, rodeados de un halo disperso de señales huérfanas que no conectan con nada.
La forma de tu conocimiento te dice dónde piensas, dónde evitas pensar y dónde tus ideas tienen espacio para chocar entre sí. La misma arquitectura del contexto que estructura el comportamiento de un agente estructura también el conocimiento humano.
En resumen: Proyectar 15.800 notas de Obsidian en un espacio de embeddings de 256 dimensiones revela tres topologías del conocimiento —centralizada, descentralizada y distribuida—, cada una con fallas propias. Las notas puente entre grupos son las que generan las ideas más originales, y la investigación sobre transiciones de fase demuestra que una curaduría descuidada puede colapsar tu estructura de conocimiento al cruzar un umbral muy preciso.
TL;DR
Los espacios de embeddings le dan a una base de conocimiento una estructura espacial que revela su topología intelectual. Kat (@poetengineer__) demostró tres topologías para bóvedas de Obsidian: centralizada (una idea central que conecta todo), descentralizada (núcleos temáticos agrupados) y distribuida (aristas entre ideas etiquetadas según su relación semántica).1 Mi bóveda de 15.800 archivos, con 49.746 fragmentos, presenta una topología descentralizada con tres grupos dominantes. El trabajo de Pesce et al. sobre transiciones de fase en la poda de redes neuronales aporta un marco matemático para entender cuándo la simplificación (curaduría, archivado, filtrado) cruza un umbral que rompe el funcionamiento de la estructura de conocimiento.2 A continuación: qué capturan los embeddings, tres topologías del conocimiento con datos reales de la bóveda, cómo diagnosticar la tuya y un explorador interactivo construido a partir de mi bóveda real.
Qué capturan realmente los embeddings
Un embedding de texto convierte un pasaje en una lista de números. El artículo sobre el visualizador de tokenización explicó cómo el texto se convierte en tokens. Los embeddings van más lejos: los tokens se vuelven coordenadas en un espacio de muchas dimensiones donde la distancia equivale a significado.
Dos pasajes sobre “hooks de Claude Code para inyectar contexto” quedan cerca uno del otro en el espacio de embeddings. Un pasaje sobre “hooks de Claude Code” y otro sobre “navegación en SwiftUI para iOS” quedan lejos. La distancia no mide coincidencia de palabras clave: dos pasajes pueden no compartir ni una sola palabra y aun así caer cerca si hablan de los mismos conceptos, mientras que dos pasajes que comparten muchas palabras (“el sistema procesa los datos”) pueden caer muy lejos si el contexto que los rodea difiere.
Mi bóveda usa el modelo potion-base-8M de Model2Vec: 7,6 millones de parámetros que producen embeddings de 256 dimensiones.3 El modelo se destila a partir de un sentence transformer más grande (bge-base-en-v1.5) y alcanza cerca del 90 % del rendimiento de all-MiniLM-L6-v2 funcionando como modelo estático, órdenes de magnitud más rápido tanto en CPU como en GPU. Cada uno de los 49.746 fragmentos de mi bóveda se convierte en un punto dentro de un espacio de 256 dimensiones.
Es imposible visualizar 256 dimensiones de forma directa. Técnicas de reducción de dimensionalidad como UMAP proyectan la estructura de alta dimensión a 2D o 3D conservando los vecindarios locales.4 Los puntos que estaban cerca en 256 dimensiones siguen cerca en 3. La estructura global es aproximada, pero los grupos son reales.
Tres topologías del conocimiento
La exploración de Kat sobre los embeddings de notas de Obsidian identificó tres topologías del conocimiento bien diferenciadas.1 Cada una refleja una estructura intelectual distinta y cada una falla de una manera distinta.
Centralizada: una idea central que lo conecta todo
En una topología centralizada, la mayoría de las notas se conectan a través de un único tema dominante. El espacio de embeddings muestra un grupo denso en el centro con zarcillos delgados que se extienden hacia afuera. Alguien que escriba exclusivamente sobre React vería esta topología: React es el núcleo, y cada nota sobre pruebas, gestión de estado, despliegue y herramientas pasa por ahí.
Fortaleza: experiencia profunda en el dominio central. La búsqueda funciona bien porque casi todas las consultas caen en el mismo vecindario.
Punto de quiebre: fragilidad. Si el tema central pierde relevancia (un cambio de trayectoria profesional, una tecnología que se descontinúa), toda la estructura de conocimiento se queda sin principio organizador. Las notas que solo tienen sentido en relación con el centro quedan huérfanas.
Descentralizada: núcleos temáticos agrupados
En una topología descentralizada, las notas forman varios grupos distintos conectados por notas puente. Mi bóveda tiene esta topología, con tres núcleos dominantes:
| Grupo | Fragmentos | % del total | Temas clave |
|---|---|---|---|
| IA y ML | ~13.100 | 26 % | Claude Code, arquitectura de agentes, investigación en LLM |
| Diseño | ~7.200 | 14 % | sistemas de UI, tipografía, ciencia del color, diseño visual |
| Desarrollo | ~5.100 | 10 % | FastAPI, SwiftUI, ingeniería web, bases de datos |
| Bandeja de entrada (sin procesar) | ~13.700 | 28 % | señales en bruto, capturas sin clasificar |
El 22 % restante se reparte entre Inspiración, Productividad, Ciencia y categorías menores.
Fortaleza: resiliencia. Perder un grupo no destruye los demás. Las conexiones interdisciplinarias se forman en las fronteras entre grupos y ahí surgen las ideas más originales.
Punto de quiebre: fragmentación. Si las notas puente entre grupos son demasiado escasas, los grupos se convierten en silos intelectuales. Mi bóveda tiene un puente delgado entre Diseño y Claude Code (notas sobre diseñar interfaces de agentes, patrones de interfaz para prompts), pero casi ningún puente entre Diseño y Desarrollo puro (las notas de arquitectura de backend rara vez se conectan con el diseño visual). Ese hueco es un punto ciego: pienso en diseño y pienso en ingeniería de backend, pero rara vez pienso en ambos a la vez.
Distribuida: aristas etiquetadas por relación
En una topología distribuida, las conexiones entre notas llevan etiquetas semánticas que describen cómo se relacionan las ideas. La implementación de Kat usó un LLM para generar las etiquetas de las aristas entre notas vecinas.1 En lugar de una cercanía anónima, cada conexión tiene una descripción: “contradice”, “amplía”, “aporta evidencia a”, “aplica en otro dominio”.
Fortaleza: navegabilidad. Una topología distribuida responde no solo “¿qué se relaciona?”, sino “¿cómo se relaciona?”. Las etiquetas habilitan razonamientos de orden superior: encontrar notas que contradicen una tesis, no solo notas que la mencionan.
Punto de quiebre: costo. Generar etiquetas para cada par de conexiones escala de forma cuadrática. Para los 49.746 fragmentos de mi bóveda, etiquetar todas las aristas exigiría alrededor de 1.200 millones de llamadas al LLM. Las implementaciones prácticas etiquetan solo las aristas que superan cierto umbral de similitud.
Transiciones de fase: cuándo la simplificación rompe la estructura
Pesce, He y Caldarelli estudiaron las transiciones de fase en la poda de redes neuronales y encontraron un umbral abrupto: las redes muestran “una transición desde una fase cooperativa y funcional hacia una fase desordenada con rendimiento colapsado”.2 Por debajo del umbral, eliminar conexiones apenas afecta el funcionamiento. En el umbral, la función colapsa de golpe. La transición sigue leyes de escala compatibles con un comportamiento crítico de segundo orden: la misma matemática que describe el hielo derritiéndose.
El paralelo con la curaduría de conocimiento es directo. Mi pipeline de puntuación de señales6 redujo la bandeja de entrada de 14.771 notas a 5.886 aplicando un umbral de relevancia. La misma dinámica de contexto compuesto que hace que la memoria de un agente acumule valor se aplica aquí: el valor de cada nota depende de sus conexiones, no solo de su contenido. La reducción mejoró la calidad de búsqueda: menos resultados poco relevantes, grupos más compactos, recuperación más rápida. Pero ¿se perdió señal? ¿La simplificación cruzó un umbral de transición de fase?
La investigación sobre poda sugiere que la respuesta depende de la conectividad, no de la cantidad. Eliminar nodos aislados (notas sin vecinos semánticos) tiene un impacto insignificante en el funcionamiento de la red. Eliminar nodos puente (notas que conectan grupos de otro modo separados) puede colapsar la estructura aunque esas notas parezcan poco importantes vistas de a una.
Mi pipeline de triaje subió el umbral de relevancia de 0,30 a 0,40. La reducción del 60 % en el tamaño de la bandeja se midió por conteo. No medí el impacto sobre la topología. Una estrategia de curaduría consciente de las transiciones de fase haría lo siguiente:
- Identificar las notas puente antes de filtrar (notas con alta centralidad de intermediación en el grafo de similitud)
- Eximir las notas puente del filtro de relevancia, sin importar su puntuación individual
- Vigilar las métricas de conectividad entre grupos después de cada pasada de curaduría
- Alertar cuando un paso de curaduría reduzca la densidad de puentes entre grupos por debajo de un umbral
# Sketch: bridge note detection before curation
def identify_bridge_notes(embeddings, threshold=0.7):
"""Find notes that connect otherwise-separate clusters."""
from sklearn.neighbors import NearestNeighbors
nn = NearestNeighbors(n_neighbors=10, metric='cosine')
nn.fit(embeddings)
distances, indices = nn.kneighbors(embeddings)
# Bridge score: how many of a note's neighbors are from
# different clusters than the note itself
bridge_scores = []
for i, neighbors in enumerate(indices):
own_cluster = labels[i]
cross_cluster = sum(1 for n in neighbors if labels[n] != own_cluster)
bridge_scores.append(cross_cluster / len(neighbors))
return bridge_scores
Cómo diagnosticar tu topología del conocimiento
No necesitas 15.000 notas para analizar tu topología del conocimiento. Cualquier colección de más de 100 notas con embeddings revela una estructura. Si usas Obsidian como infraestructura de IA, ya tienes la materia prima: las diecisiete mil señales de mi bóveda empezaron como simples capturas diarias. Tres preguntas de diagnóstico:
1. ¿Cuántos grupos existen?
Corre k-means o DBSCAN sobre tus embeddings y cuenta los grupos distintos. Menos de 3 sugiere una topología centralizada. Entre 3 y 8, descentralizada. Más de 8 puede indicar una topología genuinamente distribuida o una curaduría insuficiente (muchos grupos significan muchos temas, lo que puede significar que no hay profundidad en ninguno).
2. ¿Qué tan densos son los puentes?
Para cada par de grupos, cuenta las notas que tienen vecinos cercanos en ambos. Una densidad de puentes por debajo del 2 % del tamaño del grupo más pequeño indica un posible silo. Mi puente entre Diseño y Desarrollo ronda el 1,4 %: por debajo del umbral, lo que confirma el punto ciego que ya había notado.
3. ¿Qué porcentaje está huérfano?
Una nota huérfana no tiene ningún vecino dentro de un umbral de similitud coseno (típicamente 0,7). Las notas huérfanas no son necesariamente malas: pueden representar ideas genuinamente nuevas. Pero una tasa de orfandad superior al 15 % sugiere capturas inconsistentes (notas que no encajan en tu dominio de conocimiento) o problemas con la calidad de los embeddings.
Tasa de orfandad de mi bóveda: alrededor del 8 %. La mayoría de las huérfanas son capturas en bruto de la bandeja de entrada que todavía no se han procesado como notas estructuradas. La tasa baja al 3 % si se excluye la bandeja, lo que indica que las notas procesadas se integran bien en la topología existente.
Qué revelan los grupos
La visualización de arriba usa 500 fragmentos tomados al azar de mi bóveda. Los grupos se corresponden con vecindarios intelectuales reales.
El núcleo de IA y ML (26 % de los fragmentos) es el grupo más denso. La arquitectura de Claude Code, los patrones de diseño de agentes, los artículos de investigación sobre LLM y las técnicas de ingeniería de prompts forman un vecindario compacto. La densidad refleja el volumen: leo y capturo más contenido de IA/ML que de cualquier otra categoría. La densidad también crea una ventaja en calidad de búsqueda: las consultas de este dominio devuelven resultados muy relevantes porque el espacio de embeddings está bien poblado.
El núcleo de Diseño (14 %) está a cierta distancia de IA y ML. Los sistemas tipográficos, la ciencia del color, los patrones de componentes de UI y las referencias de diseño visual forman su propio grupo. La separación es apropiada: el diseño y la ingeniería de IA usan vocabularios distintos, marcos de razonamiento distintos y criterios de evaluación distintos. Pero esa separación también implica que consultas como “cómo debería formatearse la salida de un agente para que un desarrollador la revise” caen en el hueco entre los dos grupos y devuelven resultados de un lado o del otro, casi nunca de la intersección.
El núcleo de Desarrollo (10 %) se solapa más con IA y ML que con Diseño. Los patrones de FastAPI, el diseño de bases de datos y la arquitectura de SwiftUI comparten vocabulario conceptual con las notas de ingeniería de IA (ambos hablan de código, arquitectura, pruebas). Ese solapamiento de vocabulario produce una zona mezclada donde viven las notas de DevOps para agentes e infraestructura para IA.
El halo de la bandeja de entrada (28 %) lo rodea todo. Capturas en bruto, señales sin clasificar y marcadores sin procesar forman una nube dispersa con conexiones débiles hacia los grupos establecidos. El pipeline de puntuación de señales que redujo la bandeja de 14.771 a 5.886 notas eliminó sobre todo de este halo: notas con poca similitud con cualquier grupo establecido.
El grupo de Inspiración (6 %) ocupa una posición entre Diseño y la bandeja de entrada. Referencias de tipografía cinética, estudios de motion design y capturas de arte visual forman un vecindario laxo. El grupo existe porque capturo inspiración visual con constancia, pero rara vez proceso esas capturas como notas estructuradas. Y revela un patrón: consumo inspiración visual en abundancia, pero produzco trabajo de diseño con cuentagotas. La brecha entre consumo y producción se ve en la topología como un grupo con mucha densidad de entrada (capturas) y pocas conexiones de salida (notas que construyen sobre esa inspiración).
Los puentes entre grupos son lo más interesante de todo. El puente más delgado une Diseño y Desarrollo: alrededor del 1,4 % de las notas del grupo más pequeño tienen vecinos cercanos en ambos. Compáralo con el puente entre IA y Desarrollo, del 8,3 %, que refleja cuánto de mi trabajo de desarrollo involucra infraestructura de IA. La densidad de los puentes predice dónde surge el trabajo original. Mi artículo sobre boids y agentes nació de una nota puente que conectaba la investigación sobre comportamiento emergente (grupo de IA y ML) con la implementación de algoritmos de bandada (grupo de Desarrollo). Sin ese puente, esos dos cuerpos de notas jamás habrían chocado.
La topología también moldea la calidad de la recuperación. El recuperador híbrido que impulsa la búsqueda de mi bóveda combina coincidencia de palabras clave BM25 con similitud vectorial, pero su eficacia depende de la estructura de grupos subyacente. Las consultas que caen en grupos densos devuelven resultados precisos; las que caen entre grupos necesitan el respaldo de BM25 para salvar la distancia.
Junto a la bóveda existe una segunda base de embeddings: la base de búsqueda del toolchain, con 4.518 fragmentos repartidos en 653 archivos.5 Su topología es radicalmente distinta: un único grupo denso (configuración de Claude Code) con pequeños grupos satélite para pruebas, hooks y skills. Esa topología de monocultivo funciona en un toolchain porque un toolchain tiene un solo propósito. En una bóveda de conocimiento, una topología de monocultivo sería una señal de alarma.
Cómo remodelar tu topología
La topología no está fijada de antemano. Hay cuatro acciones deliberadas que remodelan la estructura del conocimiento.
Escribe notas puente. Si dos grupos no tienen conexiones, escribe notas que enlacen conceptos de uno y otro de forma explícita. Mi puente entre Diseño e IA es delgado porque casi nunca escribo sobre diseñar interfaces de agentes. Una nota titulada “Patrones de UX para la salida de agentes” que cite tanto principios de diseño como investigación en arquitectura de agentes crearía un punto de puente.
Detecta huérfanas. Haz un barrido mensual de huérfanas y decide: integrar, archivar o borrar. Las notas huérfanas que representan ideas incipientes deberían conectarse con los grupos existentes mediante notas puente. Las que son referencias de una sola vez pueden archivarse.
Vigila después de cada curaduría. Antes y después de cualquier curaduría masiva (borrar, archivar, filtrar), mide la conectividad entre grupos. Si la densidad de puentes cae, la curaduría eliminó notas puente que había que preservar.
Lee en las fronteras. Las lecturas más valiosas no están más adentro de tu grupo más denso, sino en los bordes entre grupos. Un artículo que tienda un puente entre la ingeniería de IA y el diseño visual generará más conexiones originales que otro que profundice el ya denso grupo de IA.
Ideas clave
- Los espacios de embeddings le dan forma a una base de conocimiento. Esa forma revela la topología intelectual: dónde concentras la atención, dónde la evitas y dónde se conectan las ideas entre dominios.
- Cada una de las tres topologías falla de una manera distinta. La centralizada es frágil. La descentralizada se fragmenta si no hay notas puente. La distribuida es cara de mantener, pero es la más rica para navegar.
- Las transiciones de fase vuelven no lineal la curaduría. Eliminar notas por debajo del umbral apenas afecta la estructura. En el umbral, la función colapsa. Hay que identificar y proteger las notas puente antes de cualquier curaduría masiva.
- El halo de la bandeja de entrada es la frontera de la curaduría. Las capturas en bruto forman una nube dispersa alrededor de los grupos establecidos. La puntuación de señales filtra ese halo, pero es la topología la que revela si el filtrado preservó o destruyó los puentes.
- Lee en las fronteras. Las notas de mayor valor conectan grupos, no los profundizan. La detección de huérfanas y las métricas de densidad de puentes guían las prioridades de lectura.
Preguntas frecuentes
¿Qué son los embeddings de texto y cómo representan el conocimiento?
Los embeddings de texto convierten pasajes de texto en listas de números (vectores) dentro de un espacio de muchas dimensiones donde la distancia equivale al significado semántico. Dos pasajes sobre temas parecidos quedan cerca, compartan o no las mismas palabras. Un modelo de embeddings de 256 dimensiones como potion-base-8M convierte cada fragmento de texto en 256 coordenadas. Aplicado a una base de conocimiento completa, el conjunto de vectores forma una estructura espacial donde los grupos, los puentes y los huecos revelan la topología intelectual del contenido.
¿Cómo puedo visualizar el espacio de embeddings de mi bóveda de Obsidian?
Genera los embeddings de tus notas con un modelo de embeddings de oraciones (potion-base-8M de Model2Vec es rápido y gratuito) y después proyecta los vectores de alta dimensión a 2D o 3D con UMAP. Guarda los embeddings en una base de datos (SQLite con la extensión vec funciona muy bien), corre la proyección UMAP y visualízala con cualquier librería de gráficos 3D. La nube de puntos resultante revela la estructura de grupos de tu bóveda: regiones densas donde escribes con frecuencia, huecos dispersos entre temas y zonas puente donde se cruzan distintos dominios.
¿Qué es una transición de fase en la curaduría de conocimiento?
Una transición de fase en la curaduría de conocimiento es un umbral en el que eliminar notas hace que la estructura de conocimiento colapse de golpe en lugar de degradarse poco a poco. La investigación sobre poda de redes neuronales muestra que las redes mantienen su función mientras se eliminan conexiones, hasta que llegan a un umbral abrupto donde el rendimiento se desploma. La misma dinámica se aplica a las bases de conocimiento: eliminar notas aisladas y de bajo valor tiene un impacto mínimo, pero eliminar notas puente que conectan grupos puede fragmentar la topología aunque esas notas parezcan poco importantes vistas de a una. Una curaduría consciente de las transiciones de fase identifica y protege las notas puente antes de filtrar.
¿Cuántas notas necesito para un análisis de topología significativo?
Una estructura de grupos significativa emerge a partir de unas 100 notas con embeddings. Con menos de 100 puede que no se formen grupos distintos. Entre 100 y 500 notas se revela la topología básica (2 a 4 grupos). Entre 500 y 5.000 aparece una estructura con matices, con zonas puente y patrones de orfandad. Por encima de 5.000 notas la topología se estabiliza y las notas nuevas profundizan los grupos existentes más de lo que crean grupos nuevos. La métrica clave no es el total, sino la diversidad de grupos: ¿tus notas abarcan al menos tres áreas temáticas distintas?
¿En qué se diferencian los embeddings de Obsidian de un grafo de conocimiento?
Un grafo de conocimiento conecta notas mediante enlaces explícitos que creas a mano (backlinks, etiquetas, MOC). Los embeddings las conectan mediante una similitud semántica que el modelo descubre solo. Son complementarios: el grafo captura tu estructura intencional, mientras que los embeddings revelan una estructura latente que nunca creaste de forma explícita. Notas sin ningún backlink en común pueden quedar cerca en el espacio de embeddings porque hablan de conceptos relacionados con otro vocabulario. Usar ambos a la vez —el grafo para navegar, los embeddings para descubrir— produce un segundo cerebro que saca a la superficie conexiones que de otro modo se te escaparían.
¿Cuál es la mejor estrategia de recuperación para una bóveda grande de Obsidian?
La recuperación híbrida, que combina la búsqueda por palabras clave BM25 con la similitud vectorial, supera a cualquiera de los dos métodos por separado. BM25 captura las coincidencias exactas de terminología que los embeddings pueden pasar por alto, mientras que los embeddings capturan la similitud conceptual que la búsqueda por palabras clave no detecta. Reciprocal Rank Fusion (RRF) fusiona las dos listas de resultados. En bóvedas de más de 10.000 notas, agregar un paso de reordenamiento después de la recuperación inicial mejora todavía más la precisión. La topología de tu bóveda determina qué estrategia domina: los grupos densos favorecen la búsqueda vectorial; las regiones dispersas o con vocabulario muy específico favorecen BM25.
Referencias
-
Kat (@poetengineer__), “Exploring shapes of thoughts: extracted my Obsidian notes’ embeddings and arranged them as a 3D network using 3 different topologies”, publicado en X, febrero de 2026. Tres topologías: centralizada, descentralizada y distribuida con aristas etiquetadas por un LLM. ↩↩↩
-
Pesce, Diego, Yang-Hui He y Guido Caldarelli, “Phase Transitions in Neural Networks Pruning”, arXiv:2602.15224, febrero de 2026. arxiv.org. Transición abrupta de una fase cooperativa y funcional a una fase desordenada, con leyes de escala compatibles con un comportamiento crítico de segundo orden. ↩↩
-
MinishLab, “Model2Vec: Fast State-of-the-Art Static Embeddings”, 2024. github.com/MinishLab/model2vec. potion-base-8M: 7,6 M de parámetros, embeddings de 256 dimensiones, ~90 % del rendimiento de all-MiniLM-L6-v2. ↩
-
McInnes, Leland, John Healy y James Melville, “UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction”, arXiv:1802.03426, 2018. arxiv.org. Conserva la estructura global mejor que t-SNE y con mejor rendimiento de ejecución. ↩
-
Sistema de memoria semántica del autor. Búsqueda híbrida Model2Vec + sqlite-vec + FTS5 BM25 + RRF sobre 49.746 fragmentos. Módulos:
embedder.py,vector_index.py,chunker.py,retriever.pyen~/.claude/lib/memory/. ↩ -
Pipeline de puntuación de señales del autor. Redujo la bandeja de entrada de 14.771 a 5.886 notas (60 % menos) ajustando el umbral de relevancia. Documentado en El pipeline de puntuación de señales. ↩
-
Análisis de topología de la bóveda del autor. Muestra aleatoria de 500 puntos sobre 49.746 fragmentos, clasificación temática según la estructura de directorios de la bóveda, proyección PCA a 3D para la visualización interactiva. ↩