Saltar a contenido

El pensamiento está hecho de piezas

Desarmamos el pensamiento de un modelo de lenguaje — "la capital de Italia" — en tres ingredientes promediados, lo volvimos a armar, escribimos el estado ensamblado en un solo punto adentro del modelo… y dijo "Rome". Cambiá la pieza de Italia por la de Francia y dice "Paris". Empujá la misma perilla 4× de más y balbucea — pero todavía sabe la respuesta.

Un pensamiento ensamblado desde tres partes promediadas vuela por el mapa de pensamientos del modelo, aterriza al lado del estado real medido — y la consola tipea la salida real del modelo: "Rome, and the currency of the United"

Los números

52% ≈ 53%un pensamiento ensamblado desde partes promediadas hace que el modelo diga la respuesta a su propio techo de precisión (8B: 62% vs 68%)
20/20 × 3cada swap ordenado de relación cambia el margen de respuesta en Qwen3-1.7B, Qwen3-8B y Gemma-2-9B; nulos de etiquetas permutadas ≈ 0
80%incluso con sobredosis 4× — donde el habla fluida colapsa en loops — la respuesta correcta gana la elección forzada
3 × 2tres modelos, dos dominios (geografía, taxonomía animal) donde funciona — y dos (aritmética, lógica) donde probadamente no

El null honesto con el que empezó todo

Este proyecto nació como réplica de un claim de "subespacio legible" — que no replicó bajo controles pareados. La estructura que se reporta acá es organización causal, validada contra nulos que conservan toda la estadística del método destruyendo su significado. Cada claim está junto al control que podría haberlo matado en Evidencia y controles.


Paper: Operator–Operand Factorization in LLM Residual Streams: Causal Influence and Compositional SufficiencyPDF · abstract y BibTeX · código y reproducibilidad · qué sigue

Matias Podeley · investigador independiente · mpodeley@gmail.com · licencia MIT · aprendé el campo en español: Interpretabilidad Mecanicista