Saltar a contenido

Las operaciones relacionales se factorizan de sus operandos en LLMs

¿Cómo representa un modelo de lenguaje "la capital de Italia"? Encontramos que divide el pensamiento en dos: la cosa (Italia) y la operación que se le aplica (capital-de) — y la operación vive como su propia dirección — una flecha en el espacio de estados internos del modelo — que se puede agarrar, mover y trasplantar.

El hallazgo, conceptualmente

El latín marca el rol de un sustantivo con una desinencia — ros-a / ros-am, misma raíz, distinta función. A mitad de la red, un LLM hace algo estructuralmente similar con las relaciones factuales. Mientras "The currency of Italy is" fluye por el modelo, el estado interno de la oración se describe bien como una suma:

estado ≈ μ + operando(Italia) + operador(moneda-de) + interacción pequeña

Tres cosas hacen que esto sea más que un ajuste de curvas:

  1. El operador es causal. Sumá la diferencia de direcciones v(capital) − v(moneda) al residual stream y el modelo deja de decir euro y dice Roma — para todos los pares ordenados de relaciones que probamos. Una dirección aleatoria del mismo tamaño no hace nada.
  2. Transfiere. Construido con la mitad de los países, flipea la otra mitad. Construido con una redacción, flipea paráfrasis que nunca vio. Construida la receta en Qwen, funciona igual en Gemma.
  3. La operación no es su palabra de salida. Idioma-de y gentilicio-de terminan ambas en "Italian" — y sin embargo son direcciones distintas, y un marcador construido exactamente donde las dos comparten la palabra sigue instalando la relación. El modelo separa el rol gramatical de la forma superficial, como la declinación separa el caso de la desinencia (sincretismo).

Y el límite es igual de informativo: corré el mismo pipeline sobre aritmética (+, ×, −) o lógica de comparación, y el operador queda entrelazado con sus operandos y se niega a transferir — consistente con "la aritmética como bolsa de heurísticas", y evidencia de que la factorización limpia es una propiedad de la recuperación relacional, no del prompting en general.

La declinación: los mismos 60 estados del workspace, organizados por operando en el token del país, se reorganizan por operador en el token de consulta

Los números

20/20 × 3swaps ordenados de operador cambian el margen de respuesta en Qwen3-1.7B, Qwen3-8B y Gemma-2-9B; nulos de etiquetas permutadas ≈ 0
52% ≈ 53%un estado ensamblado de μ + operando + operador hace que el modelo produzca la respuesta a su propio techo (8B: 62% vs 68%)
80%incluso con sobredosis 4× — donde la generación fluida colapsa — el target gana la elección forzada: la dosis destruye fluidez, no información

Todos los efectos principales llevan IC bootstrap 95% a nivel de operador y ninguno cruza cero — ver Evidencia y controles: cada claim junto al control que podía matarlo.

Nota metodológica — el null honesto que originó esto

Este proyecto empezó como réplica del claim de legibilidad del J-space / global workspace (Gurnee, Sofroniew, Lindsey et al., 2026). Bajo controles apareados (incluida una proyección aleatoria de espectro igualado), el readout del J-lens no superó al logit lens en ninguna métrica. La estructura de arriba es organización causal, no un subespacio privilegiadamente legible — la mitad negativa está documentada con el mismo rigor en el archivo y la bitácora.


Reproducibilidad. Todo corre en una sola APU AMD Strix Halo (sin CUDA). Semillas, checkpoints exactos (Qwen/Qwen3-1.7B, Qwen/Qwen3-8B, google/gemma-2-9b), artefactos long-form por operando y el generador de cada figura están en el repo — ver Cómo reproducir. Licencia MIT · Matias Podeley · mpodeley@gmail.com · Cómo citar