Líneas de investigación abiertas
Qué no sabemos todavía — con una referencia verificable por línea, al estado 2025–2026. Si buscás proyecto, cualquiera de estas tiene versiones a escala de una persona con una GPU.
El mapa general del campo está en Sharkey et al., Open Problems in Mechanistic Interpretability (2025, ~30 autores de todos los labs). Estas son las líneas que a mí me parecen más vivas:
1 · ¿Los SAEs sirven para algo, al final?
Los sparse autoencoders producen features hermosos — pero cuando se los compara contra baselines simples en tareas concretas (probing, detección de conceptos), la ventaja a veces desaparece. ¿Son la herramienta correcta o un desvío elegante? El campo está genuinamente dividido. Ref: Are Sparse Autoencoders Useful? (2025).
2 · Grafos de atribución: escala y fidelidad
Los attribution graphs explican hoy una fracción de los prompts, en modelos medianos. ¿Escalan a modelos frontera? ¿Y cómo verificamos que el grafo cuenta la historia verdadera y no una racionalización plausible? Refs: Biology of an LLM · el panorama comunitario de circuits.
3 · ¿El razonamiento en voz alta es el razonamiento real?
Los modelos "razonadores" escriben cadenas de pensamiento — pero hay evidencia de que el texto no siempre refleja el cómputo interno que produjo la respuesta. Monitorear el razonamiento real es quizás la aplicación de interp más importante para seguridad. Ref: Reasoning Models Don't Always Say What They Think (2025).
4 · Universalidad: ¿todos los modelos piensan parecido?
¿Los mismos features y estructuras aparecen en modelos con distinto entrenamiento, distinta empresa, distinta arquitectura? Cada caso de convergencia vuelve al hallazgo más interesante — y hace la interp más transferible. Ref: The Platonic Representation Hypothesis (2024).
5 · Interpretar los pesos, no (solo) las activaciones
Casi todo el campo estudia activaciones — el pensamiento en tránsito. Una línea nueva descompone directamente los parámetros: encontrar los mecanismos escritos en los pesos. Ref: Attribution-based Parameter Decomposition (2025).
6 · Steering aplicado a seguridad
Si los rasgos de comportamiento son direcciones, se pueden monitorear y controlar: detectar cuándo un modelo se desliza hacia la adulación o la manipulación, y corregirlo en el espacio de activaciones. Ref: Persona Vectors (2025).
7 · Benchmarks: que los métodos compitan en serio
El campo produce métodos más rápido que maneras de compararlos. Sin evaluación estandarizada, "mi método encuentra circuitos más lindos" no es ciencia. Ref: MIB: A Mechanistic Interpretability Benchmark (2025).
8 · Introspección: ¿el modelo sabe qué le pasa adentro?
Si le inyectás un concepto al residual stream, ¿el modelo puede reportar que se lo inyectaste? Los primeros experimentos dicen: a veces, de manera limitada pero real. Un puente fascinante entre interp y la pregunta de qué "sabe" un modelo sobre sí mismo. Ref: Emergent Introspective Awareness (Anthropic, 2025).
9 · La mía: estructura composicional del residual stream
¿El estado interno factoriza en piezas reutilizables — la cosa y la operación que se le aplica — que se pueden extraer, recombinar y reinsertar? Mi paper muestra que sí para recuperación factual (en 3 modelos, con controles), y la página de futuro del sitio del paper lista nueve direcciones concretas: del model editing quirúrgico al diagnóstico causal de errores en agentes. Conecta directo con las líneas 4 y 5 — y el siguiente paso mecanístico es usar circuit-tracer para encontrar qué cabezas y MLPs implementan la recombinación.
10 · La otra mía: importar la base en vez de buscarla
Las coordenadas del residual stream son un accidente del entrenamiento, y la superposición explica por qué mirarlas de a una casi nunca sirve. Buena parte del campo responde buscando la base correcta. Esta línea prueba lo contrario: importarla desde una simetría que la tarea ya tiene. Si renombrar las entidades de un prompt deja intacta la tarea abstracta, ¿el modelo implementa ese renombre como un operador lineal sobre su estado interno?
La teoría de representaciones aporta acá algo que casi ningún método de interpretabilidad tiene: un test de falsabilidad gratis. Toda representación de un grupo finito se descompone en irreps con multiplicidades enteras, y esas multiplicidades se recuperan solo de trazas. Si no dan enteras, la afirmación se cayó y no hay nada que discutir. Los bloques salen de los idempotentes centrales en vez de postularse a mano. El test que decide es causal: aplicar ρ(g) al stream en mitad del forward y ver si la respuesta pasa a ser g·respuesta.
Está en el repo, público y a medio hacer: el preregistro con los umbrales fijados antes de correr nada, el gate M0 que exige recuperar una representación plantada en activaciones sintéticas, y el cuaderno con el falso negativo que los diagnósticos agarraron a tiempo. Lo que todavía no hay son las mediciones principales, y la novedad frente a la literatura está sin verificar. Lo publico igual, en ese estado, porque el método es lo que se puede juzgar hoy.
Los avances en estas líneas — míos y ajenos — van a ir apareciendo en el blog.