Recursos para aprender
Curados a mano y con cada link verificado. Menos es más: esta no es una lista de todo lo que existe, sino de lo que efectivamente conviene usar, en orden.
Los niveles: inicial no pide matemática ni código; medio pide comodidad con Python y ganas; avanzado son los papers fundacionales y las herramientas de investigación.
El camino corto (si no sabés por dónde empezar)
- Hacé el curso de este sitio (una tarde).
- Mirá los capítulos de redes neuronales y GPT de 3Blue1Brown (abajo).
- Leé el Getting Started de Neel Nanda y hacé el capítulo 1 de ARENA.
- Elegí un problema chico de los 200 Open Problems o de mis líneas, y hacé.
Para arrancar (sin matemática)
- 3Blue1Brown — serie de redes neuronales inicial — Las mejores visualizaciones que existen; los capítulos 5–8 cubren GPT, atención y transformers. Los primeros capítulos están doblados al español en el canal oficial; los de transformers, en inglés con subtítulos.
- Welch Labs — "The moment we stopped understanding AI" inicial — 30 minutos que te hacen sentir por qué la interpretabilidad importa. El canal entero vale.
- Anthropic — Tracing the thoughts of a large language model inicial — El explicador sin matemática del "microscopio" de Anthropic; acompaña al paper más importante de 2025.
- Golden Gate Claude inicial — El experimento de steering más contable en un asado.
- Anthropic (video) — Interpretability: understanding how AI models think inicial — El equipo de interp de Anthropic conversando, sin filtro técnico.
Fundamentos del campo
- Neel Nanda — Getting Started in Mechanistic Interpretability medio — LA ruta de entrada opinionada, del referente pedagógico del campo. Complementos: su glosario comprehensivo (el diccionario de facto) y su canal de YouTube con walkthroughs de papers.
- 200 Concrete Open Problems in Mechanistic Interpretability medio — Del 2022 y algo datada, pero sigue siendo el mejor generador de primeros proyectos.
- Distill — el hilo Circuits medio — Donde nació la agenda del campo, empezando por Zoom In. Prosa e ilustraciones ejemplares.
- A Mathematical Framework for Transformer Circuits avanzado — El paper que formalizó el residual stream; denso y fundacional.
- In-context Learning and Induction Heads avanzado — El circuito estrella (lo contamos acá).
- Toy Models of Superposition avanzado — Por qué las neuronas son polisemánticas; la base conceptual de los SAEs.
- Towards Monosemanticity y Scaling Monosemanticity avanzado — Los papers de los SAEs y del Golden Gate.
- On the Biology of a Large Language Model avanzado — El insignia de 2025: grafos de atribución sobre un modelo de producción. Los métodos, aparte.
Cursos y programas
- ARENA medio — El curriculum práctico de referencia (transformers desde cero → interp → RL). Los materiales de auto-estudio viven en learn.arena.education; el capítulo 1 es interpretabilidad de transformers.
- BlueDot Impact inicial — Cursos de AI safety (el ex "AI Safety Fundamentals") con cohortes facilitadas; buen marco general donde la interp es una pieza.
- MATS avanzado — El fellowship de investigación con mentores del campo (Neel Nanda entre ellos); el camino serio de "quiero dedicarme a esto".
Surveys (para tener el mapa)
- Ferrando et al. — A Primer on the Inner Workings of Transformer-based Language Models medio — El survey técnico de entrada; primer autor hispanohablante (UPC Barcelona).
- Sharkey et al. — Open Problems in Mechanistic Interpretability medio — ~30 autores de todo el campo; el mejor mapa del estado del arte y de lo que falta.
- Bereska & Gavves — Mechanistic Interpretability for AI Safety medio — El survey con el ángulo de seguridad.
Herramientas
- TransformerLens medio — LA librería para experimentos de interp en modelos chicos/medianos; docs. Con esto se hizo mi paper (bueno — con hooks de PyTorch al estilo de esto).
- nnsight medio — Intervenciones sobre modelos locales o remotos (NDIF); tutoriales interactivos excelentes.
- Neuronpedia inicial — El atlas navegable de features: buscá, mirá activaciones, hacé steering desde el navegador. Docs y API. La demo de Gemma Scope es el mejor "tocar features" que existe.
- SAELens avanzado — Entrenar y analizar sparse autoencoders; docs.
- circuit-tracer avanzado — Grafos de atribución open source (anuncio); grafos navegables en Neuronpedia.
Comunidades
- AI Alignment Forum / LessWrong — Donde el campo publica y discute entre papers; el tag de interpretabilidad concentra todo.
- Open Source Mechanistic Interpretability Slack — La comunidad de trabajo activa del área; el link de invitación rota, pero se mantiene actualizado en el README de SAELens.
- BAISH — Buenos Aires AI Safety Hub 🇦🇷 — Comunidad de AI safety en Buenos Aires (UBA/Exactas): reading groups en español, cursos técnicos, becas. Si estás en Argentina, empezá por acá.
En español
La razón de ser de este sitio: material de interpretabilidad mecanicista en español casi no existe. Lo que hay:
- MIT Technology Review en español — "Interpretabilidad mecanicista" inicial — Definición divulgativa seria del término.
- Xataka — la cobertura del trabajo de Anthropic inicial — Lectura "de diario" sobre el microscopio.
- DotCSV inicial — El mayor divulgador de IA en español; cubre las noticias del área (aunque no tiene, que sepamos, un video dedicado a interp mecanicista — todavía).
- 3Blue1Brown Español inicial — El doblaje oficial de la serie de redes neuronales.
- Y este sitio: el curso y el blog, que es donde voy a ir agregando material nuevo en español.
¿Falta algo que debería estar? Escribime — el criterio es calidad sobre cantidad, pero la lista está viva.