Saltar a contenido

Recursos para aprender

Curados a mano y con cada link verificado. Menos es más: esta no es una lista de todo lo que existe, sino de lo que efectivamente conviene usar, en orden.

Los niveles: inicial no pide matemática ni código; medio pide comodidad con Python y ganas; avanzado son los papers fundacionales y las herramientas de investigación.

El camino corto (si no sabés por dónde empezar)

  1. Hacé el curso de este sitio (una tarde).
  2. Mirá los capítulos de redes neuronales y GPT de 3Blue1Brown (abajo).
  3. Leé el Getting Started de Neel Nanda y hacé el capítulo 1 de ARENA.
  4. Elegí un problema chico de los 200 Open Problems o de mis líneas, y hacé.

Para arrancar (sin matemática)

Fundamentos del campo

Cursos y programas

  • ARENA medio — El curriculum práctico de referencia (transformers desde cero → interp → RL). Los materiales de auto-estudio viven en learn.arena.education; el capítulo 1 es interpretabilidad de transformers.
  • BlueDot Impact inicial — Cursos de AI safety (el ex "AI Safety Fundamentals") con cohortes facilitadas; buen marco general donde la interp es una pieza.
  • MATS avanzado — El fellowship de investigación con mentores del campo (Neel Nanda entre ellos); el camino serio de "quiero dedicarme a esto".

Surveys (para tener el mapa)

Herramientas

  • TransformerLens medio — LA librería para experimentos de interp en modelos chicos/medianos; docs. Con esto se hizo mi paper (bueno — con hooks de PyTorch al estilo de esto).
  • nnsight medio — Intervenciones sobre modelos locales o remotos (NDIF); tutoriales interactivos excelentes.
  • Neuronpedia inicial — El atlas navegable de features: buscá, mirá activaciones, hacé steering desde el navegador. Docs y API. La demo de Gemma Scope es el mejor "tocar features" que existe.
  • SAELens avanzado — Entrenar y analizar sparse autoencoders; docs.
  • circuit-tracer avanzado — Grafos de atribución open source (anuncio); grafos navegables en Neuronpedia.

Comunidades

  • AI Alignment Forum / LessWrong — Donde el campo publica y discute entre papers; el tag de interpretabilidad concentra todo.
  • Open Source Mechanistic Interpretability Slack — La comunidad de trabajo activa del área; el link de invitación rota, pero se mantiene actualizado en el README de SAELens.
  • BAISH — Buenos Aires AI Safety Hub 🇦🇷 — Comunidad de AI safety en Buenos Aires (UBA/Exactas): reading groups en español, cursos técnicos, becas. Si estás en Argentina, empezá por acá.

En español

La razón de ser de este sitio: material de interpretabilidad mecanicista en español casi no existe. Lo que hay:


¿Falta algo que debería estar? Escribime — el criterio es calidad sobre cantidad, pero la lista está viva.