50 ML Projects To Understand LLMs
50 ML Projects To Understand LLMs
Livro de Mike X Cohen, PhD, publicado pela Packt, que propõe 50 projetos práticos para investigar os mecanismos internos de transformers através de análise de dados, visualização e experimentação. Em vez de tratar modelos como caixas-pretas, o autor combina conceitos de Machine Learning, mecanismos internos dos LLMs e programação em Python.
Temas abordados no livro
- Tokenização e suas propriedades estatísticas
- Espaços de embeddings, similaridade semântica e vetores de analogia
- Logits, softmax, perplexidade e vieses linguísticos
- Dinâmica das camadas de transformers
- Mecanismos de atenção (QKV, attention scores, head ablation e activation patching)
- MLPs internos, análise de neurônios e manipulações causais
- Logit Lens, causal tracing e interpretação de comportamentos emergentes
Interpretabilidade de LLMs
Mechanistic Interpretability - LessWrong
Visão geral sobre interpretabilidade mecanicista, campo que estuda como redes neurais processam informações internamente.
Análise de Transformers
The Transformer Architecture and Attention Mechanism - Lilian Weng
Artigo que detalha a arquitetura transformer e mecanismos de atenção, fundamentais para compreender como transformers funcionam internamente.
Visualização de Embeddings
Embedding Projector - TensorFlow
Ferramenta interativa para visualizar e explorar espaços de embeddings, útil para entender representações semânticas em LLMs.
Ferramentas para análise de interpretabilidade
TransformerLens - GitHub
Biblioteca Python para investigar internals de transformers, permitindo análise granular de camadas, atenção e ativações neuronais.
LIME - GitHub
Técnica e ferramenta para explicar predições de qualquer classificador ou regressor, aplicável também para análise de comportamentos de LLMs.
Recursos sobre causal tracing
Causal Tracing: Identifying Neurons That Cause Specific Behaviors - Rome Baulab
Pesquisa sobre como traçar causalidade em redes neurais, técnica essencial para entender quais neurônios são responsáveis por comportamentos específicos.
Cursos e tutoriais
Neural Network Interpretability with JAX - Google
Documentação e exemplos de como usar JAX para análise de redes neurais com foco em interpretabilidade.
Comunidade e pesquisa
Alignment Research Center - ARC
Organização de pesquisa focada em interpretabilidade e alinhamento de modelos de IA, com diversos artigos sobre mecanismos internos.